سازمان پژوهشی هوش مصنوعی، EleutherAI، به تازگی مجموعهای گسترده از متون با مجوز و منابع عمومی را تحت عنوان Common Pile v0.1 معرفی کرده است که به عنوان یکی از بزرگترین پایگاههای داده برای آموزش مدلهای هوش مصنوعی به شمار میرود. این مجموعه که در طول دو سال با همکاری استارتاپهایی مانند Poolside و Hugging Face و چندین مؤسسه آموزشی ایجاد شده، به اندازه ۸ ترابایت حجم دارد و به منظور تربیت دو مدل تازه به نامهای Comma v0.1-1T و Comma v0.1-2T به کار رفته است.
طبق گزارش ایتنا و به نقل از تککرانچ، EleutherAI اعلام کرده است که این مدلها عملکرد مشابهی با مدلهایی دارند که با دادههای تحت حقوق نشر و بدون مجوز آموزش دیدهاند.
در حالی که شرکتهای فعال در حوزه هوش مصنوعی، از جمله OpenAI، با مسائل حقوقی در خصوص استفاده از دادههای دارای حق نشر برای آموزش مدلهای خود مواجه هستند، EleutherAI بر این باور است که این دعاوی به کاهش اظهارنظرهای شفاف در صنعت هوش مصنوعی و آسیب به تحقیقات منجر شده است. استلا بیدرمن، مدیر اجرایی EleutherAI، در یک نوشته در بلاگ Hugging Face اشاره کرده که این شکایات «تغییرات اساسی در روشهای گردآوری دادهها ایجاد نکرده، اما شفافیت شرکتها را به طور چشمگیری کاهش داده است.»
مجموعه Common Pile v0.1 که تحت مشاوره حقوقی تهیه شده، شامل منابعی مانند ۳۰۰ هزار کتاب عمومی دیجیتال شده توسط کتابخانه کنگره ایالات متحده و آرشیو اینترنت بوده و همچنین از مدل متنخوان Whisper متعلق به OpenAI برای فراخوانی محتوای صوتی به متن استفاده کرده است.
EleutherAI بر این باور است که مدلهای Comma که به طور اختصاصی بر روی بخشی از این مجموعه گسترده آموزش دیدهاند، قادر به رقابت با مدلهای پیشرفتهای همچون نخستین مدل Llama متا هستند و در حوزههایی از قبیل برنامهنویسی، درک تصویر و ریاضیات عملکرد محسوسی از خود نشان دادهاند. بیدرمن در نوشته خود بیان کرده است: «این تصور که تنها متنهای فاقد مجوز قادر به بهبود عملکرد مدلها هستند نادرست است و با افزایش تعداد دادههای مجاز و عمومی، کیفیت مدلهای آموزش دیده روی این دادهها به تناسب افزایش پیدا خواهد کرد.»
این اقدام EleutherAI در راستای تلاشهای این سازمان برای جبران اشتباهات پیشین صورت گرفته است؛ پیشتر این سازمان مجموعه دادهای به نام The Pile را منتشر کرده بود که شامل محتوای دارای حق نشر بود و انتقادات و فشارهای حقوقی را به دنبال داشت. EleutherAI به دنبال ادامه مسیر خود در انتشار مجموعه دادههای باز و بهبود روشهای شفافسازی و پیشرفت هوش مصنوعی است.