EleutherAI مجموعه بزرگی از داده‌های آموزشی هوش مصنوعی را با متون عمومی و مجاز به انتشار در دسترس قرار داد!

سازمان پژوهشی هوش مصنوعی، EleutherAI، به تازگی مجموعه‌ای گسترده از متون با مجوز و منابع عمومی را تحت عنوان Common Pile v0.1 معرفی کرده است که به عنوان یکی از بزرگ‌ترین پایگاه‌های داده برای آموزش مدل‌های هوش مصنوعی به شمار می‌رود. این مجموعه که در طول دو سال با همکاری استارتاپ‌هایی مانند Poolside و Hugging Face و چندین مؤسسه آموزشی ایجاد شده، به اندازه ۸ ترابایت حجم دارد و به منظور تربیت دو مدل تازه به نام‌های Comma v0.1-1T و Comma v0.1-2T به کار رفته است.

طبق گزارش ایتنا و به نقل از تک‌کرانچ، EleutherAI اعلام کرده است که این مدل‌ها عملکرد مشابهی با مدل‌هایی دارند که با داده‌های تحت حقوق نشر و بدون مجوز آموزش دیده‌اند.


در حالی که شرکت‌های فعال در حوزه هوش مصنوعی، از جمله OpenAI، با مسائل حقوقی در خصوص استفاده از داده‌های دارای حق نشر برای آموزش مدل‌های خود مواجه هستند، EleutherAI بر این باور است که این دعاوی به کاهش اظهارنظرهای شفاف در صنعت هوش مصنوعی و آسیب به تحقیقات منجر شده است. استلا بیدرمن، مدیر اجرایی EleutherAI، در یک نوشته در بلاگ Hugging Face اشاره کرده که این شکایات «تغییرات اساسی در روش‌های گردآوری داده‌ها ایجاد نکرده، اما شفافیت شرکت‌ها را به طور چشمگیری کاهش داده است.»

مجموعه Common Pile v0.1 که تحت مشاوره حقوقی تهیه شده، شامل منابعی مانند ۳۰۰ هزار کتاب عمومی دیجیتال شده توسط کتابخانه کنگره ایالات متحده و آرشیو اینترنت بوده و همچنین از مدل متن‌خوان Whisper متعلق به OpenAI برای فراخوانی محتوای صوتی به متن استفاده کرده است.

 



EleutherAI بر این باور است که مدل‌های Comma که به طور اختصاصی بر روی بخشی از این مجموعه گسترده آموزش دیده‌اند، قادر به رقابت با مدل‌های پیشرفته‌ای همچون نخستین مدل Llama متا هستند و در حوزه‌هایی از قبیل برنامه‌نویسی، درک تصویر و ریاضیات عملکرد محسوسی از خود نشان داده‌اند. بیدرمن در نوشته خود بیان کرده است: «این تصور که تنها متن‌های فاقد مجوز قادر به بهبود عملکرد مدل‌ها هستند نادرست است و با افزایش تعداد داده‌های مجاز و عمومی، کیفیت مدل‌های آموزش دیده روی این داده‌ها به تناسب افزایش پیدا خواهد کرد.»

این اقدام EleutherAI در راستای تلاش‌های این سازمان برای جبران اشتباهات پیشین صورت گرفته است؛ پیشتر این سازمان مجموعه داده‌ای به نام The Pile را منتشر کرده بود که شامل محتوای دارای حق نشر بود و انتقادات و فشارهای حقوقی را به دنبال داشت. EleutherAI به دنبال ادامه مسیر خود در انتشار مجموعه داده‌های باز و بهبود روش‌های شفاف‌سازی و پیشرفت هوش مصنوعی است.

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا