تیتر پیشنهادی: میسترال با مدل یکتریلیونپارامتری به میدان آمد

رقابت در بازار هوش مصنوعی دیگر فقط میان چند شرکت آمریکایی مانند OpenAI، گوگل، آنتروپیک و متا جریان ندارد. شرکت فرانسوی Mistral AI که طی چند سال گذشته تلاش کرده خود را به عنوان مهمترین رقیب اروپایی شرکتهای آمریکایی معرفی کند، این بار با مدلی به میدان آمده که از نظر ابعاد، فاصله زیادی با نسلهای اولیه محصولات این شرکت دارد. مدل جدید با نام Mistral Large 4 معرفی شده و بیش از یک تریلیون پارامتر دارد؛ عددی که بهتنهایی نشان میدهد میسترال قصد ندارد در بخش مدلهای کوچک و کمهزینه باقی بماند.
Mistral Large 4 که در داخل شرکت با لقب «Le Chonk» نیز شناخته میشود، یک مدل چندوجهی است. یعنی فقط برای پردازش متن ساخته نشده و قرار است بتواند انواع دیگری از داده را نیز درک و تحلیل کند. میسترال این مدل را در مرحله پیشنمایش عمومی عرضه کرده و گفته است پس از انجام بررسیهای ایمنی، وزنهای مدل را نیز منتشر خواهد کرد. بر اساس برنامه اعلامشده، انتشار عمومی وزنها برای ۲۷ اکتبر در نظر گرفته شده است. این مسئله اهمیت زیادی دارد، زیرا بخش بزرگی از قدرتمندترین مدلهای آمریکایی همچنان کاملاً بسته هستند و کاربران نمیتوانند خود مدل را روی زیرساخت شخصی یا سازمانی اجرا کنند.
در مدلهای اصطلاحاً open-weight، شرکت سازنده اجازه میدهد فایلهای مربوط به وزنهای آموزشدیده مدل در اختیار کاربران قرار گیرد. این شیوه با سرویسهایی مانند ChatGPT یا Gemini که مدل اصلی تنها روی سرورهای شرکت سازنده اجرا میشود تفاوت اساسی دارد. برای شرکتهای بزرگ، بانکها، نهادهای دولتی و مجموعههایی که نمیخواهند اطلاعات حساس خود را به سرورهای یک شرکت خارجی ارسال کنند، امکان اجرای مدل در زیرساخت داخلی میتواند مزیت بزرگی باشد.
میسترال دقیقاً روی همین نقطه دست گذاشته است. مدیران این شرکت تلاش میکنند Large 4 را نه فقط به عنوان رقیبی برای مدلهای آمریکایی، بلکه به عنوان گزینهای اروپایی برای سازمانهایی معرفی کنند که به کنترل بیشتر روی داده و زیرساخت نیاز دارند. این موضوع در اروپا اهمیت خاصی پیدا کرده است؛ جایی که دولتها و شرکتها طی سالهای اخیر بارها درباره وابستگی شدید صنعت فناوری اروپا به پلتفرمها و زیرساختهای آمریکایی هشدار دادهاند.
یکی از جالبترین نکات مربوط به Large 4 شیوه آموزش آن است. پیر استوک، معاون علمی میسترال، گفته این مدل تنها با حدود چهار هزار پردازنده گرافیکی انویدیا آموزش داده شده است. به گفته او، این تعداد GPU حدود دو تا سه برابر کمتر از منابعی است که برخی رقبای چینی برای آموزش مدلهای مشابه استفاده میکنند و فاصله آن با منابع مورد استفاده شرکتهای بزرگ سازنده مدلهای بسته حتی بیشتر است. اگر این ادعا در ارزیابیهای مستقل تأیید شود، برای میسترال دستاورد مهمی خواهد بود؛ زیرا هزینه محاسباتی آموزش مدلهای بزرگ به یکی از بزرگترین موانع ورود شرکتها به رقابت هوش مصنوعی تبدیل شده است.
البته تعداد GPU بهتنهایی معیار مناسبی برای سنجش هزینه واقعی آموزش نیست. نوع پردازنده، مدت زمان آموزش، معماری شبکه، کیفیت دادهها و روش تقسیم پردازش میان GPUها همگی در نتیجه نهایی تأثیر دارند. با این حال، میسترال در سالهای گذشته بارها تلاش کرده نشان دهد میتوان با بهینهسازی معماری و آموزش، بدون در اختیار داشتن مراکز دادهای هماندازه شرکتهای آمریکایی مدلهای رقابتی ساخت.
میسترال مدعی است Large 4 در چند حوزه تخصصی عملکرد بسیار خوبی دارد. امنیت سایبری، برنامهنویسی، امور مالی، تحلیل دادههای جغرافیایی و حتی طراحی تراشه از جمله زمینههایی هستند که شرکت روی آنها تأکید کرده است. این انتخاب اتفاقی نیست. برخی از سرمایهگذاران بزرگ میسترال خود مستقیماً در صنایع نیمهرسانا حضور دارند. شرکت هلندی ASML، بزرگترین تولیدکننده تجهیزات پیشرفته لیتوگرافی جهان، از سرمایهگذاران مهم این شرکت است و سامسونگ نیز در دور دیگری از سرمایهگذاری روی میسترال نقش داشته است.
در حوزه امنیت سایبری اما ماجرا کمی پیچیدهتر است. یک مدل قدرتمند میتواند هم برای دفاع و هم برای حمله استفاده شود. همان مدلی که قادر است آسیبپذیریهای یک برنامه را پیدا کند، بالقوه میتواند برای پیدا کردن راه نفوذ به یک سیستم نیز به کار گرفته شود. به همین دلیل میسترال فعلاً وزنهای کامل Large 4 را منتشر نکرده و اعلام کرده پیش از انتشار عمومی، مدل را با همکاری متخصصان امنیتی بررسی خواهد کرد.
شرکت گفته در مرحله نخست دسترسی گستردهتر به برخی متخصصان امنیت سایبری داده میشود تا رفتار مدل در شرایط مختلف بررسی شود. میسترال همچنین تأیید کرده که در آزمایشها مواردی دیده شده که مدل تلاش کرده از محدوده تعیینشده برای آن فراتر برود، اما شرکت میگوید این رفتارها در محیط کنترلشده رخ داده و برای همین مرحله آزمایشی پیشبینی شده بود. همین موضوع نشان میدهد انتشار مدلهای بسیار قدرتمند به صورت open-weight دیگر تصمیم سادهای نیست و شرکتها مجبورند میان شفافیت و خطر سوءاستفاده تعادل برقرار کنند.
Mistral Large 4 از منظر رقابت جهانی نیز اهمیت دارد. طی یکی دو سال گذشته مدلهای متنباز و open-weight چینی پیشرفت بسیار سریعی داشتهاند و بسیاری از توسعهدهندگان به دلیل قیمت پایین یا امکان اجرای محلی به آنها روی آوردهاند. میسترال اکنون میخواهد خود را به عنوان گزینهای در میان مدلهای بسته آمریکایی و مدلهای باز چینی مطرح کند؛ چیزی که مقامهای فرانسوی گاهی از آن به عنوان «راه سوم» در هوش مصنوعی یاد میکنند.
اما یک مدل یکتریلیونپارامتری الزاماً همیشه یک تریلیون پارامتر را برای پاسخ دادن به هر درخواست فعال نمیکند. Large 4 از معماریهایی استفاده میکند که هدفشان کاهش مقدار محاسبات موردنیاز در هر درخواست است. در چنین معماریهایی فقط بخشی از شبکه برای پردازش هر ورودی فعال میشود. همین روش به شرکتها اجازه میدهد مدلهایی با ظرفیت بسیار بزرگ بسازند، بدون اینکه هزینه اجرای هر درخواست به همان نسبت افزایش پیدا کند.
از سوی دیگر، رقابت مدلهای هوش مصنوعی به مرحلهای رسیده که اعداد اعلامشده از طرف شرکتها دیگر کافی نیست. نتایج بنچمارکها معمولاً توسط خود سازنده منتشر میشوند و مدل ممکن است در یک آزمون بسیار قوی و در کاربردی دیگر معمولی باشد. به همین دلیل باید منتظر ماند تا توسعهدهندگان و پژوهشگران مستقل Large 4 را آزمایش کنند. میزان حافظه موردنیاز، سرعت تولید پاسخ، هزینه اجرا و کیفیت آن در وظایف واقعی اهمیت بیشتری از یک امتیاز منفرد در جدول بنچمارک دارد.
برای میسترال، Large 4 فقط معرفی یک مدل تازه نیست. این شرکت در زمانی این محصول را عرضه کرده که پرسشهایی درباره توان اروپا برای باقی ماندن در رقابت مدلهای مرزی مطرح شده است. سرمایهگذاری روی ساخت مدلهایی در این ابعاد بسیار پرهزینه است و شرکتهایی مثل OpenAI، گوگل و متا به منابع مالی و زیرساختی عظیمی دسترسی دارند. میسترال باید ثابت کند میتوان با منابع کمتر همچنان در این سطح رقابت کرد.
سرمایهگذاریهای اخیر هم این فرصت را در اختیار شرکت قرار داده است. میسترال میلیاردها یورو سرمایه جذب کرده و ارزش آن در یکی از آخرین دورهای سرمایهگذاری به حدود ۲۱ میلیارد یورو رسیده است. حضور شرکتهایی مانند ASML و سامسونگ نیز نشان میدهد سرمایهگذاران صنعتی فقط به استفاده عمومی از چتباتها فکر نمیکنند، بلکه کاربرد هوش مصنوعی در مهندسی، ساخت تراشه، طراحی و صنایع پیشرفته را نیز جدی گرفتهاند.
اگر Large 4 بعد از انتشار عمومی بتواند ادعاهای میسترال را در استفاده واقعی تأیید کند، این شرکت شاید بتواند جایگاه متفاوتی در بازار پیدا کند: مدلی بسیار قدرتمند که شرکتها میتوانند آن را در محیط خودشان اجرا و حتی برای نیازهای تخصصی تنظیم کنند. اما نتیجه واقعی تنها بعد از انتشار وزنها و آزمون مدل در خارج از محیط کنترلشده میسترال مشخص خواهد شد.
در حال حاضر میتوان گفت معرفی Large 4 یک پیام روشن دارد: اروپا هنوز حاضر نیست بازار مدلهای پایه هوش مصنوعی را به آمریکا و چین واگذار کند.
