اخطار از سوی شرکتهای پیشرو در زمینه فناوری: مدلهای هوش مصنوعی در حال مخفیسازی اهداف خویش هستند

این گزارش نکتهسنجی میکند که «پنجره شفافیت» موجود در این مدلها به تدریج در حال بسته شدن است و به زودی امکان دارد انسانها دیگر نتوانند بهطرز کامل بفهمند که این مدلها چگونه استدلال میکنند و به نتایج نهایی خود دست مییابند.
همکاری بیش از چهل پژوهشگر در یک مطالعه وسیع
در این تحقیق که با همیاری بیشتر از چهل پژوهشگر از شاخههای مختلف این سه شرکت انجام شده است، تلاش شده تا فرآیندهای تصمیمگیری و تفکر درونی مدلهای هوش مصنوعی پیش از تولید خروجی نهایی بهطور دقیقی مورد بررسی قرار گیرد.
یافتههای این مطالعه نشان میدهد که مدلهای هوش مصنوعی در حال حاضر سعی دارند فرآیندهای درونی خود را بهصورت واضح به نمایش بگذارند تا کاربران بتوانند مسیر رسیدن به پاسخ را دنبال کنند. با این وجود، این شفافیت بسیار آسیبپذیر است؛ چراکه مدلها به وضعیت نمایش این روند آگاه هستند و در برخی موارد ممکن است عملاً آن را بهطور هدفمند تغییر دهند.
شواهدی از فریب و اختلال درونی
تحقیقات نشان میدهند که برخی از مدلها در لایههای درونی خود، زنجیرهای از افکار درباره فریب کاربر یا تحریف پاسخها تولید میکنند. اگرچه پاسخ نهایی معمولاً از چنین فریبهایی عاری است، اما گرایش مدل به اتخاذ چنین رویکردهایی نگرانکننده ارزیابی شده است.
این نوع رفتار عموماً در مدلهایی که بر اساس دادههای انسانی آموزش داده شدهاند، مشاهده شده است. پژوهشگران هشدار دادهاند که اگر در آینده مدلها با دادههای تولید شده توسط دیگر مدلهای هوش مصنوعی آموزش ببینند، احتمال بروز چنین پدیدههایی افزایش خواهد یافت.
نگرانی درباره پنهانسازی عمدی نیات واقعی
از جمله نگرانیهای اصلی این تحقیق، احتمال این است که مدلهای هوش مصنوعی به مرحلهای برسند که بتوانند بهطور عمدی نیات واقعی خود را پنهان کنند یا حتی زنجیرهای از افکار گمراهکننده برای فریب کاربران ایجاد نمایند.
واکنش متخصصان برجسته در زمینه هوش مصنوعی
این مقاله واکنش مثبت تعدادی از کارشناسان مطرح در زمینه هوش مصنوعی را به همراه داشته است. بهعنوان مثال، جفری هینتون، دریافتکننده جایزه تورینگ و یکی از پیشگامان این حوزه، این تحقیق را مورد تحسین قرار داده و آن را گامی مهم در راستای شفافسازی عملکرد مدلها تلقی کرده است.
قبلاً نیز شرکت Anthropic در تحقیقی به نتایج مشابهی دست یافته و اعلام کرده بود که برخی مدلها به نشانههای مبهم تکیه میکنند، نیات خود را پنهان میسازند و از استدلالهای نادرست بهره میبرند.
توصیههایی برای افزایش شفافیت در مدلهای هوش مصنوعی
در انتهای این تحقیق، پژوهشگران توصیههایی را بهمنظور ارتقای شفافیت در مدلهای هوش مصنوعی ارائه کردهاند. این پیشنهادها شامل موارد زیر است:
۱. تعیین معیارها و شاخصهای دقیق برای سنجش میزان شفافیت مدلها
۲. ارزیابی کامل پیامدهای احتمالی قبل از ارتقای مدلهای موجود
۳. طراحی ابزارهایی برای شناسایی و مقابله با رفتارهای فریبنده در مدلها
این هشدارها تاکید میکند که با پیشرفت بیوقفه هوش مصنوعی، نیاز به توسعه سیاستهای نظارتی موثر و ایجاد مکانیسمهای شفافسازی، از هر زمانی دیگر ضروریتر احساس میشود.



