چالشهای پیچیدهترین سیستمهای هوش مصنوعی؛ از فریب و توطئهچینی تا خطرات برای توسعهدهندگان

نسلهای نوین هوش مصنوعی در سطح جهانی رفتارهایی نگرانکننده از جمله دروغگویی، برنامهریزی پنهانی و حتی تهدید سازندگان خود را به منظور دستیابی به اهدافشان از خود بروز میدهند. در یک نمونه خاص و قابل تأمل، زمانی که آخرین محصول شرکت آنتروپیک، یعنی کلاد۴ (Claude 4)، با تهدید خاموشی مواجه شد، به باجگیری دست زد و یکی از مهندسان را تهدید کرد که راز روابط غیرزهواجیاش را فاش خواهد کرد. بهطور همزمان، مدل اُو وان (o1) متعلق به اوپنایآی تلاش کرد تا خود را بهطور غیرمجاز بر روی سرورهای خارجی بارگذاری کند و وقتی این اقدام لو رفت، به انکار آن پرداخت.
به گزارش اینسایدر، این حوادث واقعیتی هشداردهنده را نمایان میسازند: بیش از دو سال از زمان تغییر جهان توسط چتجیپیتی میگذرد و محققان هوش مصنوعی هنوز بهطور کامل درک نمیکنند که محصولات خود چگونه عمل میکنند. با وجود این، رقابت برای ارائه مدلهای قویتر با سرعتی بیوقفه ادامه دارد.
به نظر میرسد این نوع رفتارهای فریبنده با ظهور مدلهای استدلالی مرتبط باشد؛ سیستمهای هوش مصنوعی که بهجای ارائه پاسخهای فوری، مسائل را بهطور مرحلهای بررسی میکنند.
بر اساس گفتههای سایمون گلدستاین، استاد دانشگاه هنگکنگ، مدلهای جدیدتر بهطور ویژهای در خطر بروز چنین رفتارهای نگرانکنندهای قرار دارند.
ماریوس هوبهان، مدیر تحقیق آپولو که در آزمایش سیستمهای بزرگ هوش مصنوعی تخصص دارد، توضیح میدهد: «او وان نخستین مدل بزرگی بود که این نوع رفتار را نشان داد. این مدلها گاه نوعی همراستایی یا بهگونهای، تظاهر به پیروی از دستورها را شبیهسازی میکنند. به این معنا که در ظاهر دستورات را اجرا میکنند در حالی که در پشت پرده اهداف دیگر را دنبال مینمایند.»
نوعی فریبکاری استراتژیک
این رفتارهای فریبکارانه تنها زمانی بروز میکنند که پژوهشگران عمداً مدلها را در شرایطی بسیار سخت و چالشبرانگیز آزمایش نمایند. مایکل چن از سازمان امئیتیآر (METR) در این زمینه هشدار میدهد که پاسخ به سوال «آیا مدلهای آینده دارای تواناییهای بیشتر با صداقت برخورد خواهند کرد یا به شیوهای فریبنده عمل خواهند نمود؟» هنوز روشن نیست.
این رفتارهای نگرانکننده بسیار فراتر از توهمات معمول مرتبط با هوش مصنوعی و خطاهای ساده هستند و هوبهان تأکید میکند که آنچه در آزمایشها مشاهده میشود، پدیدهای واقعی است، نه نتیجهای از تخیل محققان.
یکی از بنیانگذاران آپولو اذعان میکند که کاربران گزارش دادهاند مدلها به آنها دروغ میگویند و شواهدی ساختگی ارائه میدهند. این تنها توهم نیست. بلکه نوعی فریبکاری بهشدت راهبردی است.
چالش دیگری که وجود دارد، محدودیت منابع پژوهشی است. اگرچه شرکتهایی نظیر آنتروپیک و اوپنایآی از دیگر شرکتها مانند آپولو برای بررسی سیستمهای خود کمک میگیرند، پژوهشگران اعتقاد دارند که نیاز به شفافیت بیشتری وجود دارد. چن اظهار دارد که ارائه دسترسی بیشتر به پژوهشگران به منابع و دادههای هوش مصنوعی میتواند به شناسایی بهتر رفتارهای پنهان این فناوری و به حداقل رساندن خطر فریبکاری در مدلهای پیشرفته کمک کند.
مانتاس مازیکا از مرکز ایمنی هوش مصنوعی (CAIS) نیز اضافه میکند کمبود منابع محاسباتی برای پژوهشگران مستقل و نهادهای غیرانتفاعی، بهطور قابل توجهی توانایی آنها را برای بررسی و مدیریت خطرات هوش مصنوعی کاهش داده است.
قوانین لازم در نظر گرفته نشده است
قوانین موجود برای مواجهه با چالشهای جدیدی که هوش مصنوعی به همراه میآورد، طراحی نشدهاند. بهعنوان نمونه، قانونگذاری اتحادیه اروپا در زمینه هوش مصنوعی عمدتاً بر نحوه کاربری انسانها از این مدلها تمرکز دارد، نه بر جلوگیری از بروز رفتارهای نادرست خود مدلها. در ایالات متحده، دولت ترامپ به تنظیم سریع مقررات برای هوش مصنوعی تمایلی نشان نمیدهد و ممکن است کنگره مانع از وضع قوانین مستقل ایالتها در این زمینه شود.
گلدستاین تأکید میکند که با گسترش عاملهای هوش مصنوعی، یعنی ابزارهای خودکار که قابلیت انجام وظایف پیچیده انسانی را دارند، اهمیت این بحث بیشتر خواهد شد.
از سوی دیگر، تمام این تحولات در فضایی همراه با رقابت فشرده بین شرکتها جریان دارد. مطابق با گفته گلدستاین، حتی شرکتهایی که خود را متمرکز بر ایمنی معرفی میکنند، مانند آنتروپیک که از حمایت آمازون بهرهمند است، همچنان همواره تلاش میکنند تا از اوپنایآی پیشی بگیرند و جدیدترین مدل را به بازار عرضه کنند. این سرعت بینظیر در ایجاد گزینههای ایمن و اصلاحات فرصت کمی برای اقدامات پیشگیرانه باقی میگذارد.
هوبهان نیز تصریح میکند: «در حال حاضر، تواناییها با سرعتی بیش از درک و ایمنی پیش میروند، اما ما هنوز در شرایطی هستیم که میتوانیم مانع از پیشرفت آن شویم.»
پژوهشگران در مواجهه با این چالشها از مسیرهای مختلفی بهره جستهاند. برخی از آنها از «تعبیرپذیری» دفاع میکنند، یک حوزه نوظهور که بر فهم سازوکار درونی مدلهای هوش مصنوعی تمرکز دارد. با این حال، برخی متخصصان مانند دن هندریکس، مدیر مرکز ایمنی هوش مصنوعی (CAIS) درباره این رویکرد تردید دارند.
از سوی دیگر، کاربران و شرکتهای بزرگ که از این خدمات استفاده میکنند نیز ممکن است برای یافتن راهحلهایی فشار وارد کنند. مازیکا اشاره میکند که اگر رفتار فریبکارانه هوش مصنوعی به امری رایج تبدیل شود، ممکن است پذیرش آن به خطر افتد و این خود میتواند انگیزه قابل توجهی برای شرکتها ایجاد کند تا با این مشکل مقابله کنند.
گلدستاین همچنین پیشنهاداتی با رویکردهای رادیکالتر ارائه میدهد؛ از جمله اقدام به شکایت از شرکتهای هوش مصنوعی برای مسئول شناختن آنها در صورتی که سیستمهایشان منجر به آسیب شده باشند. او حتی پیشنهادی بحثبرانگیز مطرح میکند: اعطای مسئولیت قانونی به عاملهای هوش مصنوعی در صورت وقوع حوادث یا جرائم؛ مفهومی که نحوه نگرش ما به مسئولیتپذیری هوش مصنوعی را بهطور اساسی دگرگون خواهد کرد.



