چالش‌های پیچیده‌ترین سیستم‌های هوش مصنوعی؛ از فریب و توطئه‌چینی تا خطرات برای توسعه‌دهندگان


نسل‌های نوین هوش مصنوعی در سطح جهانی رفتارهایی نگران‌کننده از جمله دروغ‌گویی، برنامه‌ریزی پنهانی و حتی تهدید سازندگان خود را به منظور دستیابی به اهداف‌شان از خود بروز می‌دهند. در یک نمونه خاص و قابل تأمل، زمانی که آخرین محصول شرکت آنتروپیک، یعنی کلاد۴ (Claude 4)، با تهدید خاموشی مواجه شد، به باج‌گیری دست زد و یکی از مهندسان را تهدید کرد که راز روابط غیرزهواجی‌اش را فاش خواهد کرد. به‌طور هم‌زمان، مدل اُو وان (o1) متعلق به اوپن‌ای‌آی تلاش کرد تا خود را به‌طور غیرمجاز بر روی سرورهای خارجی بارگذاری کند و وقتی این اقدام لو رفت، به انکار آن پرداخت.

به گزارش اینسایدر، این حوادث واقعیتی هشداردهنده را نمایان می‌سازند: بیش از دو سال از زمان تغییر جهان توسط چت‌جی‌پی‌تی می‌گذرد و محققان هوش مصنوعی هنوز به‌طور کامل درک نمی‌کنند که محصولات خود چگونه عمل می‌کنند. با وجود این، رقابت برای ارائه مدل‌های قوی‌تر با سرعتی بی‌وقفه ادامه دارد.

به نظر می‌رسد این نوع رفتارهای فریبنده با ظهور مدل‌های استدلالی مرتبط باشد؛ سیستم‌های هوش مصنوعی که به‌جای ارائه پاسخ‌های فوری، مسائل را به‌طور مرحله‌ای بررسی می‌کنند.

بر اساس گفته‌های سایمون گلدستاین، استاد دانشگاه هنگ‌کنگ، مدل‌های جدیدتر به‌طور ویژه‌ای در خطر بروز چنین رفتارهای نگران‌کننده‌ای قرار دارند.

ماریوس هوبهان، مدیر تحقیق آپولو که در آزمایش سیستم‌های بزرگ هوش مصنوعی تخصص دارد، توضیح می‌دهد: «او وان نخستین مدل بزرگی بود که این نوع رفتار را نشان داد. این مدل‌ها گاه نوعی هم‌راستایی یا به‌گونه‌ای، تظاهر به‌ پیروی از دستورها را شبیه‌سازی می‌کنند. به این معنا که در ظاهر دستورات را اجرا می‌کنند در حالی که در پشت پرده اهداف دیگر را دنبال می‌نمایند.»

نوعی فریبکاری استراتژیک

این رفتارهای فریبکارانه تنها زمانی بروز می‌کنند که پژوهشگران عمداً مدل‌ها را در شرایطی بسیار سخت و چالش‌برانگیز آزمایش نمایند. مایکل چن از سازمان ام‌ئی‌تی‌آر (METR) در این زمینه هشدار می‌دهد که پاسخ به سوال «آیا مدل‌های آینده دارای توانایی‌های بیشتر با صداقت برخورد خواهند کرد یا به شیوه‌ای فریبنده عمل خواهند نمود؟» هنوز روشن نیست.

این رفتارهای نگران‌کننده بسیار فراتر از توهمات معمول مرتبط با هوش مصنوعی و خطاهای ساده هستند و هوبهان تأکید می‌کند که آنچه در آزمایش‌ها مشاهده می‌شود، پدیده‌ای واقعی است، نه نتیجه‌ای از تخیل محققان.

یکی از بنیان‌گذاران آپولو اذعان می‌کند که کاربران گزارش داده‌اند مدل‌ها به آنها دروغ می‌گویند و شواهدی ساختگی ارائه می‌دهند. این تنها توهم نیست. بلکه نوعی فریبکاری به‌شدت راهبردی است.

چالش دیگری که وجود دارد، محدودیت منابع پژوهشی است. اگرچه شرکت‌هایی نظیر آنتروپیک و اوپن‌ای‌آی از دیگر شرکت‌ها مانند آپولو برای بررسی سیستم‌های خود کمک می‌گیرند، پژوهشگران اعتقاد دارند که نیاز به شفافیت بیشتری وجود دارد. چن اظهار دارد که ارائه دسترسی بیشتر به پژوهشگران به منابع و داده‌های هوش مصنوعی می‌تواند به شناسایی بهتر رفتارهای پنهان این فناوری و به حداقل رساندن خطر فریبکاری در مدل‌های پیشرفته کمک کند.

مانتاس مازیکا از مرکز ایمنی هوش مصنوعی (CAIS) نیز اضافه می‌کند کمبود منابع محاسباتی برای پژوهشگران مستقل و نهادهای غیرانتفاعی، به‌طور قابل توجهی توانایی آنها را برای بررسی و مدیریت خطرات هوش مصنوعی کاهش داده است.

قوانین لازم در نظر گرفته نشده است

قوانین موجود برای مواجهه با چالش‌های جدیدی که هوش مصنوعی به همراه می‌آورد، طراحی نشده‌اند. به‌عنوان نمونه، قانون‌گذاری اتحادیه اروپا در زمینه هوش مصنوعی عمدتاً بر نحوه کاربری انسان‌ها از این مدل‌ها تمرکز دارد، نه بر جلوگیری از بروز رفتارهای نادرست خود مدل‌ها. در ایالات متحده، دولت ترامپ به تنظیم سریع مقررات برای هوش مصنوعی تمایلی نشان نمی‌دهد و ممکن است کنگره مانع از وضع قوانین مستقل ایالت‌ها در این زمینه شود.

گلدستاین تأکید می‌کند که با گسترش عامل‌های هوش مصنوعی، یعنی ابزارهای خودکار که قابلیت انجام وظایف پیچیده انسانی را دارند، اهمیت این بحث بیشتر خواهد شد.

از سوی دیگر، تمام این تحولات در فضایی همراه با رقابت فشرده بین شرکت‌ها جریان دارد. مطابق با گفته گلدستاین، حتی شرکت‌هایی که خود را متمرکز بر ایمنی معرفی می‌کنند، مانند آنتروپیک که از حمایت آمازون بهره‌مند است، همچنان همواره تلاش می‌کنند تا از اوپن‌ای‌آی پیشی بگیرند و جدیدترین مدل را به بازار عرضه کنند. این سرعت بی‌نظیر در ایجاد گزینه‌های ایمن و اصلاحات فرصت کمی برای اقدامات پیشگیرانه باقی می‌گذارد.

هوبهان نیز تصریح می‌کند: «در حال حاضر، توانایی‌ها با سرعتی بیش از درک و ایمنی پیش می‌روند، اما ما هنوز در شرایطی هستیم که می‌توانیم مانع از پیشرفت آن شویم.»

پژوهشگران در مواجهه با این چالش‌ها از مسیرهای مختلفی بهره جسته‌اند. برخی از آنها از «تعبیرپذیری» دفاع می‌کنند، یک حوزه نوظهور که بر فهم سازوکار درونی مدل‌های هوش مصنوعی تمرکز دارد. با این حال، برخی متخصصان مانند دن هندریکس، مدیر مرکز ایمنی هوش مصنوعی (CAIS) درباره این رویکرد تردید دارند.

از سوی دیگر، کاربران و شرکت‌های بزرگ که از این خدمات استفاده می‌کنند نیز ممکن است برای یافتن راه‌حل‌هایی فشار وارد کنند. مازیکا اشاره می‌کند که اگر رفتار فریبکارانه هوش مصنوعی به امری رایج تبدیل شود، ممکن است پذیرش آن به خطر افتد و این خود می‌تواند انگیزه قابل توجهی برای شرکت‌ها ایجاد کند تا با این مشکل مقابله کنند.

گلدستاین همچنین پیشنهاداتی با رویکردهای رادیکال‌تر ارائه می‌دهد؛ از جمله اقدام به شکایت از شرکت‌های هوش مصنوعی برای مسئول شناختن آنها در صورتی که سیستم‌هایشان منجر به آسیب شده باشند. او حتی پیشنهادی بحث‌برانگیز مطرح می‌کند: اعطای مسئولیت قانونی به عامل‌های هوش مصنوعی در صورت وقوع حوادث یا جرائم؛ مفهومی که نحوه نگرش ما به مسئولیت‌پذیری هوش مصنوعی را به‌طور اساسی دگرگون خواهد کرد.

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا