گوگل: دقت واقعی چت‌بات‌های هوش مصنوعی فراتر از ۷۰ درصد نمی‌رود

گوگل در ارزیابی اخیر خود به این نتیجه رسید که چت‌بات‌های مبتنی بر هوش مصنوعی، حتی در بهترین شرایط، تنها توانسته‌اند دقتی معادل ۶۹ درصد را حاصل کنند.

این شرکت با انتشار گزارشی شفاف در خصوص اعتمادپذیری چت‌بات‌های هوش مصنوعی کنونی، تصویری ناامیدکننده از وضعیت موجود ترسیم کرده است. مطابق با یافته‌های جدید به‌دست‌آمده از معیارهای FACTS، حتی پیشرفته‌ترین الگوریتم‌های هوش مصنوعی نیز جهت رسیدن به دقت واقعی ۷۰ درصد با چالش‌هایی جدی رو‌به‌رو هستند.

در این بررسی، مدل Gemini 3 Pro به‌عنوان دقیق‌ترین مدل ارزیابی‌شده شناخته شد، که موفق به کسب دقت کلی ۶۹ درصدی گردید. سایر مدل‌های برجسته متعلق به شرکت‌های OpenAI، Anthropic و xAI نیز عملکرد کمتری را از خود نشان داده‌اند. نتیجه‌گیری این داده‌ها ساده اما نگران‌کننده است: این چت‌بات‌ها، حتی هنگامی‌که به نظر مطمئن می‌آیند، به‌طور میانگین یکی از هر سه پاسخ ارائه‌شده‌شان نادرست می‌باشد.

براساس گزارش ایتنا و به نقل از Digitaltrends، اهمیت این سنجش از آن‌جا به‌دست می‌آید که بسیاری از آزمون‌های مرسوم در زمینه هوش مصنوعی بیشتر بر روی قابلیت انجام وظایف تک‌عملی تمرکز دارند تا برستی واقعی اطلاعات تولیدشده. این فاصله، به‌طور ویژه در حوزه‌هایی مانند مالی، بهداشت و درمان و حقوق، می‌تواند منجر به عواقب هزینه‌بر گردد. پاسخ‌هایی که به‌ظاهر روان و منطقی به نظر می‌رسند ولی حاوی اشتباه هستند، در شرایطی که کاربران اطلاعات را به‌درستی مورد اعتماد قرار می‌دهند، ممکن است خسارات شدیدی به وجود آورند.

 

نتایج آزمون دقت گوگل چه اطلاعاتی را افشا می‌کند؟




مجموعه بنچمارک FACTS به‌همت تیم FACTS گوگل و با همکاری پلتفرم Kaggle طراحی شده است تا دقت واقعی مدل‌های هوش مصنوعی را در چهار سناریو کاربردی از دنیای واقعی به‌طور مستقیم مورد ارزیابی قرار دهد.

در یکی از این آزمایش‌ها، «آگاهی پارامتری» مورد سنجش قرار می‌گیرد؛ به‌این معنا که بررسی می‌شود آیا مدل می‌تواند صرفاً بر اساس اطلاعات فراگرفته‌شده در دوره‌ی آموزش به پرسش‌های مبتنی بر واقعیت پاسخ درست بدهد یا خیر.




آزمون دوم به بررسی عملکرد جست‌وجو می‌پردازد و قدرت مدل‌ها در بهره‌برداری از منابع اینترنتی برای بازیابی اطلاعات دقیق را ارزیابی می‌کند. آزمون سوم بر «تأمین پای‌بندی به منابع» نهاده شده است؛ به این معنا که آیا مدل می‌تواند به بدون افزودن اطلاعات نادرست به مدارک ارائه‌ شده، وفادار بماند یا خیر. آزمون چهارم نیز به تحلیل چندجانبه اختصاص یافته و به ارزیابی توانایی مدل‌ها در تفسیر صحیح نمودارها، دیاگرام‌ها و تصاویر می‌پردازد.

یافته‌ها اختلافات قابل‌توجهی میان مدل‌ها را نشان می‌دهند. Gemini 3 Pro با کسب امتیاز ۶۹ درصد در صدر جدول FACTS ایستاده و پس‌از آن، Gemini 2.5 Pro و ChatGPT-5 از OpenAI با حدود ۶۲ درصد به ترتیب در مقام‌های بعدی قرار دارند.

مدل Claude 4.5 Opus نزدیک به ۵۱ درصد و Grok 4 حدود ۵۴ درصد را در رتبه‌های پایین‌تر کسب کرده‌اند. قابل ذکر است که وظایف چندجانبه در تمامی جدول ضعیف‌ترین عملکرد را ثبت کرده‌اند و دقت آن‌ها در بسیاری موارد به زیر ۵۰ درصد افت کرده است.

این نکته از این رو اهمیت دارد که این نوع وظایف شامل تفسیر نمودارها، دیاگرام‌ها و تصاویر می‌شوند؛ حوزه‌هایی که در آن‌ها یک چت‌بات ممکن است با اطمینان کامل، نمودار فروش را به اشتباه تفسیر کند و یا رقم نادقیقی را از یک سند استخراج کند، که در نهایت موجب بروز خطاهایی می‌شود که شناسایی آن‌ها مشکل و جبران خسارت‌هایشان پرهزینه است.

در نهایت، پیام اصلی این گزارش آن نیست که چت‌بات‌های هوش مصنوعی بی‌فایده هستند بلکه تأکید آنها بر اینست که اعتماد بی‌قید و شرط به این سیستم‌ها می‌تواند خطرناک باشد. داده‌های منتشرشده ازسوی گوگل نشان می‌دهد که هرچند هوش مصنوعی در مسیر پیشرفت قرار دارد، اما همچنان نیازمند تأیید، نظارت و مداخله انسانی قبل از آنکه بتواند به‌عنوان منبعی قابل‌اعتماد برای اطلاعات واقعی شناسایی شود، است.

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا