گوگل: دقت واقعی چتباتهای هوش مصنوعی فراتر از ۷۰ درصد نمیرود

این شرکت با انتشار گزارشی شفاف در خصوص اعتمادپذیری چتباتهای هوش مصنوعی کنونی، تصویری ناامیدکننده از وضعیت موجود ترسیم کرده است. مطابق با یافتههای جدید بهدستآمده از معیارهای FACTS، حتی پیشرفتهترین الگوریتمهای هوش مصنوعی نیز جهت رسیدن به دقت واقعی ۷۰ درصد با چالشهایی جدی روبهرو هستند.
در این بررسی، مدل Gemini 3 Pro بهعنوان دقیقترین مدل ارزیابیشده شناخته شد، که موفق به کسب دقت کلی ۶۹ درصدی گردید. سایر مدلهای برجسته متعلق به شرکتهای OpenAI، Anthropic و xAI نیز عملکرد کمتری را از خود نشان دادهاند. نتیجهگیری این دادهها ساده اما نگرانکننده است: این چتباتها، حتی هنگامیکه به نظر مطمئن میآیند، بهطور میانگین یکی از هر سه پاسخ ارائهشدهشان نادرست میباشد.
براساس گزارش ایتنا و به نقل از Digitaltrends، اهمیت این سنجش از آنجا بهدست میآید که بسیاری از آزمونهای مرسوم در زمینه هوش مصنوعی بیشتر بر روی قابلیت انجام وظایف تکعملی تمرکز دارند تا برستی واقعی اطلاعات تولیدشده. این فاصله، بهطور ویژه در حوزههایی مانند مالی، بهداشت و درمان و حقوق، میتواند منجر به عواقب هزینهبر گردد. پاسخهایی که بهظاهر روان و منطقی به نظر میرسند ولی حاوی اشتباه هستند، در شرایطی که کاربران اطلاعات را بهدرستی مورد اعتماد قرار میدهند، ممکن است خسارات شدیدی به وجود آورند.
نتایج آزمون دقت گوگل چه اطلاعاتی را افشا میکند؟
مجموعه بنچمارک FACTS بههمت تیم FACTS گوگل و با همکاری پلتفرم Kaggle طراحی شده است تا دقت واقعی مدلهای هوش مصنوعی را در چهار سناریو کاربردی از دنیای واقعی بهطور مستقیم مورد ارزیابی قرار دهد.
در یکی از این آزمایشها، «آگاهی پارامتری» مورد سنجش قرار میگیرد؛ بهاین معنا که بررسی میشود آیا مدل میتواند صرفاً بر اساس اطلاعات فراگرفتهشده در دورهی آموزش به پرسشهای مبتنی بر واقعیت پاسخ درست بدهد یا خیر.
آزمون دوم به بررسی عملکرد جستوجو میپردازد و قدرت مدلها در بهرهبرداری از منابع اینترنتی برای بازیابی اطلاعات دقیق را ارزیابی میکند. آزمون سوم بر «تأمین پایبندی به منابع» نهاده شده است؛ به این معنا که آیا مدل میتواند به بدون افزودن اطلاعات نادرست به مدارک ارائه شده، وفادار بماند یا خیر. آزمون چهارم نیز به تحلیل چندجانبه اختصاص یافته و به ارزیابی توانایی مدلها در تفسیر صحیح نمودارها، دیاگرامها و تصاویر میپردازد.
یافتهها اختلافات قابلتوجهی میان مدلها را نشان میدهند. Gemini 3 Pro با کسب امتیاز ۶۹ درصد در صدر جدول FACTS ایستاده و پساز آن، Gemini 2.5 Pro و ChatGPT-5 از OpenAI با حدود ۶۲ درصد به ترتیب در مقامهای بعدی قرار دارند.
مدل Claude 4.5 Opus نزدیک به ۵۱ درصد و Grok 4 حدود ۵۴ درصد را در رتبههای پایینتر کسب کردهاند. قابل ذکر است که وظایف چندجانبه در تمامی جدول ضعیفترین عملکرد را ثبت کردهاند و دقت آنها در بسیاری موارد به زیر ۵۰ درصد افت کرده است.
این نکته از این رو اهمیت دارد که این نوع وظایف شامل تفسیر نمودارها، دیاگرامها و تصاویر میشوند؛ حوزههایی که در آنها یک چتبات ممکن است با اطمینان کامل، نمودار فروش را به اشتباه تفسیر کند و یا رقم نادقیقی را از یک سند استخراج کند، که در نهایت موجب بروز خطاهایی میشود که شناسایی آنها مشکل و جبران خسارتهایشان پرهزینه است.
در نهایت، پیام اصلی این گزارش آن نیست که چتباتهای هوش مصنوعی بیفایده هستند بلکه تأکید آنها بر اینست که اعتماد بیقید و شرط به این سیستمها میتواند خطرناک باشد. دادههای منتشرشده ازسوی گوگل نشان میدهد که هرچند هوش مصنوعی در مسیر پیشرفت قرار دارد، اما همچنان نیازمند تأیید، نظارت و مداخله انسانی قبل از آنکه بتواند بهعنوان منبعی قابلاعتماد برای اطلاعات واقعی شناسایی شود، است.



