Cloudflare دسترسی خزنده‌های هوش مصنوعی را محدودتر می‌کند

Cloudflare از امروز اجرای سیاست تازه‌ای برای خزنده‌های هوش مصنوعی را در بخش‌هایی از شبکهٔ خود آغاز می‌کند. این شرکت می‌گوید سایت‌های جدید و مشتریانی که به‌تازگی به شبکه می‌پیوندند، به‌صورت پیش‌فرض می‌توانند نمایش صفحات خود در موتورهای جست‌وجو را حفظ کنند، اما خزنده‌هایی را که برای آموزش مدل یا استفادهٔ عامل‌های هوش مصنوعی به کار می‌روند، در صفحات دارای تبلیغ مسدود خواهند کرد. این تصمیم بخشی از تغییر بزرگ‌تر رابطهٔ میان ناشران وب و شرکت‌های هوش مصنوعی است؛ رابطه‌ای که در آن محتوا برای پاسخ‌گویی مدل‌ها ارزش دارد، اما سازندهٔ محتوا همیشه از بازدید، درآمد یا کنترل کافی برخوردار نیست.

تفاوت جست‌وجو با آموزش مدل

هر خزندهٔ وب الزاماً کاربرد یکسانی ندارد. موتور جست‌وجو صفحه را می‌خواند تا عنوان، متن و نشانی آن را در فهرست خود ثبت کند و کاربر را برای مطالعه به سایت بفرستد. در مقابل، خزندهٔ آموزش ممکن است محتوای صفحه را برای ساخت یا بهبود مدل زبانی جمع‌آوری کند؛ در این حالت کاربر لزوماً به منبع اصلی بازنمی‌گردد. عامل هوش مصنوعی نیز می‌تواند صفحه را برای انجام کاری مانند مقایسهٔ کالا، تکمیل فرم یا پاسخ به یک درخواست بخواند. تشخیص این تفاوت در عمل همیشه آسان نیست، زیرا برخی خزنده‌ها بیش از یک کار انجام می‌دهند و نام یا رفتار فنی آن‌ها تغییر می‌کند.

Cloudflare برای همین وضعیت از مفهوم خزندهٔ چندمنظوره استفاده می‌کند. ناشر ممکن است بخواهد در نتایج جست‌وجو دیده شود، اما اجازه ندهد همان داده برای آموزش مدل یا اجرای عامل استفاده شود. سیاست جدید می‌کوشد این انتخاب را جدا کند. با این حال، تصمیم نهایی به شناسایی درست خزنده و اجرای دقیق قانون وابسته است. اگر یک ربات با هویت مبهم ظاهر شود یا خود را مانند مرورگر عادی معرفی کند، کنترل فنی دشوارتر خواهد بود. بنابراین سیاست اعلام‌شده علاوه بر یک قاعدهٔ تجاری، آزمونی برای کیفیت تشخیص ترافیک وب نیز هست.

چرا صفحات تبلیغ‌دار معیار قرار گرفته‌اند؟

Cloudflare می‌گوید در مرحلهٔ نخست، مسدودسازی پیش‌فرض برای صفحات دارای تبلیغ اعمال می‌شود. منطق این تصمیم به اقتصاد ناشران مربوط است. صفحه‌ای که تبلیغ نمایش می‌دهد، برای تأمین هزینهٔ تولید محتوا به مشاهدهٔ کاربر و درآمد تبلیغاتی وابسته است. وقتی یک مدل هوش مصنوعی محتوا را استخراج می‌کند و پاسخ را بدون کلیک به کاربر می‌دهد، ناشر ممکن است نمایش صفحه و درآمد خود را از دست بدهد. از طرف دیگر، همهٔ سایت‌ها یک مدل تجاری ندارند؛ بعضی اشتراکی‌اند، بعضی از حمایت مالی استفاده می‌کنند و بعضی می‌خواهند بازدید گسترده بگیرند. به همین دلیل، سیاست عمومی باید امکان تنظیمات متفاوت را هم فراهم کند.

این قاعده به معنای بسته شدن همهٔ صفحات اینترنت برای هوش مصنوعی نیست. مالک سایت می‌تواند طبق تنظیمات خود اجازه یا محدودیت تعیین کند. هدف Cloudflare ارائهٔ کنترل متمرکز در سطح شبکه است تا مدیر مجبور نباشد برای هر ربات قانون جداگانه بنویسد. مدیر سایت باید بداند هر انتخاب چه اثری بر جست‌وجو، آموزش، خلاصه‌سازی و عامل‌ها دارد. تنظیم نادرست ممکن است باعث شود صفحه در نتایج جست‌وجو ناپدید شود یا برعکس، محتوای آن بدون جبران اقتصادی در اختیار سامانه‌های دیگر قرار گیرد.

مدل پرداخت برای استفاده از محتوا

Cloudflare همچنین مدل Pay Per Crawl را با نام Pay Per Use توضیح داده است. ایدهٔ اصلی این است که ناشر فقط برای ورود خزنده پول نگیرد، بلکه هنگامی که محتوای او در پاسخ هوش مصنوعی استفاده می‌شود، امکان دریافت هزینه داشته باشد. چنین مدلی می‌تواند مسیر تازه‌ای برای درآمد ایجاد کند، اما اجرای آن به ثبت دقیق منبع، اندازه‌گیری استفاده و توافق میان طرفین نیاز دارد. باید مشخص شود یک جملهٔ نقل‌شده، یک خلاصهٔ چندصدکلمه‌ای یا یک پاسخ تولیدشده بر پایهٔ چند صفحه چگونه قیمت‌گذاری می‌شود. ناشر باید مطمئن باشد اطلاعات مصرف به‌درستی گزارش می‌شود.

مدل پرداختی در صورتی جذاب است که برای هر دو طرف هزینهٔ عملیاتی قابل قبول داشته باشد. یک سامانهٔ هوش مصنوعی ممکن است در هر پاسخ چندین منبع را بررسی کند و اگر مذاکره با هر سایت جداگانه انجام شود، پیچیدگی زیادی شکل می‌گیرد. یک شبکهٔ واسط می‌تواند قرارداد، احراز هویت و صورتحساب را ساده‌تر کند، اما در این حالت اعتماد به گزارش شبکه اهمیت می‌یابد. ناشر نیز ممکن است ترجیح دهد به‌جای پرداخت به ازای هر استفاده، اشتراک یا قرارداد سالانه داشته باشد. هنوز روشن نیست کدام مدل در بازار غالب خواهد شد.

چالش شناسایی ربات‌ها

یکی از مسائل فنی، تفکیک ربات‌های شرکت‌های بزرگ است. Googlebot برای جست‌وجو با Google-Extended برای کاربردهای هوش مصنوعی ارتباط دارد، اما ناشر باید بداند بستن یک شناسه دقیقاً کدام سرویس را تحت تأثیر می‌گذارد. اگر قوانین بیش از حد کلی نوشته شوند، ممکن است سایت به‌طور ناخواسته از جست‌وجوی عادی حذف شود. اگر قوانین بیش از حد محدود باشند، محتوای آموزشی یا عامل‌های ناخواسته همچنان دسترسی پیدا می‌کنند. مدیران فنی به گزارش‌های قابل فهم نیاز دارند تا ببینند چه خزنده‌ای، با چه هدفی و با چه حجمی درخواست فرستاده است.

فایل robots.txt مدت‌ها ابزار اصلی اعلام ترجیح ناشر بوده است، اما ضمانت فنی مطلق ایجاد نمی‌کند. ربات معتبر می‌تواند قانون را رعایت کند، ولی ربات ناشناس ممکن است آن را نادیده بگیرد. Cloudflare در سطح درخواست شبکه قادر است الگو، نشانی، نرخ درخواست و نشانه‌های رفتاری را هم بررسی کند. این روش کنترل بیشتری می‌دهد، اما احتمال خطای مثبت نیز وجود دارد. اگر یک کاربر واقعی یا سرویس مشروع شبیه خزنده دیده شود، نباید به‌اشتباه مسدود شود. توازن میان امنیت، دسترسی و حفظ بازدید به تنظیم دقیق نیاز دارد.

اثر بر ناشران و کسب‌وکارها

ناشران خبری، وبلاگ‌های تخصصی، فروشگاه‌های اینترنتی و پایگاه‌های آموزشی هرکدام هدف متفاوتی دارند. یک سایت خبری ممکن است بخواهد نام و خلاصهٔ مطلب در پاسخ مدل دیده شود تا مخاطب جدید جذب کند، اما سایت دیگری به درآمد اشتراک وابسته باشد و استخراج متن را محدود کند. فروشگاه شاید اجازه دهد مشخصات محصول خوانده شود، ولی قیمت و موجودی را فقط از مسیر رسمی ارائه دهد. سیاست جدید می‌تواند این تفاوت‌ها را شفاف‌تر کند، به‌شرط آنکه تنظیمات و گزارش‌ها برای مدیر غیرمتخصص نیز قابل فهم باشند.

برای شرکت‌های هوش مصنوعی، تغییر سیاست به معنای هزینه و ریسک بیشتر برای گردآوری داده است. آن‌ها ممکن است به سراغ قرارداد مستقیم با ناشران، داده‌های دارای مجوز یا منابع عمومی بروند. این کار می‌تواند کیفیت داده و رابطهٔ تجاری را بهتر کند، اما سرعت پوشش وب را کاهش دهد. شرکت‌های کوچک‌تر نیز شاید توان مذاکره با هزاران ناشر را نداشته باشند. در نتیجه، بازار احتمالاً به سمت واسطه‌های محتوا، استانداردهای مشترک و قراردادهای دسته‌جمعی حرکت خواهد کرد.

آیندهٔ وب

اگر تعداد بیشتری از شبکه‌های تحویل محتوا سیاست مشابهی اجرا کنند، وب به محیطی با دسترسی‌های لایه‌ای تبدیل می‌شود. یک صفحه ممکن است برای کاربر عادی و موتور جست‌وجو باز باشد، برای آموزش مدل بسته باشد و برای عامل خرید تنها بخشی از داده را نشان دهد. چنین تفکیکی می‌تواند کنترل ناشر را افزایش دهد، اما توسعه‌دهندگان باید استانداردهای روشن برای اعلام هدف خزنده داشته باشند. بدون استاندارد مشترک، هر سایت قانون و شناسهٔ جداگانه‌ای خواهد داشت و مدیریت آن دشوار می‌شود.

تصمیم Cloudflare نشان می‌دهد اختلاف میان ارزش محتوا و ارزش توزیع آن وارد مرحلهٔ فنی و تجاری تازه‌ای شده است. ناشر می‌خواهد در اکوسیستم پاسخ‌های هوش مصنوعی حضور داشته باشد، اما نمی‌خواهد کنترل و درآمدش ناپدید شود. Cloudflare با پیش‌فرض تازه و مدل Pay Per Use تلاش می‌کند این انتخاب را به تنظیمات شبکه و بازار پرداخت تبدیل کند. نتیجهٔ واقعی زمانی روشن می‌شود که ناشران و شرکت‌های هوش مصنوعی از آن استفاده کنند و مشخص شود آیا محدودیت‌ها بازدید را کم می‌کنند یا به قراردادهای پایدارتر می‌انجامند.

تاریخ انتشار: ۲۴ شهریور ۱۴۰۵

منبع: Engadget

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا