Cloudflare دسترسی خزندههای هوش مصنوعی را محدودتر میکند

Cloudflare از امروز اجرای سیاست تازهای برای خزندههای هوش مصنوعی را در بخشهایی از شبکهٔ خود آغاز میکند. این شرکت میگوید سایتهای جدید و مشتریانی که بهتازگی به شبکه میپیوندند، بهصورت پیشفرض میتوانند نمایش صفحات خود در موتورهای جستوجو را حفظ کنند، اما خزندههایی را که برای آموزش مدل یا استفادهٔ عاملهای هوش مصنوعی به کار میروند، در صفحات دارای تبلیغ مسدود خواهند کرد. این تصمیم بخشی از تغییر بزرگتر رابطهٔ میان ناشران وب و شرکتهای هوش مصنوعی است؛ رابطهای که در آن محتوا برای پاسخگویی مدلها ارزش دارد، اما سازندهٔ محتوا همیشه از بازدید، درآمد یا کنترل کافی برخوردار نیست.
تفاوت جستوجو با آموزش مدل
هر خزندهٔ وب الزاماً کاربرد یکسانی ندارد. موتور جستوجو صفحه را میخواند تا عنوان، متن و نشانی آن را در فهرست خود ثبت کند و کاربر را برای مطالعه به سایت بفرستد. در مقابل، خزندهٔ آموزش ممکن است محتوای صفحه را برای ساخت یا بهبود مدل زبانی جمعآوری کند؛ در این حالت کاربر لزوماً به منبع اصلی بازنمیگردد. عامل هوش مصنوعی نیز میتواند صفحه را برای انجام کاری مانند مقایسهٔ کالا، تکمیل فرم یا پاسخ به یک درخواست بخواند. تشخیص این تفاوت در عمل همیشه آسان نیست، زیرا برخی خزندهها بیش از یک کار انجام میدهند و نام یا رفتار فنی آنها تغییر میکند.
Cloudflare برای همین وضعیت از مفهوم خزندهٔ چندمنظوره استفاده میکند. ناشر ممکن است بخواهد در نتایج جستوجو دیده شود، اما اجازه ندهد همان داده برای آموزش مدل یا اجرای عامل استفاده شود. سیاست جدید میکوشد این انتخاب را جدا کند. با این حال، تصمیم نهایی به شناسایی درست خزنده و اجرای دقیق قانون وابسته است. اگر یک ربات با هویت مبهم ظاهر شود یا خود را مانند مرورگر عادی معرفی کند، کنترل فنی دشوارتر خواهد بود. بنابراین سیاست اعلامشده علاوه بر یک قاعدهٔ تجاری، آزمونی برای کیفیت تشخیص ترافیک وب نیز هست.
چرا صفحات تبلیغدار معیار قرار گرفتهاند؟
Cloudflare میگوید در مرحلهٔ نخست، مسدودسازی پیشفرض برای صفحات دارای تبلیغ اعمال میشود. منطق این تصمیم به اقتصاد ناشران مربوط است. صفحهای که تبلیغ نمایش میدهد، برای تأمین هزینهٔ تولید محتوا به مشاهدهٔ کاربر و درآمد تبلیغاتی وابسته است. وقتی یک مدل هوش مصنوعی محتوا را استخراج میکند و پاسخ را بدون کلیک به کاربر میدهد، ناشر ممکن است نمایش صفحه و درآمد خود را از دست بدهد. از طرف دیگر، همهٔ سایتها یک مدل تجاری ندارند؛ بعضی اشتراکیاند، بعضی از حمایت مالی استفاده میکنند و بعضی میخواهند بازدید گسترده بگیرند. به همین دلیل، سیاست عمومی باید امکان تنظیمات متفاوت را هم فراهم کند.
این قاعده به معنای بسته شدن همهٔ صفحات اینترنت برای هوش مصنوعی نیست. مالک سایت میتواند طبق تنظیمات خود اجازه یا محدودیت تعیین کند. هدف Cloudflare ارائهٔ کنترل متمرکز در سطح شبکه است تا مدیر مجبور نباشد برای هر ربات قانون جداگانه بنویسد. مدیر سایت باید بداند هر انتخاب چه اثری بر جستوجو، آموزش، خلاصهسازی و عاملها دارد. تنظیم نادرست ممکن است باعث شود صفحه در نتایج جستوجو ناپدید شود یا برعکس، محتوای آن بدون جبران اقتصادی در اختیار سامانههای دیگر قرار گیرد.
مدل پرداخت برای استفاده از محتوا
Cloudflare همچنین مدل Pay Per Crawl را با نام Pay Per Use توضیح داده است. ایدهٔ اصلی این است که ناشر فقط برای ورود خزنده پول نگیرد، بلکه هنگامی که محتوای او در پاسخ هوش مصنوعی استفاده میشود، امکان دریافت هزینه داشته باشد. چنین مدلی میتواند مسیر تازهای برای درآمد ایجاد کند، اما اجرای آن به ثبت دقیق منبع، اندازهگیری استفاده و توافق میان طرفین نیاز دارد. باید مشخص شود یک جملهٔ نقلشده، یک خلاصهٔ چندصدکلمهای یا یک پاسخ تولیدشده بر پایهٔ چند صفحه چگونه قیمتگذاری میشود. ناشر باید مطمئن باشد اطلاعات مصرف بهدرستی گزارش میشود.
مدل پرداختی در صورتی جذاب است که برای هر دو طرف هزینهٔ عملیاتی قابل قبول داشته باشد. یک سامانهٔ هوش مصنوعی ممکن است در هر پاسخ چندین منبع را بررسی کند و اگر مذاکره با هر سایت جداگانه انجام شود، پیچیدگی زیادی شکل میگیرد. یک شبکهٔ واسط میتواند قرارداد، احراز هویت و صورتحساب را سادهتر کند، اما در این حالت اعتماد به گزارش شبکه اهمیت مییابد. ناشر نیز ممکن است ترجیح دهد بهجای پرداخت به ازای هر استفاده، اشتراک یا قرارداد سالانه داشته باشد. هنوز روشن نیست کدام مدل در بازار غالب خواهد شد.
چالش شناسایی رباتها
یکی از مسائل فنی، تفکیک رباتهای شرکتهای بزرگ است. Googlebot برای جستوجو با Google-Extended برای کاربردهای هوش مصنوعی ارتباط دارد، اما ناشر باید بداند بستن یک شناسه دقیقاً کدام سرویس را تحت تأثیر میگذارد. اگر قوانین بیش از حد کلی نوشته شوند، ممکن است سایت بهطور ناخواسته از جستوجوی عادی حذف شود. اگر قوانین بیش از حد محدود باشند، محتوای آموزشی یا عاملهای ناخواسته همچنان دسترسی پیدا میکنند. مدیران فنی به گزارشهای قابل فهم نیاز دارند تا ببینند چه خزندهای، با چه هدفی و با چه حجمی درخواست فرستاده است.
فایل robots.txt مدتها ابزار اصلی اعلام ترجیح ناشر بوده است، اما ضمانت فنی مطلق ایجاد نمیکند. ربات معتبر میتواند قانون را رعایت کند، ولی ربات ناشناس ممکن است آن را نادیده بگیرد. Cloudflare در سطح درخواست شبکه قادر است الگو، نشانی، نرخ درخواست و نشانههای رفتاری را هم بررسی کند. این روش کنترل بیشتری میدهد، اما احتمال خطای مثبت نیز وجود دارد. اگر یک کاربر واقعی یا سرویس مشروع شبیه خزنده دیده شود، نباید بهاشتباه مسدود شود. توازن میان امنیت، دسترسی و حفظ بازدید به تنظیم دقیق نیاز دارد.
اثر بر ناشران و کسبوکارها
ناشران خبری، وبلاگهای تخصصی، فروشگاههای اینترنتی و پایگاههای آموزشی هرکدام هدف متفاوتی دارند. یک سایت خبری ممکن است بخواهد نام و خلاصهٔ مطلب در پاسخ مدل دیده شود تا مخاطب جدید جذب کند، اما سایت دیگری به درآمد اشتراک وابسته باشد و استخراج متن را محدود کند. فروشگاه شاید اجازه دهد مشخصات محصول خوانده شود، ولی قیمت و موجودی را فقط از مسیر رسمی ارائه دهد. سیاست جدید میتواند این تفاوتها را شفافتر کند، بهشرط آنکه تنظیمات و گزارشها برای مدیر غیرمتخصص نیز قابل فهم باشند.
برای شرکتهای هوش مصنوعی، تغییر سیاست به معنای هزینه و ریسک بیشتر برای گردآوری داده است. آنها ممکن است به سراغ قرارداد مستقیم با ناشران، دادههای دارای مجوز یا منابع عمومی بروند. این کار میتواند کیفیت داده و رابطهٔ تجاری را بهتر کند، اما سرعت پوشش وب را کاهش دهد. شرکتهای کوچکتر نیز شاید توان مذاکره با هزاران ناشر را نداشته باشند. در نتیجه، بازار احتمالاً به سمت واسطههای محتوا، استانداردهای مشترک و قراردادهای دستهجمعی حرکت خواهد کرد.
آیندهٔ وب
اگر تعداد بیشتری از شبکههای تحویل محتوا سیاست مشابهی اجرا کنند، وب به محیطی با دسترسیهای لایهای تبدیل میشود. یک صفحه ممکن است برای کاربر عادی و موتور جستوجو باز باشد، برای آموزش مدل بسته باشد و برای عامل خرید تنها بخشی از داده را نشان دهد. چنین تفکیکی میتواند کنترل ناشر را افزایش دهد، اما توسعهدهندگان باید استانداردهای روشن برای اعلام هدف خزنده داشته باشند. بدون استاندارد مشترک، هر سایت قانون و شناسهٔ جداگانهای خواهد داشت و مدیریت آن دشوار میشود.
تصمیم Cloudflare نشان میدهد اختلاف میان ارزش محتوا و ارزش توزیع آن وارد مرحلهٔ فنی و تجاری تازهای شده است. ناشر میخواهد در اکوسیستم پاسخهای هوش مصنوعی حضور داشته باشد، اما نمیخواهد کنترل و درآمدش ناپدید شود. Cloudflare با پیشفرض تازه و مدل Pay Per Use تلاش میکند این انتخاب را به تنظیمات شبکه و بازار پرداخت تبدیل کند. نتیجهٔ واقعی زمانی روشن میشود که ناشران و شرکتهای هوش مصنوعی از آن استفاده کنند و مشخص شود آیا محدودیتها بازدید را کم میکنند یا به قراردادهای پایدارتر میانجامند.
تاریخ انتشار: ۲۴ شهریور ۱۴۰۵
منبع: Engadget



