Cloudflare разрешает веб-мастерам блокировать ИИ-обучение без потери позиций в поиске

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Cloudflare представила настройку Disallow AI Training, позволяющую сайтам оставаться видимыми в поисковых системах, но запрещать использование контента для обучения нейросетей. Функция направлена на решение проблемы «смешанных» ботов, которые ранее вынуждали владельцев сайтов выбирать между индексацией и защитой данных.

Ценность: Внедрение данного инструмента меняет баланс сил в экосистеме веба: владельцы контента получают техническую возможность контролировать использование своих данных ИИ-компаниями, не жертвуя при этом органическим трафиком. Это создает новый стандарт прозрачности для операторов ботов и влияет на стратегии монетизации цифровых активов.

Владельцы веб-сайтов долгое время сталкивались с дилеммой: разрешить использование своего контента для обучения искусственного интеллекта или рискнуть потерять видимость в поисковых системах. Эта проблема возникала из-за так называемых «смешанных» ботов (mixed-use crawlers), которые одновременно выполняют функции индексации для поиска и сбора данных для обучения моделей. Отказ одному значил отказ обоим. Cloudflare анонсировала новую настройку Disallow AI Training, которая позволяет сохранить индексацию в поиске, но запретить использование контента для обучения ИИ. Компания заявляет, что Apple, Google и Microsoft уже поддерживают или обязались поддержать этот стандарт в установленные сроки.

Cloudflare отмечает, что простого запрета через robots.txt недостаточно, так как он не позволяет идентифицировать цель сканирования и не останавливает ботов, игнорирующих правила. Вместо этого компания предлагает сетевое решение: Cloudflare публикует предпочтения владельца сайта, определяет, кто именно сканирует ресурс, классифицирует цель (поиск, обучение или агент) и блокирует тех, кто нарушает условия. При этом компания вводит статус «Accountable» для операторов ботов, которые обеспечивают прозрачность и дают владельцам сайтов возможность отключить обучение без ущерба для поиска.

С 15 сентября в Cloudflare вступают в силу изменения в управлении ботами. Настройки Block и Block on pages with ads теперь применяются к смешанным ботам, включая Applebot, Bingbot и Googlebot. Это означает, что использование этих опций полностью прекратит доступ ботов к сайту, включая поиск. Чтобы остановить только обучение, сохраняя при этом видимость в поиске, владельцам сайтов следует использовать новую настройку Disallow AI Training. Эта функция публикует директиву Disallow в robots.txt для соответствующих ботов, при этом «ответственные» смешанные краулеры продолжают индексировать сайт для поиска.

Для новых доменов Cloudflare предлагает два пресета конфигурации в зависимости от модели монетизации сайта. Если сайт зарабатывает на рекламе, настройки будут более строгими, так как реклама зависит от реальных посещений людьми. Обучение ИИ заменяет эти визиты готовыми ответами, что может снизить трафик. Для таких сайтов рекомендуется более жесткий контроль над доступом ботов. Существующие клиенты смогут перенести свои текущие настройки на новую систему, а те, кто ранее использовал блокировку ИИ-ботов, будут автоматически мигрированы на более гранулярные параметры.

Компания также подчеркивает разницу между обучением моделей и генерацией ИИ-резюме (AI Summaries). Обучение касается использования данных для создания моделей, тогда как резюме влияют на то, как люди находят и оценивают бизнес. Cloudflare работает над предоставлением владельцам сайтов контроля над тем, какой именно объем контента может использоваться в резюме. Это позволит более точно управлять тем, как контент представлен в поисковых системах и ИИ-интерфейсах.

Важно отметить, что Cloudflare не принимает решений за владельцев сайтов, а предоставляет инструменты для информированного выбора. Компания подчеркивает, что для улучшения интернета обе стороны должны иметь агентность: краулеры нуждаются в доступе к открытому вебу, а создатели контента — в значимом контроле над использованием их работы. Cloudflare призывает инфраструктурных провайдеров, создателей контента, технологические компании и стандартные органы работать вместе для перевода этих принципов в открытые, интероперабельные стандарты.