3

На сайтах можно будет блокировать ИИ-ботов

Новость про Cloudflare перепостили, перевели и опубликовали все кому не лень, а прокомментировать почему-то никто не взялся. А тема-то важная. И, что интересно, совсем не новая.

Эти разговоры ходили ещё года полтора назад, задолго до нынешнего анонса. Тогда все носились с форматом llms.txt — файлик, которым сайт как бы просил обучающих ботов не лезть. Работал он, мягко говоря, никак. Но сам запрос был виден уже тогда: владельцы сайтов не в восторге от того, что нейронки съедают их контент и потом спокойно раздают его в своих ответах.

Почему это вообще проблема

Одно дело — когда тебя проиндексировал поисковый бот и потом где-то процитировал: в обычной выдаче или в ИИ-ответе, но со ссылкой на твой сайт. Это дополнительный трафик. А трафик автору нужен как воздух, потому что вся монетизация живёт на сайте: реклама, подписки, свои продукты, нативка, партнёрские ссылки. Способов куча, но для любого нужен свой трафик на своей площадке. Поэтому поисковых ботов почти никто не блокирует — по оценке самого Cloudflare, меньше 1% сайтов.

Совсем другое дело — когда нейронка сожрала твой материал и вываливает всю фактуру, все выводы прямо у себя в окне. Может, тебя даже упомянет как автора. Но без ссылки. Без перехода. Просто "есть такое мнение". И всё, над чем ты пыжился-мурыжился — писал, собирал по крупицам многолетний опыт, чтобы поделиться с читателями и как-то на этом заработать, — модель отдаёт бесплатно. Задаром.

Вот отсюда и разница в цифрах. Поиск блокирует меньше 1% сайтов, а обучение — уже как минимум 17%. Далеко не все, конечно. Но это люди, которые очень захотели и нашли способ, а способы там неочевидные, на поверхности не лежат. И дальше это будет только расти.

Кто на самом деле тормозил

Самое интересное: проблема все эти годы была не в сайтах, а в тех, кто делает нейросети.

Им-то как раз позарез нужно обучать модели на свежем человеческом тексте. Не будет живого материала — модель начинает тупеть, причём стремительно. И это уже видно невооружённым глазом: интернет заваливает нейроконтентом, и модели всё чаще жуют трижды пересказанные идеи. Змея кусает свой хвост.

Получается забавный расклад. Одной рукой ИИ-компании хотят всё больше живого человеческого контента — иначе их модели деградируют. А другой рукой те же компании должны придумать, как успокоить владельцев сайтов: пустить поискового бота и не пустить обучающего. Тот самый llms.txt и должен был это разрулить, но не разрулил — половина провайдеров просто забила на его поддержку.

Что сделал Cloudflare

Cloudflare — это, на минуточку, больше 20% сайтов по всему миру. И он заявляет, что договорился с большинством крупных игроков: они теперь честно делят своих ботов на поисковых и обучающих и слушаются директив. Google и Apple под условия уже подходят, Microsoft обещает подтянуться в начале 2027-го. Для владельца сайта это выглядит как один переключатель: поиск оставляем, обучение закрываем.

И вот тут спрятана главная мысль. Cloudflare просто решил закрыть потребность, которая на рынке всё заметнее и будет только расти. Нейровыдача меняет уже не только то, как продвигаются, но и саму манеру, в которой люди ищут, — так что желание "в поиск пускать, а в обучение нет" будет только крепнуть. 17% против 1% — это не про технологию, это про спрос, который был всегда, просто до сих пор было нечем его закрыть.

А теперь ложка дёгтя

Разделить ботов механически сами мы никогда не могли. Один и тот же бот заходит на сайт сразу с двумя задачами — и для поиска, и для обучения. Ни по названию бота, ни по IP их не растащишь. Значит, вся конструкция держится на честном слове операторов. Захотят соблюдать — будут. Не захотят — а кто проверит?

Но даже не это главное. Контент утягивают не только сами модели. Есть тьма парсеров, которые тупо копируют твой текст и бесплатно выкладывают у себя. Я как автор сталкиваюсь с этим постоянно: каждая публикация через день всплывает на трёх, пяти, десяти чужих сайтах. И вот вопрос — будут ли те сайты закрываться от обучающих ботов? Да с чего бы. То есть мой материал модель не возьмёт с моего сайта, зато спокойно возьмёт с чужого.

Куда всё катится

При этом сам разворот мне нравится. Недавно ведь была история, что Google начал платить издателям за использование их контента в ответах нейросетей — пока в тестовом режиме, но это по сути тот же разговор — рынок пытается нащупать баланс: без живого человеческого текста модели тупеют, а человеку должно быть выгодно этот текст отдавать.

Нейросети позарез нужен тот, кому есть что сказать. На пустом пересказе пересказа она "задыхается". В сухом остатке ценность остаётся у авторов, способных передавать смысл, опыт и фактуру, а не у контент-мельниц, которые штампуют пустоту.

Искусственный интеллект

6.4K постов12.1K подписчиков

Правила сообщества

ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.


Разрешено:


- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.

- Делиться статьями, понятными большинству аудитории Пикабу.

- Делиться опытом создания моделей машинного обучения.

- Рассказывать, как работает та или иная фиговина в анализе данных.

- Век жить, век учиться.


Запрещено:


I) Невостребованный контент

  I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.

  I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.

  I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.


II) Нетематический контент

  II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.

  II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".

  II.3) Создавать контент, входящий в противоречие с правилами Пикабу.


III) Непотребный контент

  III.1) Эротика, порнография (даже с NSFW).

  III.2) Жесть.


За нарушение I - предупреждение

За нарушение II - предупреждение и перемещение поста в общую ленту

За нарушение III - бан

0
Автор поста оценил этот комментарий

Три типа ИИ-ботов

Обучающие боты - GPTBot, ClaudeBot, Google-Extended - Можно закрыть — прямой отдачи нет

Поиск / индексация для ИИ-ответов - OAI-SearchBot, PerplexityBot - Оставить открытым — это трафик

Заход по запросу человека - ChatGPT-User, Claude-User - Обязательно открыть — это живой клиент


По типу сайтов

Магазины, услуги, сайты-визитки — не закрывать (максимум убрать обучающих ботов). Трафик важнее контента.
Медиа, базы знаний, авторские тексты, платный контент — закрывать обучение, оставлять поиск.

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества