NYT поймала OpenAI на скрытых уликах — Anthropic и Meta уже прошли этот путь
The New York Times и The Daily News заявили в суде, который тянется уже два года: OpenAI всё это время твердила, что технически не может искать в собственных данных для обучения ChatGPT — а на деле давно умела это делать.
На апрельском допросе инженер OpenAI по имени Винни Монако признал: компания вела внутренний поиск по тренировочному корпусу на предмет украденной журналистики. Более того, ещё до подачи иска NYT компания уже собрала базу примерно из 78 миллионов деперсонализированных диалогов ChatGPT — чтобы самой оценить, насколько активно продукт воспроизводит чужой контент. Параллельно работал инструмент «Project Giraffe» с bloom-фильтром, который отслеживал повторение защищённого текста в ответах модели — его запустили практически сразу после подачи иска.
Когда истцы запросили 120 миллионов логов переписок как доказательство, OpenAI отдала выборку в 20 миллионов записей — но с таким количеством редактур и купюр, что суд признал её непригодной для анализа. Теперь NYT и The Daily News просят судью признать эти логи ничтожными как доказательство, зачесть презумпцию массового копирования контента и обязать OpenAI оплатить судебные издержки за то, что пришлось столько добиваться этих данных.
В OpenAI обвинения отрицают. Представитель компании Дрю Пусатери заявил, что позиция истцов слабеет по мере рассмотрения дела, а вся эта возня с логами — попытка влезть в приватность миллионов пользователей, не имеющих отношения к делу.
Симметрия индустрии
История OpenAI — не изолированный случай, а очередная глава общей саги про то, как ИИ-компании обучали модели на чужом контенте.
Anthropic уже прошла этот путь до конца: в рамках дела Bartz v. Anthropic компания согласилась на $1,5 млрд — крупнейшее в истории США урегулирование по авторским правам. Суд установил, что Anthropic скачала свыше 7 млн книг с пиратских библиотек вроде LibGen и Pirate Library Mirror; итоговая выплата — около $3000 за каждую из примерно 500 000 книг, попавших под расчёт.
Meta* в июне 2025-го отбилась от иска Kadrey v. Meta по чисто техническому основанию — суд оценивал влияние на рынок, а не сам факт нарушения — но при этом прямо зафиксировал, что инженеры Meta торрентили книги с Library Genesis, Z-Library и Anna's Archive. В мае 2026-го компанию накрыл новый коллективный иск от издательств Elsevier, Cengage, Hachette, Macmillan и McGraw Hill — снова про торренты пиратских книг для обучения Llama.
Три ведущие AI-лаборатории, одна и та же схема — и три разные стадии расплаты: Anthropic уже заплатила рекордный штраф, Meta* вывернулась в суде технически, но огребает по новой, а OpenAI теперь обвиняют в попытке скрыть, что она знала о масштабе нарушений с самого начала.
* Meta признана экстремистской организацией, её деятельность запрещена на территории РФ.

Искусственный интеллект
6.4K поста12.1K подписчиков
Правила сообщества
ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.
Разрешено:
- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.
- Делиться статьями, понятными большинству аудитории Пикабу.
- Делиться опытом создания моделей машинного обучения.
- Рассказывать, как работает та или иная фиговина в анализе данных.
- Век жить, век учиться.
Запрещено:
I) Невостребованный контент
I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.
I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.
I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.
II) Нетематический контент
II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.
II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".
II.3) Создавать контент, входящий в противоречие с правилами Пикабу.
III) Непотребный контент
III.1) Эротика, порнография (даже с NSFW).
III.2) Жесть.
За нарушение I - предупреждение
За нарушение II - предупреждение и перемещение поста в общую ленту
За нарушение III - бан