4

NYT поймала OpenAI на скрытых уликах — Anthropic и Meta уже прошли этот путь⁠⁠

NYT поймала OpenAI на скрытых уликах — Anthropic и Meta уже прошли этот путь

The New York Times и The Daily News заявили в суде, который тянется уже два года: OpenAI всё это время твердила, что технически не может искать в собственных данных для обучения ChatGPT — а на деле давно умела это делать.

На апрельском допросе инженер OpenAI по имени Винни Монако признал: компания вела внутренний поиск по тренировочному корпусу на предмет украденной журналистики. Более того, ещё до подачи иска NYT компания уже собрала базу примерно из 78 миллионов деперсонализированных диалогов ChatGPT — чтобы самой оценить, насколько активно продукт воспроизводит чужой контент. Параллельно работал инструмент «Project Giraffe» с bloom-фильтром, который отслеживал повторение защищённого текста в ответах модели — его запустили практически сразу после подачи иска.

Когда истцы запросили 120 миллионов логов переписок как доказательство, OpenAI отдала выборку в 20 миллионов записей — но с таким количеством редактур и купюр, что суд признал её непригодной для анализа. Теперь NYT и The Daily News просят судью признать эти логи ничтожными как доказательство, зачесть презумпцию массового копирования контента и обязать OpenAI оплатить судебные издержки за то, что пришлось столько добиваться этих данных.

В OpenAI обвинения отрицают. Представитель компании Дрю Пусатери заявил, что позиция истцов слабеет по мере рассмотрения дела, а вся эта возня с логами — попытка влезть в приватность миллионов пользователей, не имеющих отношения к делу.

Симметрия индустрии

История OpenAI — не изолированный случай, а очередная глава общей саги про то, как ИИ-компании обучали модели на чужом контенте.

Anthropic уже прошла этот путь до конца: в рамках дела Bartz v. Anthropic компания согласилась на $1,5 млрд — крупнейшее в истории США урегулирование по авторским правам. Суд установил, что Anthropic скачала свыше 7 млн книг с пиратских библиотек вроде LibGen и Pirate Library Mirror; итоговая выплата — около $3000 за каждую из примерно 500 000 книг, попавших под расчёт.

Meta* в июне 2025-го отбилась от иска Kadrey v. Meta по чисто техническому основанию — суд оценивал влияние на рынок, а не сам факт нарушения — но при этом прямо зафиксировал, что инженеры Meta торрентили книги с Library Genesis, Z-Library и Anna's Archive. В мае 2026-го компанию накрыл новый коллективный иск от издательств Elsevier, Cengage, Hachette, Macmillan и McGraw Hill — снова про торренты пиратских книг для обучения Llama.

Три ведущие AI-лаборатории, одна и та же схема — и три разные стадии расплаты: Anthropic уже заплатила рекордный штраф, Meta* вывернулась в суде технически, но огребает по новой, а OpenAI теперь обвиняют в попытке скрыть, что она знала о масштабе нарушений с самого начала.

🔗 Источник: TechCrunch

НЕЙРО-ПУШКА ● Новости и обзоры нейросетей

* Meta признана экстремистской организацией, её деятельность запрещена на территории РФ.

Искусственный интеллект

6.4K поста12.1K подписчиков

Правила сообщества

ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.


Разрешено:


- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.

- Делиться статьями, понятными большинству аудитории Пикабу.

- Делиться опытом создания моделей машинного обучения.

- Рассказывать, как работает та или иная фиговина в анализе данных.

- Век жить, век учиться.


Запрещено:


I) Невостребованный контент

  I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.

  I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.

  I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.


II) Нетематический контент

  II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.

  II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".

  II.3) Создавать контент, входящий в противоречие с правилами Пикабу.


III) Непотребный контент

  III.1) Эротика, порнография (даже с NSFW).

  III.2) Жесть.


За нарушение I - предупреждение

За нарушение II - предупреждение и перемещение поста в общую ленту

За нарушение III - бан

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества