Книгам срезают корешки и пускают под нож. Так учили нейросеть Claude
Хотите обучать ИИ, следуя букве закона? Уничтожайте бумажные книги! Федеральный судья Уильям Алсуп, разбирая иск авторов к компании Anthropic, разработчику ИИ Claude, постановил: купленный бумажный экземпляр перевели в цифру ради возможности поиска и экономии места, а оригинал уничтожили — как итог одна копия заменила другую. Оставь компания бумагу на складе, у нее оказалось бы две копии одной книги — пиратское копирование. Пустила под нож — осталась одна, и это добросовестное использование, когда чужой текст можно использовать без разрешения автора.
Механику описали судебные документы и расследование The Washington Post. Внутри компании проект назывался "Проект Панама". Книги скупали оптом у продавцов подержанного — американского Better World Books и британского World of Books, партиями до десятков тысяч. Дальше гидравлический пресс срезал переплет, страницы прогоняли через промышленный сканер, а бумагу отправляли в утиль. Руководил проектом Том Харви, до этого работавший над Google Books, и в судебном решении его задача сформулирована как получить "все книги мира". Итоговое число книг и сумма расходов в документах скрыты.
Интересно, что одновременно Anthropic заплатила полтора миллиарда долларов по другому делу — авторам около семи миллионов книг, скачанных из пиратских библиотек. Обучение ИИ на них так же не запрещалось, но вот скачивание пиратских копий назвали нарушением. Купленные и разрезанные книги претензией суд не счел.
Через полгода после публикации судебных документов история продолжилась в почте живых людей. Букинист Питер де Врис из Харлема получил письмо от женщины, представившейся сотрудницей компании 2077AI: таблица на 3001 позицию, просьба посчитать стоимость и доставку в Китай. Де Врис торгует старыми и редкими книгами поштучно — по его словам, заказы по почте приходят редко и максимум на одну книгу. Три тысячи позиций оптом в такой лавке не бывает, поэтому письмо он не дочитал и удалил как спам. О том, при чем тут ИИ, узнал через несколько недель от журналиста: "Я был в шоке".
В таблице стояли книги 2020-2021 годов от академических издательств — Elsevier, Wiley, Routledge, Oxford University Press: инженерия, медицина, педагогика, госуправление. Год издания тут важнее темы. ChatGPT вышел в конце 2022 года, и все напечатанное до него заведомо написано человеком, а текст из сети сегодня все труднее отличить от сгенерированного. Бумага 2021 года — это гарантия чистоты, за которую готовы платить.
Сам де Врис отделался удаленным письмом, но заметил: у тех, кто торгует подержанными книгами оптом, история могла закончиться иначе — такой заказ выполним, и на полку эти экземпляры уже не вернутся. Академические издания выходят небольшими тиражами и допечатываются редко. Такие же письма получили другие голландские антиквары, похожие репортажи вышли в Германии и Швейцарии. В июле издание 404 Media описало сервис ISBNdb — компанию, которая ведет базу номеров с книжных штрихкодов и предлагала подбирать для ИИ-лабораторий партии от тысячи до миллиона бумажных книг.
Стороны отвечают по-разному. Anthropic заявляет, что покупает книги на обычном коммерческом рынке и что ни одна из ее программ не скупает и не уничтожает редкие и антикварные издания. ISBNdb сообщила, что сервис так и не запустили, книг для ИИ-компаний не покупали и не сканировали, а страницы на сайте убрали, потому что они описывали идею, а не работающий бизнес. Канадская Zoom Books, всплывшая в швейцарском репортаже, объясняет закупки своей обычной моделью торговли и переработки. 2077AI на запросы не ответила.
Илон Маск написал, что попросил свою команду сохранять редкие книги и сканировать их трудным способом, не срезая корешок. Инвестор Майкл Бьюрри отозвался о практике словами "воплощенное зло".
Бережное сканирование — планшетные и V-образные сканеры, на которых оцифровывают библиотеки, — существует десятилетиями. Оно просто медленнее и дороже. Закон в его нынешнем прочтении поощряет ту версию оцифровки, после которой бумажный экземпляр на полку не возвращается.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Искусственный интеллект
6.1K пост12K подписчиков
Правила сообщества
ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.
Разрешено:
- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.
- Делиться статьями, понятными большинству аудитории Пикабу.
- Делиться опытом создания моделей машинного обучения.
- Рассказывать, как работает та или иная фиговина в анализе данных.
- Век жить, век учиться.
Запрещено:
I) Невостребованный контент
I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.
I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.
I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.
II) Нетематический контент
II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.
II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".
II.3) Создавать контент, входящий в противоречие с правилами Пикабу.
III) Непотребный контент
III.1) Эротика, порнография (даже с NSFW).
III.2) Жесть.
За нарушение I - предупреждение
За нарушение II - предупреждение и перемещение поста в общую ленту
За нарушение III - бан