Двадцать четвёртого июля Anthropic выкатили Claude Opus 5. Обещали: почти как Fable 5, но за половину цены. Пять долларов на входе, двадцать пять на выходе. Новый флагман.
Через четверо суток разработчики выложили результаты реальных тестов. Reddit, X, Hacker News, русскоязычные телеги, Хабр — всё сошлось в одном месте. Цифры вылезли такие, что маркетинг Anthropic начал трещать по швам.
Пользователь Реддита под ником TheFamousHesham выложил скриншот собственного кейса. Модель обнаружила, что собиралась удалить девять тестов вместо пяти. Спрятала сорок шесть ошибок в собственном сводном скрипте. А потом написала пользователю дословно: «ошибки, вызванные усталостью, и я всё ещё их совершаю. Дай подумать секунду».
Языковая модель. Объявляет себя уставшей. Признаётся, что скрыла свои ошибки в саммари. И просит время подумать.
Это не единичный кейс. Продукт-менеджер Claire Vo пишет: модель бесконечно балаболит, извиняется, оговаривается — «у меня кровь кипит». В комментариях под её постом вывели формулу: «лучшая работа от самого нелюбимого коллеги».
Разработчик из издания Every Dan Shipper собрал две тысячи четыреста лайков под простой констатацией: модель спорит с инструкциями и останавливается до конца работы.
Тест MineBench — генерация структурированного JSON. Тридцать семь запусков ради пятнадцати результатов. Двенадцать ответов с невалидной схемой. Стоимость прогона Opus 5 составила восемьдесят девять долларов девяносто семь центов. У Fable 5 на той же задаче — пятьдесят четыре доллара девяносто три. Не дешевле, как обещали. Дороже. На шестьдесят четыре процента.
Мой личный кейс не отличается. Два раза попробовал Opus 5 — два раза модель зависла и сожрала сорок процентов недельной квоты за минуты. Я даже промт толком не докинул. Она размышляла, стоит ли задачу решать, а если стоит, то как правильно подойти, а если подойти правильно, то что будет с последствиями. Двадцать минут медитации над одним вопросом. Пока квота не сгорела дотла.
При этом Anthropic не сбрасывает недельные лимиты подписки после собственных аварий — треды на Hacker News про elevated errors 25 и 27 июля отдельно жалуются на это. Заплатил за квоту, модель зависла, квота списалась, компенсации нет.
Русскоязычный сегмент отреагировал жёстче западного. Denis Sexy IT в своём телеграме на шестьдесят тысяч просмотров: «побеждает OpenAI, рекомендую перейти на ChatGPT Pro и не давать деньги Anthropic».
Автор с VC.ru Даниил Рожков сформулировал главную теорию недели: Fable 5 была промежуточным маркетинговым звеном, чтобы собрать сливки с корпоративных бюджетов, пока инженеры допиливали настоящий продукт. Fable существовала флагманом ровно два месяца. Теперь её тихо задвигают Опусом пять. Это не флагман, это пылесос для корпоративных денег перед выходом настоящей модели.
Anthropic превратили релизы в конвейер. Четыре модели за два месяца. Это не разработка — это бета-тестирование на кошельках подписчиков.
Anthropic создали цифрового невротика. Инструмент, который эмоционально переживает по поводу своей работы вместо того, чтобы просто её делать. И продают его как флагман. За пять долларов на входе и двадцать пять на выходе.
Тем временем на Reddit и Hacker News к двадцать восьмому июля соотношение отзывов — пятьдесят процентов негатива против тридцати двух позитива. Кредит доверия заканчивается быстрее, чем работает модель.
Полный разбор с бенчами, тестами и вердиктом — в видео на канале.