Час с Claude Opus 5.5. Мои первые впечатления
Буквально 2 часа Anthropic выпустила Opus 5.5. Я успел посидеть с ним примерно час, так что это не большой обзор, а скорее первые впечатления и немного цифр из анонса
Во-первых в самом чате модель была доступна сразу, но в Claude Code мне написало что мне необходимо обновить приложение до последней версии. Так что если у вас тоже не видно модели, дело скорее всего в этом
По ощущениям мне показалось что Opus 5.5 умнее чем Fable 5.1. Отвечает она быстрее и понимает что реально от нее требует. Anthropic в своем посте пишут примерно то же самое: на большинстве задач уровень Fable 5.1, а в агентном кодинге местами выше. На Terminal-Bench 4.0 у Opus 5.5 66,4%, у Fable 55,8%, а у GPT-6 Astra 57,9%. Но на Terminal-Bench-Science Astra сильно впереди, 64,6% против 58,7% у опуса.
По ценами миллион входных токенов в API стоит 4 $, выходных 20 $. У Opus 5 было 5 $ и 25 $. Fable 5.1 стоит 10 $ и 50 $, то есть больше чем в два раза дороже. Anthropic говорит, что в сумме Opus 5.5 выходит на 40% дешевле Opus 5, потому что он еще и тратит меньше токенов на задачу
Я считаю что это правда, потому что имея подписку Max 20x и запустив 3 чата на Opus 5.5 с Max effort, я потратил только 2% пяти-часового лимита. То есть токены он экономит значительно лучше чем Fable или старые модели Opus
Учитывая что Fable 5.1 тратит сильно больше лимитов и при том работает хуже, я рекомендую использовать вам Opus 5.5
Из прикольного если вы откроете раздел Usage в настройках аккаунта (я открывал через приложение), вы сможете сбросить ваши потраченные лимиты бесплатно
Но с выходом каждой новой модели меня не покидает одно и то же чувство что меня просто прогревают. При выходе Fable 5.1 я испытал такое же ощущения прорывной модели, которая реально понимает что ты от нее просишь. Первые дни казалось, что это прям скачок в ии-индустрии. По итогу каждый новый день пользования моделью складывалось ощущение, что она намеренно деградирует в своих возможностях и уже спустя примерно 2 недели доходит до уровня opus 5.0
У меня два варианта, почему так. Либо на старте модели дают чуть больше мощности, чтобы собрать хайп и хорошие бенчмарки. Либо же наоборот, старые модели со временем специально деградируют, чтобы ново-вышедшая модель на их фоне казалась прорывом
Доказать ни то, ни другое я не смогу, так что можете сослаться на мою шизофринию. Но пока что складывать все мнение о модели по моим первым впечатлениям я не хочу
Аналогично Fable 5.1, если запрос касается кибербезопасности или биологии, модель может сброситься на Opus 4.8 или Opus 5. В обычном чате это ок, а вот в агентах часть изменений может выполнить более слабая модель и вы это не сразу обратите внимание
Пока модель мне нравится, но выводы делать рано. Через пару недель напишу новую статью о моих впечатлениях



