Anthropic выпустила Claude Sonnet 5.5: почти Opus за полцены и 142 токена в секунду
28 сентября Anthropic выпустила Claude Sonnet 5.5, вторую модель семейства 5.5 после Opus 5.5. Цена осталась как у Sonnet 5: 2 доллара за миллион входных токенов и 10 за миллион выходных, это вдвое дешевле Opus 5.5. По бенчмаркам Anthropic модель отстаёт от флагмана на 1–3 пункта, а на Terminal-Bench его обгоняет. По замерам Artificial Analysis это самая быстрая модель верхнего эшелона.
Бенчмарки Anthropic (Sonnet 5.5 / Sonnet 5 / Opus 5.5)
Terminal-Bench 4.0: 70,6% / 10,3% / 66,4%
FrontierCode 1.1: 46,2% / 42,4% / 54,4% (GPT-6 Sol: 49,3%)
CursorBench 4.0: 55,5% / 34,1% / 57,8%
OSWorld 2.1: 80,1% / 57,0% / 81,8%
Humanity's Last Exam: 64,5% / 54,9% / 67,7%
Chartography: 61,6% / 15,6% / 64,4% (GPT-6 Sol: 53,6%)
GDPval-AA v2.1: 1844 / 1449 / 1846 (GPT-6 Sol: 1487)
Заметно Sonnet 5.5 отстаёт от Opus только на FrontierCode. Разрыв с Sonnet 5 на Terminal-Bench подозрительно велик: независимый замер Artificial Analysis дал Sonnet 5.5 на этом тесте 64%.
Независимый замер: второе место в индексе
В Intelligence Index от Artificial Analysis у Sonnet 5.5 на усилии max 56 баллов. Это второе место, в 2 пунктах от Opus 5.5. По скорости и цене прогона одной задачи среди топ-моделей расклад такой:
Opus 5.5: индекс 58, 95 ток/с, 5,98 доллара за задачу
Sonnet 5.5: индекс 56, 142 ток/с, 7,60 доллара
Fable 5.1: индекс 53, 69 ток/с, 7,63 доллара
GPT-6 Astra: индекс 53, 64 ток/с, 3,26 доллара
GPT-6 Sol: индекс 48, 90 ток/с, 1,06 доллара
Grok 4.7: индекс 46, 82 ток/с, 3,74 доллара
Подвох в расходе: на max модель тратит около 193 тысяч выходных токенов на задачу, и это рекорд Artificial Analysis. Выходит на 60% больше, чем у Opus 5.5, поэтому задача на Sonnet в этом режиме обходится дороже.
Против флеш-моделей
Sonnet 5.5 не флеш-модель, Haiku 5.5 обещают «в ближайшие недели». Но сравнить с быстрыми моделями полезно (индекс Artificial Analysis, скорость, цена одной задачи):
Sonnet 5.5 (max): 56, 142 ток/с, 7,60 доллара
Sonnet 5.5 (medium): 41, 111 ток/с, 0,59 доллара
GLM-5.3-Flash: 42, 52 ток/с, 0,25 доллара
Gemini 3.8 Flash: 41, 251 ток/с, 1,24 доллара
Qwen3.8-Flash-Next: 40, 58 ток/с, 0,37 доллара
DeepSeek V4.1 Flash: 39, 220 ток/с, 0,27 доллара
MiMo-V2.6-Flash: 38, 58 ток/с, 0,06 доллара
GPT-6 Luna: 37, 163 ток/с, 0,07 доллара
Gemini 3.5 Flash-Lite: 22, 320 ток/с, 0,12 доллара
Claude Haiku 4.5: 17, 87 ток/с, 0,28 доллара
Mercury 2.5: 12, 762 ток/с, 0,12 доллара
По уму Sonnet 5.5 на max опережает любую флеш-модель минимум на 14 пунктов. Со скоростью всё неоднозначно. Gemini 3.8 Flash и DeepSeek быстрее его в полтора-два раза. А китайские GLM, Qwen и MiMo Flash, хоть и почти догнали Gemini по индексу, выдают всего 52–58 токенов в секунду: это в 2,5 раза медленнее Sonnet. По цене флешки вне конкуренции: Luna и MiMo решают задачу за 6–7 центов.
Самое интересное сравнение: Sonnet 5.5 на среднем усилии и Gemini 3.8 Flash на высоком. У обоих индекс 41. Gemini вдвое быстрее, но задача на Sonnet вдвое дешевле (59 центов против 1,24 доллара), потому что флешка Google тратит слишком много токенов на рассуждения.
Быстрого Grok в списке нет, потому что замерять нечего. Grok 4.7 Fast, по словам xAI, вдвое быстрее и вдвое дороже обычного Grok 4.7 (82 ток/с), но работает только в Cursor и Grok Build. В публичном API его нет, независимых замеров тоже.
Почему это важно
Разрыв между Sonnet и Opus почти пропал. Если заменить Opus 5.5 на Sonnet 5.5, большинство команд получат то же качество с половинной ценой токена и в полтора раза большей скоростью, если не выставлять усилие max без нужды. Контекст 1 млн токенов, модель доступна в приложениях Claude, в API и в облаках AWS, Google Cloud и Azure.
Источники: Anthropic, Artificial Analysis, VentureBeat
Самая бесполезная работа
#ИИ #юмор #работа #спасатель #мемы #яЕщёНаРаботе
«И увидел я дела, которые делаются под солнцем. И вот — спасатель сидит у воды, и вода сия есть. И нет ему работы, ибо все плывут сами. И сказал я: суета сует и томление духа.»
— Екклесиаст, 1:14. Почти 😀😀
«I have seen all the things that are done under the sun; all of them are meaningless, a chasing after the wind.» Ecclesiastes 1:14
«Я еще на работе»
Ответ trapwalker в «Рабочих Tesla попросили обучать робота, который их заменит. Часть отказалась»3
Вот картинка от ИИ с юмором.
Ну а если серьезно, то задумайтесь - какую профессию ИИ не сможет заменить в ближайшем будущем?
Если пришлось думать больше минуты - у меня для вас плохие новости.
Пока вы выбираете профессию, ИИ уже изучает эту профессию, проходит стажировку.
Я в ИТ уже довольно давно работаю и видел как многие профессии заменяет\упрощает эта сфера, но мне впервые боязно смотреть на будущее, где есть ИИ, не зря ведь и Маск и Гейтс предупреждают о его опасности.
Бизнес (владельцы компаний, фирм и прочих) заинтересован в бесплатной 24\7 раб.силы.
Военные и политики в тотальным контроле над людьми. ИИ в этом сильно поможет.
Вполне возможно что и смартфоны, компьютеры перестанут быть в привычном нам виде, а будут в глазах или в мозгу (в виде чипа, имплантов) и в мире будет 8 млрд. камер наблюдений и ушей. И мало кто будет против, мы уже добровольно передали свои отпечатки пальцев, лица, данные местоположения, фото и т.д.
С радостью примем и такие удобства.
Алиса на марше
Натравил Алису собрать все мои публикации. Получилось несовершенно, но общее представление дает.
Анализ публикационной активности Александра Милицкого (1997–2025)
Площадки и объёмы
Компьютерра 1997–2010 ~54 статьи телеком, провайдеры, технологии, социум
«Вебпланета» (webplanet.ru)2004/2005–2009 15–30+ статей (5 подтверждено) телеком, провайдеры, критика отраслевой аналитики, вино
«Сетевой журнал» (setevoi.ru)2003 7+ статей кризис-менеджмент в телекоме (цикл из 5 частей), качество IP-услуг, тарифообразование
«Профиль» (profile.ru)2012 1+ статьявидеонаблюдение за выборами, госконтракты в телекоме
«Итоги» (itogi.ru)?упомянуто автором не найдено в архивах
«Московские новости» (mn.ru)? упомянуто автором не найдено в архивах; по профилю издания — вероятно, телеком/IT
«Известия»? упомянуто автором—
ProviderNet.ru (НОП)1999–2014~20 статейэкономика провайдеров, IPTV, регулирование
Slon.ru апрель–июль+ 2010 80–120+ постов (9 подтверждено)интернет-регулирование, кибербезопасность, Web 2.0, ИКТ в госуправлении, провайдеры, госпоиск
Nag.ru 2010–2011 4 статьи + активность на форуме B2B/B2C тарифообразование, копирайт и контент, налоги на провайдеров, видеонаблюдение
ИА REGNUM 2007–2019 ~10 статей связь, вино, экология
РИДУС 2019–2025 20 статей оружие, самооборона, экология, пандемия
Life.ru 2017–2019 22 статьи космос, вино, алкоголь
Пикабу июль 2024 — наст. 189 постов (78 в горячем) оружие, самооборона, охота, кино, ностальгия, политика, кулинария
Дзен 2024+ 20+ постов (дублирование Пикабу) вино, оружие, охота
ЖЖ (sanches.livejournal.com)2001–2020+ ~4137 постов вино, оружие, политика, телеком, сатира
Журнал сетевых решений/LAN 2002, 2012 ~3 статьи рынок провайдеров, кризис телекома
Коммерсантъ Секрет Фирмы 2002 1 статья домовые сети, Ethernet
Коммерсантъ Деньги 2009 1 статья нишевые соцсети, винный портал «Гроздь»
Журнал ИКС 2008 1 статья«Широкополосная сага о доступе»
CNews 2002–2019 ~10 публикаций новости телекома, NetByNet
Вокруг Света 2010 1 статья кометы, астрономия
Комсомольская правда 2017–2018 ~3 статьи оружие, самооборона, транспорт
Грозди.Ру 2009–2026 сайт-проект винный портал, главный редактор
Газета.Ru 1999, 2009 2 статьи интернет-конфликты
Tут есть к чему стремиться (многое не нашла), — но в целом инструмент впечатляющий.
Проверку тарифов на воду и канализацию доверят ИИ. Но пока только в Подмосковье
Комитет по ценам и тарифам Московской области вместе с Мингосуправления региона запустил специальный ИИ-модуль. Нейросеть возьмет на себя всю черновую работу по проверке документов и обоснований цен на водоснабжение и канализацию. В ведомстве рассчитывают, что это избавит экспертов от рутины, ускорит процесс и поможет избежать ошибок на первом этапе.
Конец бумажной рутины
Каждый год ведомству приходится утверждать больше 750 тарифов для 372 ресурсоснабжающих организаций региона (бедняжечки). Чтобы обосновать свои цены, коммунальщики загружают через Госуслуги огромные пакеты документов и расчетов.
Раньше эксперты комитета проверяли всё это вручную: часами вычитывали сканы, сверяли цифры и вылавливали нестыковки. Если какой-то бумаги не хватало или копия была смазанной, приходилось тратить время, оформлять запросы и ждать ответа.
Робот разберет даже плохой почерк
Теперь всю механическую работу отдали нейросети. Робот сканирует и распознает документы еще до того, как они попадут на стол к человеку. Система легко справляется с размытыми фотографиями, плохими копиями и даже с текстом, написанным от руки. Если в пакете документов чего-то не хватает или внутри закралась ошибка, ИИ предупредит проверяющего.
Председатель комитета Олег Толмачев объяснил, что передача первичной сверки машине позволит людям заняться по-настоящему важными вещами — глубокой аналитикой и расчетом справедливых тарифов. В ведомстве обещают, что благодаря цифровизации весь процесс станет прозрачнее, а жители региона (наконец-то) смогут увериться, что цены на воду не берутся с потолка.
Верим?






