1

Claude Opus 5 против Kimi K3: что выбрать

Claude Opus 5 и Kimi K3 вышли с разницей в неделю: у обеих контекст 1 млн токенов и ставка на код и агентов. Разбираем, где сравнение честное (GPQA Diamond 93,2 против 93,5), где цифры несопоставимы и кому какая модель подойдёт. Обе — в одном окне чата.

Claude Opus 5 и Kimi K3 — две топовые модели июля 2026 года с контекстом в 1 000 000 токенов, и обе сильны в программировании и агентных задачах. Claude Opus 5 (Anthropic, 23 июля 2026) — проприетарный флагман с «мышлением», включённым по умолчанию, и первым местом (85,88 балла) в сводном рейтинге независимого агрегатора из 215 моделей. Kimi K3 (MoonshotAI, 16 июля 2026) — одна из крупнейших открытых моделей: 2,8 трлн параметров в архитектуре MoE и первое место в Arena Frontend Code. Напрямую сопоставить их можно всего по двум одноимённым тестам: GPQA Diamond (93,2 у Opus 5 против 93,5 у Kimi K3) и BrowseComp (90,8 против 91,2), причём замеры выполнялись разными сторонами. Обе модели работают в одном окне чата СуперИнтеллекта — из России, без VPN и зарубежной карты.


Коротко о главном
• Claude Opus 5 — флагман Anthropic: «мышление» по умолчанию, пять уровней усилий, 1-е место (85,88) в сводном рейтинге агрегатора из 215 моделей.
• Kimi K3 — одна из крупнейших открытых моделей MoonshotAI: 2,8 трлн параметров (MoE), 1-е место в Arena Frontend Code.
• Контекст 1 000 000 токенов — у обеих.
• Прямое сравнение корректно только по GPQA Diamond (93,2 против 93,5) и BrowseComp (90,8 против 91,2), с оговоркой о разных замерах.
• Проверить обе на своей задаче можно в одном чате: начать бесплатно


Claude Opus 5 и Kimi K3: в чём принципиальная разница?

Между релизами прошла неделя, и целятся модели в одну аудиторию: разработчики, аналитики, авторы агентных сценариев. Совпадений много — миллион токенов контекста, ставка на код и автономную работу с инструментами. Разница проходит по трём линиям. Первая — доступ к весам: Kimi K3 открытая, Claude Opus 5 закрытый. Вторая — приоритет: Anthropic оптимизирует глубину и надёжность на длинной дистанции, MoonshotAI — масштаб модели и практическую силу в генерации кода. Третья — набор опубликованных замеров: у Opus 5 он заметно шире, что даёт больше точек опоры, но парадоксальным образом затрудняет честное сопоставление, потому что общих тестов у моделей всего два.

Что такое Claude Opus 5?

Claude Opus 5 — флагманская модель Anthropic, вышедшая 23 июля 2026 года. Ключевая особенность: «мышление» включено по умолчанию, а глубину рассуждения регулируют пять уровней усилий — low, medium, high, xhigh и max, по умолчанию high. Контекст равен 1 000 000 токенов, причём максимум стоит дефолтом: не нужно вручную расширять окно перед загрузкой большого репозитория или пакета документов. Вывод — до 128 000 токенов за ответ. На вход модель принимает текст, изображения и файлы, на выходе даёт только текст. В сводном рейтинге независимого агрегатора, ранжирующего 215 моделей, Opus 5 занимает первое место с 85,88 балла; следом идут Claude Mythos 5 (83,01), Claude Fable 5 (82,76) и GPT-5.6 Sol (81,46), а предыдущий флагман Claude Opus 4.8 — шестым с 77,44. Подробные разборы — в материалах обзор Claude Opus 5 и что умеет Claude Opus 5.

  • Контекст 1 000 000 токенов, по умолчанию равен максимуму; вывод — до 128 000 токенов

  • «Мышление» включено по умолчанию, пять уровней усилий: low, medium, high, xhigh, max (дефолт — high)

  • Вход: текст, изображения, файлы. Выход: только текст

  • Сильные стороны: глубокие рассуждения, агентное программирование и длинные задачи, ревью кода и поиск багов, длинный контекст, офисные задачи (таблицы, презентации), мультиагентные схемы writer-verifier, «зрение» по графикам, документам и вёрстке

  • Результаты по данным Anthropic и независимых замеров: SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, SWE-bench Multilingual 89,5%, BrowseComp 90,8%, Toolathlon 80,6%, GPQA Diamond 93,2%, ARC-AGI-2 90,4%, ARC-AGI-1 97,5%, MMMU-Pro 84,7%, HLE (с инструментами) 64,7%, IMO 2026 — 42 из 42

Что такое Kimi K3?

Kimi K3 — модель MoonshotAI, представленная 16 июля 2026 года, и одна из крупнейших открытых моделей на сегодня: 2,8 трлн параметров в архитектуре MoE (смесь экспертов), то есть на каждый запрос активируется лишь часть сети. Контекстное окно — 1 000 000 токенов. На платформе СуперИнтеллект Kimi K3 принимает текст и изображения. По данным разработчика и ранних независимых замеров: GPQA Diamond 93,5, BrowseComp 91,2, Terminal-Bench 88,3, а также первое место в Arena Frontend Code — рейтинге фронтенд-задач. Заявленные сильные стороны: код, агентные сценарии, длинный контекст.

  • 2,8 трлн параметров, архитектура MoE; открытая модель

  • Контекст 1 000 000 токенов

  • Вход на нашей платформе: текст и изображения. Выход: только текст

  • Сильные стороны: программирование (особенно фронтенд), агентные цепочки, работа с длинным контекстом

  • Результаты по данным разработчика и ранних замеров: GPQA Diamond 93,5, BrowseComp 91,2, Terminal-Bench 88,3, 1-е место в Arena Frontend Code

Таблица: чем отличаются Claude Opus 5 и Kimi K3

Обратите внимание на строки про вход и выход. Ни Opus 5, ни Kimi K3 не создают изображения, видео или звук — обе отвечают текстом, даже когда картинка была на входе. Для генерации визуала на платформе есть отдельный раздел МедиаЛаб. Путать эти вещи не стоит: иначе в ответ на просьбу «нарисуй» вы получите подробное словесное описание вместо самого изображения.

Какие бенчмарки Claude Opus 5 и Kimi K3 можно сравнивать напрямую?

Здесь начинается самая аккуратная часть сравнения. Цифры Opus 5 публикует Anthropic, часть подтверждают независимые замеры; цифры Kimi K3 идут от MoonshotAI и ранних сторонних прогонов. Это разные лаборатории, разные обвязки, разные настройки числа попыток и доступных модели инструментов. Сопоставлять корректно только одноимённые тесты, и даже в этом случае разрыв в доли процентного пункта ничего не доказывает. Общих тестов у наших героев в доступных публикациях ровно два: GPQA Diamond и BrowseComp.


Как читать таблицу ниже
Прямое сравнение допустимо только по строкам GPQA Diamond и BrowseComp — и то с оговоркой, что замеры выполнены разными сторонами и в разных условиях. Строки, где у одной модели есть число, а у другой прочерк, сравнением не являются. SWE-bench Pro у Opus 5 и Terminal-Bench у Kimi K3 измеряют разные вещи и друг в друга не переводятся — любой «пересчёт» одного в другой будет выдумкой.


Разница по GPQA Diamond — 0,3 процентного пункта в пользу Kimi K3, по BrowseComp — 0,4 пункта, тоже в её пользу. На таких дистанциях единственный честный вывод: по сложным научным вопросам и по многошаговому поиску в вебе модели идут вровень, и на вашем конкретном наборе задач лидер вполне может смениться. Практический смысл этих строк не в том, кто выше на 0,3 балла, а в том, что обе модели относятся к верхнему эшелону, а выбирать между ними придётся по другим критериям: формат задач, длина сессий, требования к предсказуемости.

Кто сильнее в коде: Claude Opus 5 или Kimi K3?

Агентное программирование и длинные задачи

У Claude Opus 5 опубликована самая полная линейка кодовых замеров: SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, SWE-bench Multilingual 89,5% и Toolathlon 80,6% (данные Anthropic и независимых замеров). У Kimi K3 в открытых материалах — Terminal-Bench 88,3. Это разные бенчмарки: первый набор проверяет починку реальных задач в репозиториях и работу с инструментами, второй — действия в терминале. Складывать и вычитать их нельзя. Качественно картина такая: Opus 5 проектировался под длинные автономные сессии — многочасовой рефакторинг, миграции, ревью пул-реквестов, поиск редких багов, а также мультиагентные схемы вида writer-verifier, где одна роль пишет, а вторая проверяет и спорит. Включённое по умолчанию «мышление» и регулируемые уровни усилий здесь работают как ручка «думай дольше там, где цена ошибки высокая». Kimi K3 тоже уверенно ведёт агентные цепочки и заметно сильна в генерации кода. Готовые сценарии и промпты под Opus 5 разобраны в гайде Claude Opus 5 для кода.

Фронтенд, вёрстка и интерфейсы

Здесь у Kimi K3 есть аргумент, которого у Opus 5 попросту нет: первое место в Arena Frontend Code — рейтинге, посвящённом задачам вёрстки и интерфейсов. Если ваша ежедневная работа — быстро получать рабочие компоненты, страницы и прототипы UI, начните тест именно с Kimi K3. У Opus 5 сильная сторона рядом, но другой природы — «зрение»: модель разбирает скриншоты интерфейсов, макеты, графики и документы (MMMU-Pro 84,7 по данным Anthropic и независимых замеров), поэтому хорошо отрабатывает связку «покажи скриншот сломанной вёрстки — получи диагноз, объяснение причины и правку». На практике это два разных рабочих движения: сгенерировать интерфейс и починить существующий.

Как обе модели работают с контекстом в 1 000 000 токенов?

Формально окно одинаковое — миллион токенов у каждой. Практически важны две вещи: как модель удерживает внимание на длинной дистанции и что происходит по умолчанию. У Opus 5 максимальное окно стоит дефолтом, а вывод до 128 000 токенов позволяет вернуть большой артефакт целиком — полный разбор договора, переписанный модуль, длинную аналитическую записку без нарезки на части. Публичных цифр по удержанию контекста для Kimi K3 в доступных нам данных нет, поэтому единственный честный способ сравнить — прогнать один и тот же длинный материал через обе модели и спросить о фрагментах из начала, середины и конца.

  • Загрузите один и тот же материал (репозиторий, свод регламентов, годовую переписку) в обе модели

  • Задайте три вопроса: по факту с первых страниц, по факту из середины, по факту с самого конца

  • Попросите свести противоречия между разными частями документа — это проверка связности, а не поиска

  • Сравните, кто раньше начинает терять детали и кто честнее признаёт, что данных в материале нет

Кому подойдёт Claude Opus 5?

Opus 5 — выбор там, где надёжность важнее скорости, а задача не заканчивается одним ответом. Проприетарная модель означает предсказуемое поведение «из коробки» и максимум по сумме способностей: первое место с 85,88 балла в сводном рейтинге агрегатора из 215 моделей — это именно про широту, а не про один тест.

  • Длинные автономные задачи: многочасовой рефакторинг, миграции, разбор легаси-кода

  • Ревью кода и поиск редких багов, где цена ошибки выше цены минуты ожидания

  • Аналитика и исследования: глубокие рассуждения, сложные научные вопросы, работа с источниками

  • Офисные задачи: таблицы, презентации, длинные документы с выводом до 128 000 токенов

  • Работа с визуалом на входе: графики, скриншоты, сканы, макеты и вёрстка

  • Мультиагентные схемы writer-verifier, где нужна дисциплина исполнения инструкций

  • Ситуации, когда важно регулировать глубину: от low для рутины до max для по-настоящему трудных задач

Кому подойдёт Kimi K3?

Kimi K3 — выбор тех, кому нужны сильный практический код и открытая модель. Открытость здесь не абстракция: это прозрачность происхождения, возможность изучать и воспроизводить поведение модели, отсутствие зависимости от одного вендора в долгую. Плюс сильный сигнал по фронтенду.

  • Фронтенд и интерфейсы: первое место в Arena Frontend Code по данным разработчика

  • Генерация кода и агентные цепочки, где важна практическая скорость получения результата

  • Проекты, где принципиальна открытая модель — прозрачность и независимость от одного поставщика

  • Работа с большими массивами текста: контекст 1 000 000 токенов

  • Сложные вопросы уровня GPQA и многошаговый веб-поиск: 93,5 и 91,2 по данным разработчика и ранних замеров — фактически вровень с Opus 5

  • Сценарии, где нужно второе независимое мнение к ответу Opus 5 — перекрёстная проверка двумя топ-моделями

Как выбрать между Opus 5 и Kimi K3 за один вечер?

Выбирать вслепую по чужим бенчмаркам — худшая из стратегий: чужие тесты измеряют чужие задачи. В СуперИнтеллекте обе модели живут в одном окне чата, переключение занимает один клик, промпты переписывать не нужно, оплата идёт нейронами, а старт бесплатный. Значит, честный эксперимент стоит одного вечера, а не недели переговоров о доступах.

  1. Возьмите три своих реальных задачи: одну кодовую, одну с длинным документом, одну аналитическую.

  2. Прогоните каждую через Claude Opus 5 — «мышление» уже включено, при необходимости поднимите усилия до xhigh или max.

  3. Переключите модель на Kimi K3 в том же чате и повторите те же промпты без единого изменения.

  4. Сравните по четырём критериям: корректность, полнота, следование инструкции и то, насколько легко вам проверить ответ.

  5. Зафиксируйте выбор по типам задач, а не «навсегда». У большинства команд получается сплит: одна модель на интерфейсы и быстрый код, другая — на разбор, ревью и длинные сессии.

Если ни один из двух вариантов не закрывает задачу, в том же окне есть и другие флагманы. Gemini 3.6 Flash делает ставку на скорость и нативно принимает на вход текст, изображения, аудио и видео — это про восприятие материала, а не про генерацию картинок или роликов. GPT-5.5 и GPT-5.6 Sol от OpenAI — сильные универсалы, у GPT-5.5 контекст тоже достигает миллиона токенов. DeepSeek V4 Flash сделан ради скорости и экономичности при окне в 1 млн токенов, GLM 5.2 — рассуждающая модель с таким же окном, а Claude Fable 5, Sonnet 5 и GigaChat закрывают остальные сценарии. Сравнивать их между собой по разным бенчмаркам бессмысленно, а вот прогнать один и тот же промпт — дело пары минут.


Проверьте обе модели на своей задаче
Claude Opus 5, Opus 5 Fast, Kimi K3 и другие модели доступны в одном чате — в России, без VPN и без зарубежной карты. Смена модели в один клик, оплата нейронами, бесплатный старт. Создать аккаунт и попробовать


Частые вопросы о Claude Opus 5 и Kimi K3

Что лучше для программирования — Claude Opus 5 или Kimi K3?

Из бенчмарков прямой ответ не следует: общего кодового теста у моделей нет. По данным Anthropic у Opus 5 SWE-bench Verified 96,0% и SWE-bench Pro 79,2%, у Kimi K3 заявлены Terminal-Bench 88,3 и первое место в Arena Frontend Code — это разные измерения, и переводить одно в другое нельзя. Практическое правило: длинные автономные задачи, ревью и поиск багов — Opus 5; быстрый фронтенд и генерация интерфейсов — Kimi K3. Окончательный вывод стоит делать на своём коде.

Правда ли, что Kimi K3 обходит Claude Opus 5 по GPQA Diamond?

По опубликованным цифрам — да: 93,5 против 93,2. Но разрыв составляет 0,3 процентного пункта, а замеры выполнялись разными сторонами и в разных условиях. Корректная формулировка: по GPQA Diamond модели идут вровень. Такая же картина по BrowseComp — 91,2 против 90,8. Разницу такого размера нельзя считать доказательством превосходства.

У обеих моделей контекст 1 млн токенов — значит, они одинаково справятся с большим проектом?

Нет. Размер окна — это ёмкость, а не качество внимания на длинной дистанции. У Opus 5 максимальное окно стоит по умолчанию, а вывод достигает 128 000 токенов, что удобно для больших итоговых артефактов. Как каждая модель удерживает связность именно на ваших материалах, покажет только тест: одинаковый документ, вопросы по началу, середине и концу, задание свести противоречия.

Могут ли Claude Opus 5 или Kimi K3 сгенерировать изображение или видео?

Нет. Обе модели отвечают только текстом. Изображения они разбирают на входе — Opus 5 дополнительно принимает файлы, — но не создают. Для генерации визуала на платформе есть отдельный раздел МедиаЛаб, и это принципиально разные инструменты.

Нужны ли VPN и зарубежная карта, чтобы работать с этими моделями из России?

Нет. Claude Opus 5 и Opus 5 Fast, Kimi K3, Gemini 3.6 Flash, GPT-5.6 и GPT-5.5, DeepSeek V4, GLM 5.2, Claude Fable 5, Sonnet 5 и GigaChat доступны в СуперИнтеллекте без VPN и без зарубежной карты. Оплата — нейронами, есть бесплатный старт. Как начать работу с флагманом, разобрано в гайде как пользоваться Claude Opus 5.

Если хотите сравнить Opus 5 с другими флагманами, у нас есть отдельные разборы: Claude Opus 5 против GPT-5.6, против Gemini, против Fable 5 и против Sonnet 5. Если вы только знакомитесь с линейкой, начните с материалов что такое Claude Opus 5 и чем отличаются модели Claude. А самый быстрый способ определиться — открыть чат и задать обеим моделям один и тот же вопрос.

Попробуй бесплатно

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества