Китайцы опять что-то сделали. Новый DeepSeek уже наступает на пятки GPT и Claude
Помните времена, когда китайские нейросети выглядели примерно так:
— Зато бесплатно.
— А работает?
— Ну… зато бесплатно.
Кажется, эти времена постепенно заканчиваются.
DeepSeek выпустили новую модель — DeepSeek V4.1 Flash. Я полез смотреть результаты именно по программированию, потому что красивые ответы на вопросы меня уже мало интересуют. Сейчас гораздо интереснее, способен ли ИИ получить настоящий проект и самостоятельно в нём работать.
И вот тут результаты занятные.
Модель огромная — 552 млрд параметров. Но построена по архитектуре MoE, поэтому одновременно работает только часть всей этой махины.
Контекст — до 1 миллиона токенов.
Если по-человечески: ей можно скормить очень много кода и документации за раз.
Но главное — она заточена не только под «напиши калькулятор на Python».
Современный ИИ-программист должен уметь открыть репозиторий, разобраться в чужом коде, найти нужные файлы, полезть в терминал, что-нибудь изменить, запустить тесты, увидеть ошибку, исправить её и продолжить работу.
Вот здесь новый DeepSeek показывает довольно серьёзные результаты.
Например, в Terminal-Bench 2.1 у него 90,6 балла.
В DeepSWE — 74,2.
В AutomationBench — 54,8.
Это уже территория топовых моделей OpenAI и Anthropic.
Но прежде чем писать «КИТАЙ УНИЧТОЖИЛ OPENAI!!!», есть важная деталь.
На более сложном Terminal-Bench 4.0 результаты выглядят так:
DeepSeek V4.1 Flash — 31,2
GPT-5.6 Sol — 39,9
Claude Opus 5 — 51,8
То есть нет, GPT и Claude пока можно не хоронить.
На действительно тяжёлых агентных задачах у DeepSeek ещё есть куда расти.
Но дальше начинается самое интересное.
Эта штука стоит какие-то смешные деньги
API DeepSeek:
$0,30 за миллион входящих токенов
$1,20 за миллион выходящих
А в непиковое время цены падают примерно до:
$0,15 / $0,60.
И вот тут лично для меня начинается гораздо более интересная история, чем очередное соревнование бенчмарков.
Потому что раньше хороший ИИ-программист был довольно дорогим ресурсом.
Поэтому условному Claude или GPT обычно даёшь нормальную задачу и ждёшь результат.
А теперь можно попробовать совсем другую архитектуру работы.
Допустим, у нас есть проект.
Запускаем несколько агентов.
Один изучает репозиторий.
Второй ищет потенциальные проблемы.
Третий пишет реализацию.
Четвёртый пишет тесты.
Пятый проверяет работу третьего.
Шестой смотрит, не сломали ли они что-нибудь в другом месте.
И всё это может происходить параллельно.
Раньше такая схема быстро превращала счёт за API в отдельную статью расходов.
С DeepSeek стоимость становится настолько низкой, что подобных агентов можно начинать использовать почти как расходный материал.
Не справился один?
Пусть второй проверит.
Не уверены в результате?
Запускаем ещё одного.
И вот это, на мой взгляд, намного интереснее вопроса:
«DeepSeek уже умнее GPT или ещё нет?»
А можно скачать её себе на компьютер?
Можно.
DeepSeek открыла веса.
Только есть маленькая проблема.
552 миллиарда параметров.
На обычном игровом компьютере можете даже не пытаться.
Я как раз смотрел новый компьютер AMD, который они сделали специально под локальные нейросети.
Там 128 ГБ общей памяти, мощный Ryzen AI Max+ и довольно серьёзная встроенная графика.
Стоит эта коробочка примерно $4000.
И даже она полный новый DeepSeek нормально не потянет.
Для модели нужны уже сотни гигабайт памяти.
Поэтому сейчас логичнее выглядит примерно такая схема:
небольшие и средние модели → локально
DeepSeek V4.1 → через дешёвый API
GPT / Claude → оставляем для действительно сложных задач
Получается своеобразная иерархия.
Зачем отправлять задачу модели за условные $10, если модель за $1 решает её не хуже?
А если дешёвая не справилась — тогда зовём тяжёлую артиллерию.
И вот это изменение кажется мне важнее очередного «+7% на бенчмарке».
Мы довольно быстро движемся от:
«У меня есть один очень умный ИИ-помощник»
к:
«У меня есть команда из 20 ИИ, которые параллельно работают над одной задачей».
И когда один такой работник стоит копейки, совершенно меняется сам подход к разработке.
Поэтому я бы пока не говорил, что DeepSeek победил OpenAI или Anthropic.
Не победил.
Но китайцы сделали другое.
Они опять очень сильно уронили цену интеллекта.
А вот последствия этого, мне кажется, будут гораздо интереснее очередной таблицы с результатами GPT против Claude.
вчера считал на этом дикпике теплообменник.
Функция простая - вогнать воздух, и выпустить с температурой 200 градусов.
...
этот еблан воздух упорно насквозь ТЭН пускал, хотя я пишу - послойно, пожалуйста, перепроверь чтобы воздух шёл по каналам с нужным сечением (это коротко). Нет, рисует хуету раз за разом, даже с уточнениями.
До сих пор в шоке.
Наверное, нужен трёхэтажный промт, а не одним абзацем, как у меня