3

Китайцы опять что-то сделали. Новый DeepSeek уже наступает на пятки GPT и Claude⁠⁠

Помните времена, когда китайские нейросети выглядели примерно так:

— Зато бесплатно.
— А работает?
— Ну… зато бесплатно.

Кажется, эти времена постепенно заканчиваются.

DeepSeek выпустили новую модель — DeepSeek V4.1 Flash. Я полез смотреть результаты именно по программированию, потому что красивые ответы на вопросы меня уже мало интересуют. Сейчас гораздо интереснее, способен ли ИИ получить настоящий проект и самостоятельно в нём работать.

И вот тут результаты занятные.

Модель огромная — 552 млрд параметров. Но построена по архитектуре MoE, поэтому одновременно работает только часть всей этой махины.

Контекст — до 1 миллиона токенов.

Если по-человечески: ей можно скормить очень много кода и документации за раз.

Но главное — она заточена не только под «напиши калькулятор на Python».

Современный ИИ-программист должен уметь открыть репозиторий, разобраться в чужом коде, найти нужные файлы, полезть в терминал, что-нибудь изменить, запустить тесты, увидеть ошибку, исправить её и продолжить работу.

Вот здесь новый DeepSeek показывает довольно серьёзные результаты.

Например, в Terminal-Bench 2.1 у него 90,6 балла.

В DeepSWE — 74,2.

В AutomationBench — 54,8.

Это уже территория топовых моделей OpenAI и Anthropic.

Но прежде чем писать «КИТАЙ УНИЧТОЖИЛ OPENAI!!!», есть важная деталь.

На более сложном Terminal-Bench 4.0 результаты выглядят так:

DeepSeek V4.1 Flash — 31,2

GPT-5.6 Sol — 39,9

Claude Opus 5 — 51,8

То есть нет, GPT и Claude пока можно не хоронить.

На действительно тяжёлых агентных задачах у DeepSeek ещё есть куда расти.

Но дальше начинается самое интересное.

Эта штука стоит какие-то смешные деньги

API DeepSeek:

$0,30 за миллион входящих токенов

$1,20 за миллион выходящих

А в непиковое время цены падают примерно до:

$0,15 / $0,60.

И вот тут лично для меня начинается гораздо более интересная история, чем очередное соревнование бенчмарков.

Потому что раньше хороший ИИ-программист был довольно дорогим ресурсом.

Поэтому условному Claude или GPT обычно даёшь нормальную задачу и ждёшь результат.

А теперь можно попробовать совсем другую архитектуру работы.

Допустим, у нас есть проект.

Запускаем несколько агентов.

Один изучает репозиторий.

Второй ищет потенциальные проблемы.

Третий пишет реализацию.

Четвёртый пишет тесты.

Пятый проверяет работу третьего.

Шестой смотрит, не сломали ли они что-нибудь в другом месте.

И всё это может происходить параллельно.

Раньше такая схема быстро превращала счёт за API в отдельную статью расходов.

С DeepSeek стоимость становится настолько низкой, что подобных агентов можно начинать использовать почти как расходный материал.

Не справился один?

Пусть второй проверит.

Не уверены в результате?

Запускаем ещё одного.

И вот это, на мой взгляд, намного интереснее вопроса:

«DeepSeek уже умнее GPT или ещё нет?»


А можно скачать её себе на компьютер?

Можно.

DeepSeek открыла веса.

Только есть маленькая проблема.

552 миллиарда параметров.

На обычном игровом компьютере можете даже не пытаться.

Я как раз смотрел новый компьютер AMD, который они сделали специально под локальные нейросети.

Там 128 ГБ общей памяти, мощный Ryzen AI Max+ и довольно серьёзная встроенная графика.

Стоит эта коробочка примерно $4000.

И даже она полный новый DeepSeek нормально не потянет.

Для модели нужны уже сотни гигабайт памяти.

Поэтому сейчас логичнее выглядит примерно такая схема:

небольшие и средние модели → локально

DeepSeek V4.1 → через дешёвый API

GPT / Claude → оставляем для действительно сложных задач

Получается своеобразная иерархия.

Зачем отправлять задачу модели за условные $10, если модель за $1 решает её не хуже?

А если дешёвая не справилась — тогда зовём тяжёлую артиллерию.


И вот это изменение кажется мне важнее очередного «+7% на бенчмарке».

Мы довольно быстро движемся от:

«У меня есть один очень умный ИИ-помощник»

к:

«У меня есть команда из 20 ИИ, которые параллельно работают над одной задачей».

И когда один такой работник стоит копейки, совершенно меняется сам подход к разработке.

Поэтому я бы пока не говорил, что DeepSeek победил OpenAI или Anthropic.

Не победил.

Но китайцы сделали другое.

Они опять очень сильно уронили цену интеллекта.

А вот последствия этого, мне кажется, будут гораздо интереснее очередной таблицы с результатами GPT против Claude.

1
Автор поста оценил этот комментарий

вчера считал на этом дикпике теплообменник.
Функция простая - вогнать воздух, и выпустить с температурой 200 градусов.
...
этот еблан воздух упорно насквозь ТЭН пускал, хотя я пишу - послойно, пожалуйста, перепроверь чтобы воздух шёл по каналам с нужным сечением (это коротко). Нет, рисует хуету раз за разом, даже с уточнениями.
До сих пор в шоке.
Наверное, нужен трёхэтажный промт, а не одним абзацем, как у меня

раскрыть ветку

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества