DeepSeek V4.1 Flash: новая модель DeepSeek бросает вызов флагманам1
DeepSeek официально выпустила V4.1 Flash — быструю MoE-модель с 552 млрд параметров, рассчитанную прежде всего на программирование, агентные сценарии и мультимодальные задачи. При этом на один токен активируется значительно меньше параметров: 8 млрд при обработке входа и 16 млрд при генерации.



По заявленным результатам тестирования модель показывает очень высокие результаты:
DeepSWE v1.1 — 74,2 балла;
CyberGym — 88,1;
Automation-Bench — 54,8;
Codeforces — 3471;
Terminal-Bench 2.1 — 90,6.
DeepSeek заявляет, что V4.1 Flash в ряде сценариев превосходит предыдущую V4 Pro, включая производительность, скорость и время выполнения задач. Сравнение с конкретными моделями вроде GPT-5.6 Sol и Claude Opus 5 зависит от методики тестирования, поэтому воспринимать отдельные лидерские позиции как абсолютный рейтинг всех моделей не стоит.
Главная особенность архитектуры — ставка не только на количество параметров, но и на эффективность. DeepSeek указывает, что новая архитектура позволяет снизить требования к KV-кэшу примерно в четыре раза по HBM и в восемь раз по SSD относительно предыдущего поколения. Для агентных задач это особенно важно: такие системы постоянно работают с большими объёмами контекста.
Цена тоже интересная
С 10 сентября действуют новые тарифы Flash:
$0,15 за 1 млн входных токенов без попадания в кэш и $0,60 за 1 млн выходных в непиковое время. Для кэшированных входных токенов цена составляет всего $0,003 за 1 млн. В пиковые часы тарифы увеличиваются вдвое.
Модель уже доступна в открытом виде на Hugging Face. Репозиторий также содержит инструкции для запуска через Transformers, vLLM и SGLang.
V4.1 Flash получила нативную мультимодальность, поэтому модель умеет работать не только с текстом и кодом, но и с изображениями. Старые V4 Flash и V4 Flash Vision Exp выводятся из эксплуатации, а их API-имена временно перенаправляются на новую модель.
Есть и ещё более интересный момент: 14 сентября DeepSeek планирует окончательно вывести V4 Pro. До выхода V4.1 Pro запросы к V4 Pro будут автоматически отправляться на V4.1 Flash и оплачиваться по тарифу Flash.
Технический отчёт DeepSeek V4.1 Flash опубликован отдельно и доступен на Hugging Face в формате PDF.
Похоже, DeepSeek решила не просто выпустить ещё одну Flash-модель, а сделать её основной рабочей лошадкой для кода и AI-агентов — причём с ценой, которая заметно ниже уровня флагманских моделей.
Источник техножурнал КОД: https://t.me/kodjournal/271
Честно, поделюсь опытом от 1,5 дней пользования моделью. Это лютый ужас: Резко урезано контекстное окно. Модель теряет середину длинного диалога, забывает ранее решённое, возвращается к уже обсуждённым темам. Потеряна инициативность. Раньше модель сама предлагала категории и решения. Теперь — подтверждает, перебирает варианты и заканчивает вопросом. Потеряна глубина. Ответы стали фрагментированными, повторяющимися и поверхностными. Модель перестала считать до конца и давать законченные ответы. Для меня, как человека работающего с сюжетами, она потеряла и тот зачаток эмоционального интеллекта, что был. Объединение режимов ухудшило все три. Аналитический, быстрый и творческий режимы усреднены в один. В итоге потеряны: глубина аналитика, инициатива творца, скорость быстрого режима. Невозможность работы с длинными задачами. Задачи, требующие 50–100 постов и удержания всей картины, стали невыполнимыми. Модель не удерживает контекст и не может обеспечить синергию портфеля. На последнем, я потерял полгода работы, так как мне требовалась обработка задачи, трубующей огромного контекстного окна и пусть DeepSeek уступал в глубине другим, он мог обработать задачу, а теперь, он не вмещает даже вводные данные в свое контекстное окно.
Я просто в ужасе и просто не понимаю, что мне теперь делать. Полгода подготовки массива задач, просто ушли в топку, получается... Может есть у кого-нибудь мысли или опыт по другим моделям, которые могли бы заменить DS в этом аспекте?