NVIDIA выложила VoiceChat 11B: открытая голосовая модель, которую можно перебивать
NVIDIA выложила в открытый доступ NemotronLabs VoiceChat 11B — голосовую модель, которая работает в полном дуплексе: слушает, пока говорит, и позволяет себя перебивать. Лицензия OpenMDW-1.1, веса на Hugging Face, код в NeMo Speech, контейнер в NGC.
Цифры
Задержка на обычной смене реплик — 448 мс, при перебивании пользователем — 480 мс. Именно это отличает полный дуплекс от привычного голосового ассистента: не нужно ждать, пока модель договорит, её можно оборвать на полуслове, и она это корректно обработает.
Что внутри
Гибридная архитектура Mamba и трансформера, собранная из трёх собственных компонентов NVIDIA: речевой энкодер Fast Conformer на входе, языковой бэкбон Nemotron Nano v2 и TTS-декодер с кодеком на выходе. Плюс отдельный канал для вызова инструментов.
Последнее — главная новость для разработчиков. Это первая открытая full-duplex модель, которая умеет дёргать внешние функции прямо посреди разговора: она выделяет вызов в отдельный блок и при этом может сказать собеседнику что-то вроде «секунду, проверяю», пока запрос выполняется. По бенчмарку выбора инструмента — 82,5%, точность аргументов — 44,2%. На VoiceBench модель занимает второе место среди открытых full-duplex систем.
Чем придётся заплатить
Аппетит серьёзный: нужна одна видеокарта минимум с 80 ГБ видеопамяти — A100, H100, RTX 6000 Pro или B200, x86_64 Linux. И сама NVIDIA пишет прямо: модель готова для пилотов, но не для продакшна. Известные ограничения — контекст всего две минуты аудио и деградация качества после нескольких ходов диалога.
Кто ещё в этой гонке
Планку по скорости держит французская Moshi от лаборатории Kyutai: около 200 мс сквозной задержки, 7 миллиардов параметров, открытый код, запускается на одной видеокарте или даже на iPhone. Правда, только английский. На её архитектуре сама NVIDIA в январе 2026 года выпустила PersonaPlex.
Из Китая главный соперник — Alibaba с Qwen2.5-Omni: средняя задержка 257 мс и полная мультимодальность из коробки, то есть картинки, видео, аудио и текст в одной модели, в вариантах на 7B и 3B.
А накануне релиза NVIDIA свою заявку сделала ByteDance — SeedRealtime, единая модель, которая не только слушает и говорит, но и смотрит: аудио, видео и текст обрабатываются насквозь, без каскада «распознавание — модель — синтез». Вот только проверить это невозможно. ByteDance не опубликовала ни технического отчёта, ни числа параметров, ни бенчмарков: нет ни открытых весов, ни объявленного API, модель доступна только внутри приложения Doubao.
Контраст показательный. Реалтайм-голос расходится по двум дорожкам: одни выкладывают веса и метрики и дают себя измерить, другие показывают демо и предлагают поверить на слово.
Источник: MarkTechPost

























