Вышла новая модель для синтеза речи Fish Audio S2 Pro
Новая открытая TTS-система Fish Audio S2 Pro (https://huggingface.co/fishaudio/s2-pro) поддерживает мультиспикерные и многоходовые генерации, управление через естественные языковые инструкции, длинные связные аудио, а также потоковый вывод с RTF 0.195 и TTFA <100 мс.
В её архитектуре используется Dual‑AR, состоящий из Slow AR (Qwen3‑4B), который предсказывает семантические токены, и Fast AR (4 слоя) для акустических деталей по кодовым книгам RVQ. Аудиотокенизатор у модели работает на базе DAC с каузальными свёртками, трансформерным узким местом и семантической дистилляцией (w2v‑BERT 2.0).
При обучении применили трёхступенчатый пайплайн, во время которого выделяют голос, затем фильтруют его по качеству и выполняют rich‑транскрипцию (ASR с разметкой эмоций, дикторов). В дальнейшем эту же модель ASR и оценщик качества используют как сигналы вознаграждения в RL. Основной процесс обучения включал в себя пре‑тренинг на 10 млн часов аудио (приблизительно 80 языков), затем SFT и RL‑посттренинг (GRPO с многомерными наградами за точность, качество и сходство тембра).
В результате модель имеет лучшие или конкурентоспособные показатели WER/CER и сходства тембра в Seed-TTS-Eval, Long-TTS-Eval и на мультиязычных тестах. Кроме этого, Audio Turing Test показал результат 0.483 (0.515 с переписанными инструкциями), а Emergent-TTS‑Eval дал 81.88% побед против базовой модели. Их собственный бенчмарк инструкций продемонстрировал активацию тегов 98.4% для китайского и 88.1% для английского языка, при этом естественность и выразительность речи выше, чем у S1.



