VoiceStudio — локальная замена ElevenLabs: клон голоса, дубляж видео и аудиокниги на своём компьютере
За синтез речи и клонирование голоса принято платить подписку. VoiceStudio делает ровно то же самое бесплатно и целиком на вашей машине: ни аккаунта, ни API-ключей, ни счётчика символов — после разовой загрузки моделей всё работает оффлайн.
Внутри 16 движков синтеза речи и 11 движков распознавания, каталог на 646 языков, а переключение между ними — одна кнопка. За четыре месяца проект собрал 10 тысяч звёзд на GitHub и 209 тысяч скачиваний, так что это не витрина, а рабочий инструмент.
Версия 0.5.0 от 14 августа 2026, лицензия AGPL-3.0. Ставится как обычная программа: MSI для Windows 10/11, DMG для macOS на Apple Silicon, AppImage для Linux. Из требований — 8 ГБ оперативной памяти (лучше 16), около 10 ГБ на диске под модели. Видеокарта не обязательна, всё умеет работать на процессоре; с GPU достаточно 4 ГБ видеопамяти.
Что умеет VoiceStudio
🟣 Клонирование голоса — zero-shot, хватает трёхсекундного образца; 5–15 секунд дают результат лучше
🟣 Дизайн голоса — собрать голос с нуля, задав возраст, акцент, высоту, манеру и подачу
🟣 Дубляж видео — распознаёт речь, переводит, разделяет спикеров, синтезирует и отдаёт готовое видео
🟣 Аудиокниги и истории — импорт EPUB и PDF, разные голоса на роли, рендер по главам, экспорт в .m4b
🟣 Диктовка в любом окне — системный хоткей, живая расшифровка, опционально чистка текста локальной моделью
🟣 Разделение голоса и фона — Demucs вытаскивает речь из музыки и шума
🟣 Разметка по спикерам — Pyannote и WhisperX сами разложат диалог по голосам
🟣 Сотни готовых голосов — галерея архетипов с акцентами, если возиться с клонированием не хочется
🟣 16 движков синтеза — CosyVoice 3, GPT-SoVITS, VoxCPM2, IndexTTS 2.5, KittenTTS, Supertonic 3, PocketTTS и dots.tts
🟣 11 движков распознавания — WhisperX, Faster-Whisper, Parakeet TDT, Moonshine, FunASR и другие
🟣 Своя замена облачному API — поднимает OpenAI-совместимый сервер на localhost:3900: в чужой программе меняешь один адрес, и озвучка идёт на вашем железе
🟣 Пакетная очередь — ставишь десятки видео и текстов в работу и уходишь
🟣 Работает на чём есть — CUDA, Apple Silicon, ROCm на Linux или просто процессор
Установка и запуск
⁍ Скачать со страницы релизов: .msi для Windows, .dmg для macOS на Apple Silicon или .AppImage для Linux
⁍ Запустить — при первом старте приложение само собирает окружение и качает модель по умолчанию
⁍ Открыть вкладку Voice Cloning, добавить чистый образец голоса на 5–15 секунд, ввести текст, выбрать язык и нажать Generate
⁍ На macOS первый запуск — правый клик по приложению и «Открыть». Intel-маки локальный движок не тянут, только удалённый бэкенд
🔗 GitHub: debpalash/VoiceStudio
📦 Скачать релиз под свою платформу: страница релизов










