Делаю полную русскую нейроозвучку GTA V: сюжет, прохожие, радио и даже полицейская рация
Всем привет! Недавно увидел ролик про нейро-GTA V — как к NPC подключают нейросеть и с ними можно разговаривать, как в нейромоде для Skyrim. Идея зацепила, и захотелось снова пройти игру — но слушая диалоги, а не читая субтитры, как при первом прохождении. Полез искать русскую нейроозвучку и нашёл только неполную версию, довольно кривую и почти одноголосую.
Прикинул объём работы и понял, что сделать свою вполне посильно. Начал с тестового ролика — он второй в посте: подобрал персонажам голоса, попробовал передать характеры и эмоции, сохранить сленг и грубость оригинала. Получилось лучше, чем я ожидал, — и я взялся за полную озвучку.
Первое видео — пролог целиком, от ограбления до похорон. Это настоящая озвучка, записанная прямо из игры: ещё не финальная, но примерно так всё и будет звучать.
Масштаб оказался такой: 168 271 реплика, около 100 часов речи. И это не только сюжет — катсцены, звонки, побочки, болтовня прохожих на улицах, радио с ток-шоу и рекламой, полицейская рация, объявления.
Самое забавное, что сгенерировать голос — самое простое. Озвучивает Gemini TTS от Google. А всё, что вокруг, — это и есть настоящая работа:
Распаковка. Звук игры лежит в зашифрованных архивах. Вытащил все 260 866 аудиопотоков и разобрал, что из этого речь, а что музыка и эффекты.
Распознавание. Там, где нет субтитров, речь распознаёт Whisper large-v3 — по четыре копии параллельно на RTX 4090, сутки работы видеокарты. Whisper при этом врёт как дышит: на тишине пишет «Subtitles by Amara», испанскую речь сам переводит на английский, а корейских бандитов записывает хангылем. Поэтому всё подозрительное перепроверялось второй моделью — Parakeet от NVIDIA.
Кто говорит. Оказалось, игра хранит в каждом звуковом файле путь к анимации губ персонажа — по нему и определяется говорящий. В катсценах и ток-шоу речь делит по голосам Nemotron от NVIDIA, а WeSpeaker сверяет голос с персонажами. Пол — по голосу моделью ECAPA-TDNN, потому что данным игры верить нельзя: Пейдж и Талиана там записаны мужчинами 😅
Отделение голоса. Нейросеть BS-RoFormer вырезала английскую речь из 7 038 дорожек. Двери, выстрелы и музыка под ней остаются на месте.
Укладка. В катсценах русская фраза должна влезть ровно в окно оригинала: ускорение — не больше 10%, иначе ИИ сокращает текст, а лишние слова вырезаются прямо из готовой озвучки.
Сборка. Свой упаковщик обратно в архивы игры. По пути нашёл баг кодека в CodeWalker, из-за которого в конце каждой реплики был щелчок, — починил.
Это видео тест озвучки, не из игры, просто проба, как пример:
Что в итоге:
— переводится всё, что звучит в игре, больше, чем есть в официальных субтитрах, и без цензуры — мат на месте;
— у каждого персонажа свой голос на всю игру;
— в катсценах остаётся живой звук сцены, громкость — как у оригинала, рация звучит как рация;
— каждая реплика сюжета проверяется обратным распознаванием, брак уходит на перегенерацию.
Делаю в первую очередь для Enhanced-версии — она выглядит не хуже нынешних игр, так что перепройти её перед шестой частью определённо стоит. Сейчас запускаю генерацию всего сюжета.
Как будет двигаться дальше, рассказываю у себя в Telegram — подписывайтесь, чтобы быть в курсе: https://t.me/nerual_dreming
Интересно вам такое или нет? Пишите в комментариях 👇












