Локальный тест MiniMax H3 в ComfyUI: генерируем видео для макси-сингла «Fish Fugue — без воды»
Каждый релиз музыки требует визуального сопровождения. Когда вышел мой новый макси-сингл Fish Fugue — «без воды», я решил отказаться от стандартных стоковых видео и попробовать создать полноценный видеоряд с помощью нейросетей.
Целью эксперимента было протестировать новую видеомодель MiniMax H3 локально в ComfyUI, оценить её плавность и качество в сравнении с LTX 2.3 и собрать готовый клип на текст песни.
💡 Что такое MiniMax H3 и почему она интересна?
Согласно официальному руководству MiniMax, архитектура H3 представляет собой гибридное решение для генерации видео высокой четкости с реалистичной физикой движений, поддержкой синхронизации текста/аудио и высокой плавностью кадров.
В отличие от многих предыдущих решений (включая LTX 2.3), модель значительно лучше справляется со сложными траекториями движения, динамичным освещением и сохранением детализации объектов между кадрами.
🛠 Окружение и сетап
Для быстрого развертывания я взял сборку ComfyUI-Easy-Install от Pixaroma Community Edition и готовый workflow, предложенный сообществом Pixaroma.
Использованные модели:
Основной чекпоинт: minimax_h3_fl2va_pruned_int8_convrot.safetensors
Текстовый энкодер / Vision-модель: qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Audio VAE: minimax_h3_audio_vae_fp32.safetensors
Video VAE: minimax_h3_video_vae_fp16.safetensors
Аппаратное обеспечение:
CPU: Intel Core i5-12600K
RAM: 32 GB+
ОС: Windows 10 Pro Workstation
🎨 Подготовка референсов и промптинг
Чтобы клип соответствовал смыслу песни из макси-сингла «без воды», я сначала создал серию ключевых кадров (ключевых референсов) на основе текста трека. Для этого я использовал две разные системы генерации изображений:
Ideogram 4 — отлично подошла для генерации сложных сюжетных кадров с высокой детализацией элементов.
Krea 2 — использовалась для создания более стилизованных и атмосферных артов
Тестирование Workflow:
В ComfyUI я проверил два основных сценария работы:
Single Image Prompting: генерация анимации из одного базового изображения-референса.
Two Image References: генерация с переносом стиля и движения между начальным и конечным кадрами.
⏱ Результаты генерации и впечатления
Генерация видео на локальном ПК оказалась ресурсоемкой задачей.
Время генерации одного пасса: от 4 до 8 минут.
Затраты времени: на весь процесс настройки, тестов и генерации финальных фрагментов ушел целый вечер.
Сравнение с LTX 2.3:
Плавность: MiniMax H3 показывает на порядок более естественную физику. Кадры не «поплыли», нет резких разрывов текстур.
Детализация: Сохранение мелких деталей с генераций Ideogram 4 и Krea 2 оказалось значительно выше, чем у LTX 2.3.
Стабильность: Модель отлично держит динамику движения без превращения видео в «кашу».
🎵 Финал: Видеоклип к макси-синглу «Fish Fugue — без воды»
Все сгенерированные фрагменты были собраны под трек. Предлагаю оценить плавность и физику MiniMax H3 непосредственно в готовом видеоряде:
Итоги
MiniMax H3 — крайне перспективная модель для локального запуска, хоть и требовательная к железу. Полноценное видео на вечер работы — отличный результат для домашнего сетапа.
Делитесь в комментариях, пробовали ли вы запускать H3 локально и какие квантования используете для ускорения генерации!