Прогнал 10 промптов через MiniMax H3 и проверил, умеет ли она в кириллицу
Есть подборка из десяти профессиональных промптов под видеомодель MiniMax H3, каждый заточен под свою задачу: кинематографичный кадр, тизер по таймкодам, переход между двумя кадрами, инфлюенсер с зафиксированным лицом, перенос движения, товарка со звуком, титр с точным текстом, замена предмета в готовом ролике, демонстрация интерфейса и большой брифинг сразу с пятью референсами.
Я перевёл все десять на русский и прогнал через модель. Не выборочно, а все, по очереди, с реальными референсами, которые пришлось генерировать отдельно. Ниже что получилось, где модель попала, где промахнулась и на какие грабли я наступил по дороге.
Все ролики ниже - мои генерации, звук у них родной, модель пишет его сама вместе с картинкой. Гонял через наш агрегатор.
Сразу главный вопрос: работает ли кириллица
Это первое, что интересует любого, кто пишет по-русски. Все зарубежные обзоры проверяют текст в кадре на латинице и хвалят. А что с нашими буквами?
Проверял двумя промптами. В первом нужно было вывести титр «НАЙДИ СВОЙ ПУТЬ» на фоне горного гребня.
Создай 8-секундное раскрытие титра для премиальной кампании об активном отдыхе. [0-3с] Чёрный треккинговый ботинок ступает на мокрый сланец в туманном горном перевале; близкий низкий ракурс, звук дождя и протектора по камню. [3-6с] Камера поднимается вслед за ботинком, туман расходится и открывает широкий горный гребень на рассвете. [6-8с] По центру кадра появляется точный титр «НАЙДИ СВОЙ ПУТЬ» чистыми белыми прописными буквами на фоне тёмного гребня, затем замирает неподвижно. Выведи только этот титр и только эти три слова. Никакого другого текста, без опечаток, без логотипов, без лишних букв, без субтитров. Сдержанная кинематографическая цветокоррекция, 16:9.
Модель отрисовала титр чисто: правильные буквы, ровный кернинг, без лишних символов, титр держится неподвижно все финальные секунды.
Во втором был интерфейс игрового инвентаря с тремя подписями: «КАРТА», «СНАРЯЖЕНИЕ» и «КОМПАС».
Создай 10-секундный ролик-демонстрацию продукта в формате 16:9 для вымышленной стратегической игры: интерфейс инвентаря. [0-3с] Курсор открывает тёмно-серую панель снаряжения с тремя чётко разделёнными ячейками предметов; тихие щелчки интерфейса. [3-7с] Курсор перетаскивает бронзовый компас из левой ячейки в центральную; центральная ячейка получает мягкую синюю подсветку контура. [7-10с] Панель закрывается, открывая чистый внутриигровой вид: путник держит бронзовый компас на закате. Подписи интерфейса выведи точно так: «КАРТА», «СНАРЯЖЕНИЕ», «КОМПАС». Без лишних меню, без нечитаемого текста, без перекрывающихся панелей, без рук на клавиатуре. Контролируемая камера как при записи экрана, чёткие края интерфейса, сдержанное движение.
Все три подписи отрисованы верно. Но тут же вылезла проблема. В кадре была четвёртая, незаданная ячейка, и модель заполнила её сама - получилось «КОУЕННОВСИРИМ», набор букв, похожий на слово, но бессмысленный. Вывод: H3 отлично рисует ту кириллицу, которую вы явно прописали, и сочиняет ерунду там, где вы промолчали. Перечисляйте каждую видимую надпись, а остальное запрещайте отдельной строкой.
Ещё наблюдение: описание сцены модель прекрасно понимает по-русски. Ни один из десяти промптов не пришлось переводить обратно на английский.
Тайминги в промпте работают буквально
Формат, где сцена расписана по секундам, оказался самым надёжным приёмом подборки.
Создай 12-секундный тизер оригинального научно-фантастического триллера. [0-3с] Сверхкрупный план: рука в перчатке смахивает иней с треснувшего иллюминатора космического корабля; начинается низкий электрический гул. [3-7с] Резкая склейка на общий план интерьера: тот же астронавт стоит один в тёмной обзорной палубе, по помещению проходит красный аварийный свет; медленный наезд камеры вперёд. [7-10с] Резкая склейка на иллюминатор: огромный безмолвный объект проплывает за стеклом, заслоняя звёзды. [10-12с] Уход в чёрное. Один глубокий удар, затем тишина. Без читаемого текста, без логотипов, без комедии, без лишних членов экипажа. Высококонтрастный практический свет, кинематографический 21:9.
Детектор смены планов нашёл в готовом ролике ровно одну жёсткую склейку - на отметке 3,0 секунды. Именно там, где я её и просил. При этом содержание внутри куска модель трактует вольнее: огромный объект, который должен был проплыть за стеклом, толком не появился. Тайминг железный, наполнение творческое.
Базовый кадр без референсов
С этого промпта я начинал - проверить, тянет ли модель обычную режиссёрскую задачу без вложений.
Одинокий веломеханик закрывает узкую мастерскую в синий час. Один непрерывный кадр на 8 секунд: начинаем средне-общим планом от дверного проёма, механик опускает металлическую штору, затем медленный наезд камеры, тёплый свет ламп накаливания разливается по разбросанному инструменту и мокрому асфальту снаружи. Механик замирает, смотрит на улицу и выключает лампу над верстаком. Естественный шум дождя, шорох шин по мокрому асфальту вдалеке, один мягкий лязг шторы, без диалогов, без субтитров, без логотипов, без посторонних людей. Приземлённая современная драма, сдержанная холодно-синяя и янтарная палитра, реалистичные материалы, 16:9.
Мастерская, синий час, мокрый асфальт, тёплый свет ламп внутри против холодного снаружи, медленный наезд. Одна непрерывная сцена, ни одной лишней склейки.
Переход между двумя кадрами
Третий промпт строится на приёме, где начальный и конечный кадры заданы жёстко, а модель придумывает середину. Я сгенерировал два кадра: женщина в ярко-жёлтом пальто в вагоне метро и залитая солнцем песчаная дюна сверху.
Используй первый кадр как открывающую композицию, а последний кадр как обязательную финальную композицию. Создай 7-секундный переход: камера с рук на 35 мм следует за женщиной в ярко-жёлтом пальто, идущей по переполненному вагону метро. Когда двери закрываются, свет в салоне один раз мигает; камера наезжает на жёлтое пальто, пока кадр не заполняется жёлтой тканью. Продолжи движение в финальный кадр, где жёлтая ткань превратилась в залитую солнцем песчаную дюну, снятую сверху. Перенеси грохот поезда в звук сухого ветра. Сохрани движение героини вперёд. Без текста, без логотипов, без лишних склеек.
Модель наехала на пальто, пока жёлтая ткань не заполнила экран, и вывела из неё дюну. Фактура ворса в момент перехода рифмуется с рябью песка. Приём рабочий, но требует, чтобы у двух кадров было что-то общее - здесь общим был цвет и форма изгиба.
Референсное лицо действительно держится
Отдельно генерировал портрет девушки-блогера и отдавал его модели как источник внешности, а голос - отдельным аудиофайлом.
Используй Изображение 1 только для лица, волос, пропорций тела и внешности героини. Используй Аудио 1 только для её говорящего голоса и вокального характера. Создай 10-секундный вертикальный ролик автора в светлой домашней студии: героиня протягивает к камере небольшой блокнот для эскизов, улыбается и произносит: «Три эскиза, одна ясная идея». Начни со среднего плана, затем сделай мягкий шаг камерой ближе, пока блокнот входит в передний план. Мягкий свет из окна, достоверный шум комнаты, лёгкое движение бумаги, естественная синхронизация губ. Сохраняй внешность с Изображения 1 на всём ролике. Не меняй голос, не добавляй субтитры, не добавляй других людей, 9:16.
В готовом ролике та же героиня: те же веснушки, та же причёска, тот же светлый свитер. Камера делает шаг ближе, блокнот входит в передний план, лицо не поплыло ни на одном кадре.
Перенос движения с чужого видео
Пятый промпт просит взять движение камеры из одного видео, а внешность исполнителя из фотографии. Пришлось сначала снять сам референс движения - короткий круговой объезд пустой репетиционной комнаты.
Используй Видео 1 только для движения камеры и ритма тела: повтори его низкий круговой объезд. Используй Изображение 1 только для внешности исполнителя, одежды и черт лица. Создай 9-секундный клип музыкального выступления в пустой бетонной репетиционной комнате. Исполнитель начинает спиной к камере, один раз поворачивается в такт и заканчивает лицом к камере, не меняя внешности и костюма. Один непрерывный круговой проезд камеры, боковой свет через высокие окна, пыль в воздухе, скупой электронный бит и звук скольжения обуви. Без толпы, без зеркал, без текста, без смены костюма, 16:9.
Исполнитель начинает спиной к камере, разворачивается и заканчивает лицом, а камера всё это время идёт по дуге. Костюм и комната не изменились. Два источника, две разные роли, и они не подрались между собой.
Товарка со звуком
Здесь важен не столько кадр, сколько то, что модель пишет физические звуки предмета сама.
Создай 9-секундный вертикальный ролик-раскрытие товара: матовая кобальтово-синяя термобутылка на чёрной каменной столешнице. [0-2с] Капли конденсата скатываются по бутылке почти в тишине; макро-движение камеры от крышки к корпусу без логотипов. [2-6с] Рука поднимает бутылку, откручивает крышку и наливает газированную воду в прозрачный стакан; крупным стереозвуком передай щелчок крышки, шипение пузырьков и звук льющейся воды. [6-9с] Рука ставит бутылку рядом с наполненным стаканом, утренний свет даёт чистый контурный блик. Минималистичная тёмная кухня, резкий фокус на товаре, реалистичные вода и металл, без названия бренда, без этикеток, без закадрового голоса, 9:16.
Щелчок крышки, шипение пузырьков, звук льющейся воды - всё в одной генерации, отдельного этапа озвучки нет. Единственный прокол: стакан между планами поменял форму с низкого на высокий.
Лучший результат подборки: замена предмета
Восьмой промпт мне понравился больше всех, потому что его проще всего проверить. Сначала я сгенерировал исходник: мужчина в тёмном пальто идёт по мокрой вечерней улице с красным зонтом. Потом отдал этот ролик модели с задачей поменять только зонт на прозрачный.
Используя загруженное видео, сохрани оригинальное движение камеры, актёра, направление света, фон, кадрирование, цветокоррекцию, звуковую подложку и тайминг. Измени только красный зонт в руке актёра на прозрачный зонт с видимыми каплями дождя и реалистичными бликами по краю. Сохрани хват руки, темп ходьбы, тень и положение зонта без изменений. Не меняй лицо актёра, пальто, улицу, силу дождя, витрины и любой уже присутствующий текст. Замена должна следовать оригинальному движению на протяжении всего ролика.
Сравнил кадры попарно. Актёр тот же, пальто то же, походка та же, витрины на тех же местах, отражения на асфальте те же, движение камеры не сбилось. Поменялся ровно один предмет. Для правок готового материала это очень практичная штука: не надо переснимать сцену целиком из-за одной детали.
Максимальный брифинг: пять референсов сразу
Последний промпт - самый сложный. Лицо с одной картинки, ветровка со второй, кроссовки с третьей, движение камеры с видео, голос с аудио. Плюс три куска по таймкодам.
Используй Изображение 1 только для лица, волос, пропорций тела и внешности спортсмена. Используй Изображения 2 и 3 только для кобальтовой беговой ветровки, кроссовок и деталей продукта. Используй Видео 1 только для низкого бокового движения камеры вдоль героя. Используй Аудио 1 только для дыхания бегуна и произнесённой реплики «Не останавливайся». [0-4с] Едем сбоку рядом со спортсменом, бегущим в одиночку по мокрому городскому мосту перед рассветом; сохрани низкое боковое движение камеры из Видео 1. [4-8с] Переходим на крупный профиль, спортсмен произносит «Не останавливайся», попадая в Аудио 1. [8-12с] Склейка на кроссовок, приземляющийся в мелкую лужу, затем возврат к спортсмену, бегущему в бледный утренний свет. Изображения 2 и 3 использовать только для точной передачи одежды и обуви. Сохраняй внешность с Изображения 1. Мокрые шаги, контролируемое дыхание, далёкий шум транспорта, без логотипов, без других бегунов, без лишних реплик, без текста.
Роли между файлами модель не перепутала: спортсмен с нужным лицом бежит в нужной ветровке и в нужных кроссовках. Склейки встали на 4,08, 8,08 и 10,08 секунды - ровно по заданной сетке.
На какие грабли я наступил
Первое. Загрузка референсов - это не просто «прикрепить файл». Каждому файлу нужно явно указывать тип: картинка, видео или аудио. Пока я слал всё одним типом, генерации с видео и звуком падали с невнятной ошибкой, а деньги возвращались на баланс. Как только тип начал проставляться правильно, всё заработало с первого раза.
Второе. У аудио-референса жёсткие границы длительности: от двух до пятнадцати секунд. Моя реплика «Не останавливайся» вышла короче - 1,07 секунды, и модель отказалась работать. Лечится добавлением тишины в конец файла.
Третье. Ролики отдаются на двадцати четырёх кадрах в секунду, и это константа, а не настройка. В стандартном качестве горизонтальный кадр выходит 1344 на 768, вертикальный - 768 на 1344, сверхширокий - 1536 на 672. Звуковая дорожка есть у всех десяти роликов без исключения.
Что в итоге
Десять роликов, суммарно около полутора минут готового материала. Склейки внутри одной генерации встречаются там, где я их заказывал таймкодами, и не появляются там, где просил непрерывный кадр - в семи роликах из десяти детектор не нашёл ни одной лишней склейки. Ни одна генерация не потребовала больше одной попытки после того, как я починил загрузку референсов.
Если делаете короткие ролики для соцсетей, товарку или превью, самые полезные приёмы отсюда - замена предмета в готовом кадре, фиксация лица по фотографии и раскладка сцены по таймкодам. Эти три вещи работают предсказуемо и экономят пересъёмку.
Если нужен текст в кадре на русском - он получится, но перечисляйте каждую надпись явно и отдельной строкой запрещайте всё остальное. Иначе модель допишет своё.
А какой из приёмов кажется вам самым полезным? И что бы вы прогнали через модель первым делом - напишите, интересно сравнить.

































