Вышла новая модель для генерации видео Wan-Animate-2
Демонстрирована новая модель Wan-Animate-2 (https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B) для сквозной анимации персонажей без промежуточных представлений движения.
Архитектура переработанного Diffusion Transformer напрямую потребляет управляющее видео и включает двухветвевой DiT (опорная и целевая ветви) с раздельными временными шагами, RoPE с временным выравниванием для синхронизации позиционных эмбеддингов между ветвями и разреженно-ссылочное внимание, дающее каждому токену целевого кадра видеть только соответствующий токен опорного кадра, резко снижая вычислительную сложность.
Ракурсом управляет LoRA точки обзора, обученная на синтетических данных, позволяя задавать положение камеры текстовой подсказкой (например, "вид справа 60°, сверху"), разрывая жёсткую связь с ракурсом управляющего видео.
Режим реального времени в Wan-Animate 2 Lite потребовал трёхэтапного обучения. Предварительно обучали методом принудительного обучения (Teacher Forcing) с авторегрессией по чанкам и буфером ошибок для устойчивости к накоплению сбоев. Впоследствии дистиллировали методом самопринуждения (Self-Forcing) с почаночным обратным распространением, позволяющим сжать многошаговый процесс удаления шума примерно до 3 шагов без потери качества на масштабе 14B.
В результате качество превосходит открытые аналоги и не уступает коммерческим системам (Dreamina, Kling), достигая потоковой генерации 24 fps на четырёх H100.


