Вышла новая модель для понимания видео MOSS-VL-Realtime
Спроектирована новая открытая модель MOSS-VL-Realtime (https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime) с 11B параметров для потокового понимания видео в реальном времени, переводящая ИИ из режима "запись" в режим "прямой эфир".
Основная идея заключается в том, что мир не ждёт и нужно жить в настоящем, отвечая, замолкая и корректируя себя на лету.
Три базовых поведения обеспечили ответ в любой момент по текущему кадру без задержки, проактивное молчание, когда информации недостаточно, и своевременную коррекцию, меняющую ответ сразу при изменении сцены.
Видеокадры с абсолютными временными метками, вопросы пользователя и ответы модели передавали вперемешку единым потоком. Осознанное молчание обозначили специальным токеном <|silence|>. Кросс-внимание архитектурно разделили, снизив задержки, и добавили единое пространственно-временное представление XRoPE.
Среди демо-сценариев было видеонаблюдение с оповещениями, живой комментарий, счёт в реальном времени, интерактивное чтение и отслеживание изменений.
В результате набраны лидирующие показатели на бенчмарках потокового видео (OVOBench, OmniMMI, StreamingBench, ProactiveVideoQA) с мощной офлайн-базой высоких метрик восприятия, темпорального анализа, понимания длинных видео и документов.


