Случай с нидерландской спортсменкой Манон Хекман (Manon Hekman)
Во время марафона по спидскейтингу (конькобежному спорту на роликовых коньках) в 2025 году.
На ходу у Манон Хекман заклинило подшипник в роликовом коньке, после чего одно из колёс отделилось. Это произошло прямо во время прохождения марафонской дистанции (42 км). Ситуация была критической: потеря колеса и заклинивший подшипник нарушили баланс и устойчивость.
Несмотря на аварию, Манон Хекман проявила невероятное самообладание и силу воли. Она не сошла с дистанции, а продолжила движение, пытаясь стабилизировать движение и сохранить контроль над роликом. Ей пришлось приложить максимум усилий, чтобы не потерять равновесие и не упасть на высокой скорости.
"Человек-паук: Новый день" и BMW
В фильме "Человек-паук: Новый день" компания BMW заплатила за то, чтобы все модели BMW, выпущенные после 2020 года, были представлены на экране. Когда вы заводите машину, вам показывается реклама фильма.
Вышла новая модель для понимания видео Mage-VL
Презентована новая эффективная потоковая мультимодальная модель Mage-VL (https://huggingface.co/microsoft/Mage-VL), решающая парадокс Моравека (сильные в офлайн-рассуждениях, но неэффективные в потоковом восприятии) за счёт кодек-ориентированного подхода.
Зрительный токенизатор Mage-ViT вместо равномерной выборки кадров избирательно кодирует динамические, насыщенные информацией области, используя векторы движения и остаточную энергию на уровне патчей 16×16, сокращая потребление визуальных токенов более чем на 75% с сохранением пространственно-временного контекста.
Обучение с нуля на примерно 560M немаркированных изображений и 100M видеокадров позволило достичь или превзойти энкодеры, обученные на миллиардах пар изображение-текст (например, SigLIP2).
Архитектура двойной системы из лёгкого System 1 (гейт событий) и каузального System 2 (языковой декодер) для проактивного потокового взаимодействия предоставила модели возможность самой решать, когда реагировать на события в реальном времени.
Семь ключевых эмпирических выводов сводятся к тому, что веб-масштабное предобучение не обязательно для зрительных энкодеров, предобучение с переменным разрешением даёт монотонный рост качества с увеличением токенов, кодек-ориентированная токенизация создаёт превосходный компромисс точности и эффективности, явный SFT для длинных VideoQA избыточен, так как достаточно насыщенных видеоподписей и короткого SFT, динамическое видеообучение усиливает статическое пространственное мышление (синергия движения и геометрии), AI4AI-пайплайн с оптимизацией промтов и кода систематически повышает качество данных, а Zero-Vision SFT (чисто текстовый SFT перед RL) раскрывает мощные мультимодальные RL-способности.
В результате Mage-VL-4B сравним с Qwen3-VL-4B на статических задачах, значительно лучше в понимании видео и пространственном мышлении (2D и 3D), с ускорением вывода до 3,5 раза, превосходя 15B Phi-4-reasoning-vision.
Прощай, шерсть! Привет, пингвинчик!
Активные выходные на роликах. Ярославль и Москва
Жена с детьми уехали в отпуск. Меня этим летом не отпускают, да и ценник на отпуск очень уж не маленький. Поэтому в голове возникла идея скататься к коллегам в Ярославль, а заодно (когда ещё выпадет такая возможность) покататься на роликах по городам.
Итог:
По Ярославлю в субботу - маршрут не записался, но по моим прикидкам с 7 утра до 12 и после с 17 до 19 проехал где-то 50ки. Это было сложно, потому что надо было думать куда ехать.
А вот в воскресенье с 11 утра до 19 вечера - 70км на роликах по Москве и это было легче)
Да ещё и внезапно купил себе новые ролики с жёстким ботинком, вместо моих фитнесов.
Вышла новая модель для понимания видео MOSS-VL-Realtime
Спроектирована новая открытая модель MOSS-VL-Realtime (https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime) с 11B параметров для потокового понимания видео в реальном времени, переводящая ИИ из режима "запись" в режим "прямой эфир".
Основная идея заключается в том, что мир не ждёт и нужно жить в настоящем, отвечая, замолкая и корректируя себя на лету.
Три базовых поведения обеспечили ответ в любой момент по текущему кадру без задержки, проактивное молчание, когда информации недостаточно, и своевременную коррекцию, меняющую ответ сразу при изменении сцены.
Видеокадры с абсолютными временными метками, вопросы пользователя и ответы модели передавали вперемешку единым потоком. Осознанное молчание обозначили специальным токеном <|silence|>. Кросс-внимание архитектурно разделили, снизив задержки, и добавили единое пространственно-временное представление XRoPE.
Среди демо-сценариев было видеонаблюдение с оповещениями, живой комментарий, счёт в реальном времени, интерактивное чтение и отслеживание изменений.
В результате набраны лидирующие показатели на бенчмарках потокового видео (OVOBench, OmniMMI, StreamingBench, ProactiveVideoQA) с мощной офлайн-базой высоких метрик восприятия, темпорального анализа, понимания длинных видео и документов.







