Вышла новая модель Muse Glimmer
Разработана новая 30-миллиардная причинно-следственная модель Muse Glimmer (https://huggingface.co/collections/meta-models/muse-glimmer) с выделенным зрительным кодировщиком, дистиллированная из Muse Spark, предназначенная для автономных агентных задач на потребительском оборудовании (Mac и PC с одной GPU) под лицензией Apache 2.0.
Внутри единой модели без облака реализовали сквозное выполнение агентных задач с многошаговыми рассуждениями и восстановлением после сбоев. Организовали надёжный вызов инструментов по строгим схемам. Также поддерживается совместимость с агентскими фреймворками, такими как OpenClaw и Hermes Agent. Для баланса качества и скорости добавили контролируемое усилие рассуждения (низкое, среднее, высокое и сверхвысокое). Многоязычности добились обучением на данных более чем 100 языков.
Архитектуру и оптимизацию направляли под локальный запуск через плотный каузальный трансформер (29.6B параметров, включая зрительный энкодер ViT-G/14 около 1.8B) и контекст более 131K токенов. Квантованием до примерно 4 бит модель сжали менее чем до 20 ГБ, позволив ей работать в 24 и 32 ГБ VRAM с минимальным падением точности (0.2-1.0%). Спекулятивным декодированием с помощью облегчённого "драфтера" DFlash (блоки по 16 токенов) ускорили генерацию с 74.9 до 233.4 ток/с (в 3.1 раза) на RTX 5090, с 23.7 до 37.8 ток/с (в 1.5 раза) на Apple M4 Max и с 26.6 до 50.2 ток/с (в 1.8 раза) на Apple M5 Max.
Контентную безопасность, агентские риски, приватность и подготовленность (вместе с химией, биологией, кибербезопасностью и потерей контроля на умеренном или низком уровне) оценивали по четырём осям. Для корректных информационных потоков прибегали к встроенным мерам защиты, таким как Safety SFT, Safety RL и синтетическим данным. Однако развёртывать рекомендуют с дополнительными защитами (например, подтверждением человеком необратимых действий).
Методология оценки сравнивала Muse Glimmer с моделями схожего размера везде в режиме высокого уровня рассуждений при температуре 1.0, top_p=0.95 и top_k=64, проводя агентские оценки третьих моделей в едином фреймворке, из-за чего результаты могут не отражать их максимальные возможности в специализированных средах. Дисперсию снижали, усредняя результаты по нескольким прогонам.
В результате производительность при высоком рассуждении против Gemma4-31B и Qwen3.6-27B уверенно лидирует в общих агентских бенчмарках с 75.5 на MCP-Atlas, 74.6 на DeepSearch QA, 47.6 на WildClawBench, 43.3 на Gaia2 и 23.5 на 𝛕3‑Banking (всё является лучшими результатами). Агентный кодинг достигает 51.2 на SWE-Bench Pro, 43.6 на SciCode (первые места) и 76.0 на SWE-Bench Verified (второе после Qwen). Мультимодальные возможности составляют 78.8 на Charxiv Reasoning (лидер) и на уровне конкурентов в ScreenSpot Pro, OmniDocBench, MMMU Pro. Безопасность обеспечивает низкий процент нарушений в CI Memories и отсутствие атак в Siren AgentDojo при высокой полезности. Общие способности и рассуждения набирают 94.7 на AIME 2026, 77.0 на IFBench, 65.1 на Beam128K (первые места).


