Вышла новая модель Motif 3
Представлена новая MoE-модель Motif 3 (https://huggingface.co/Motif-Technologies/Motif-3) с 314B всего и 13.2B активных параметров на токен, нацеленная на сильные результаты в рассуждениях, коде, инструментах и длинном контексте, основываясь на тонкой экспертной разреженности, новом внимании GDLA, стабильной оптимизации, эффективном обучении на 12.5T токенов и многоэтапном пост-тренинге.
Архитектура MoE содержит 51 слой с 384 маршрутизируемыми экспертами, из которых 8 выбираются на каждый токен (top-8) и один общий эксперт, причём все они с функцией активации Expert-Specific PolyNorm (свои коэффициенты у каждого эксперта). GDLA (Grouped Differential Latent Attention) объединил дифференциальное внимание (подавление шума) и латентное сжатие KV-кэша (MLA), используя общие KV-головы (16) для сигнальных и шумовых голов (64/16), модулируя выход гейтом от латентного запроса. Модифицированные многообразно-ограниченные гиперсвязи (mHC) свели 4 параллельных потока остатков с обучаемыми маршрутизаторами, снизив масштаб пост-отображения с 2 до 1 в ходе обучения для подавления выбросов. Одна дополнительная голова MTP предсказывает несколько токенов (как в DeepSeek-V3).
Систему обучения оптимизировали без пайплайнов, параллельно распределяя экспертов (8 GPU) и FSDP2, пересчитывая активации и выполняя полный пересчёт для слоя с длиной 256K. Экономя память и коммуникации, взяли экспертные веса и активации с низкой точностью в MXFP8, передавая градиенты в BF16 и восстанавливая их в FP32, используя Muon-оптимизатор с QK-Clip. Обработку длинного контекста (до 256K) осуществили гибридным контекстным параллелизмом (Ulysses для полных слоёв, кольцевое внимание для скользящего окна).
Предобучение на данных 12.5T токенов (веб, STEM, код, математика, корейский, право, финансы) создавало динамические смеси с постепенным увеличением сложных данных, применяя токенизатор SuperBPE (220K слов) с улучшенным сжатием для английского и корейского языков и кода. MoE стабилизировали FP32-роутингом, балансировочной функцией потерь, затухающим шумом маршрутизатора, регуляризацией магнитуды FFN и мониторингом здоровья экспертов (диспетчеризация, нормы весов, косинусное сходство выходов). Конфигурация подразумевала 53 слоя (2 плотных и 51 MoE), размерность 4096, 80 голов запросов, окно внимания 128 с полным вниманием в каждом 4-м слое, размер батча до 75M токенов и график LR с этапом разогрева, стабилизации и затухания, с последующим переключением на длинный контекст.
Пост-обучение прошло на общем SFT со смесью инструкций, рассуждений, кода и агентных траекторий, маскируя потери только на ответах ассистента. Дальше подключили специализированных учителей (RL), включая 6 GRPO-учителей (агентные инструменты, профессиональная работа, длинный контекст с воздержанием, математика, код и наука, чат) и 1 SFT-учителя (Software Engineering), асинхронно внедряя GRPO с коррекцией важности и оффлайн-фильтрацией промтов. Потом обратились к MOPD (Multi-teacher On-Policy Distillation), где студент инициализировался SFT-моделью и принимал сигнал от учителей на их доменах без наград среды, притом MTP и параметры роутеров заморозили, дабы дистилляцией объединить навыки без ухудшения общих способностей.
Текущие ограничения не дают полностью охватить все задачи и языки, оставляя только текст и ограниченную длину агентных траекторий, но планируются более эффективные архитектуры, контекст более 1M токенов, мультимодальность и улучшение долгосрочного планирования.
В результате сравнения Motif 3 с сильнейшими открытыми моделями сильными сторонами оказались агентные и инструментальные задачи (лидерство на τ^3-Banking, высокий результат на Terminal-Bench 2.1), хорошие показатели в кодинге (SWE-bench) и математике (IMO-AnswerBench), баланс точности и отсутствие галлюцинаций (Omniscience), а помимо этого конкурентоспособность в длинном контексте (AA-LCR) и следовании инструкциям.



