Вышла новая модель Instella-MoE
Дебютировала новая полностью открытая MoE-модель Instella-MoE (https://huggingface.co/collections/amd/instella-moe) на 16B параметров (2.8B активны на токен), предназначенная для исследований с необходимой проверкой безопасности под лицензией Research RAIL.
Для обучения с нуля применяли графические процессоры AMD Instinct MI300X и MI325X совместно с ROCm, Primus и Miles.
Среди архитектурных решений можно выделить гейтированное многоголовое латентное внимание (Gated MLA) в виде обучаемого гейта на выходе внимания, а также FarSkip-Collective, совмещающий коммуникации и вычисления для снижения простоев, ускоряя претрейн на 12.7% и вывод (TTFT) до 39.2%.
Пайплайн обучения состоял из шести этапов. Сначала проводили претрейн на 7.1T смеси веба, кода, математики и науки. Потом мидтрейн на качественных STEM-данных со слиянием чекпоинтов. Затем контекст расширили до 64K с YaRN и маскировкой документов. Дальше наступил этап SFT на инструктивном и рассуждающем датасете с целевым добором примеров под ошибки. Вскоре приступили к обучению предпочтениям через DPO, отключив функцию потерь балансировки экспертов для стабильности. На заключительном двухэтапном RL (Miles) перешли от IF-специализированного GRPO к Multi-Teacher On-Policy Distillation (MOPD).
В результате Base-модель со средним показателем 76.7 сильнее всех полностью открытых моделей, обходя SmolLM3-3B и OLMo-3-7B, конкурируя с Qwen3.5-4B. Длинный контекст демонстрирует 41.5 на HELMET и 79.4 на RULER на 64k токенов. Think-модель со средним показателем 73.22 получилась лучшей среди полностью открытых, значительно улучшившись на IFEval до 83.7.



