Вышла новая модель A.X K2
Описана новая MoE-модель A.X. K2 (https://huggingface.co/skt/A.X-K2) на 688B параметров, 33B активных, созданная как основа для агентных приложений.
Обучение на объёме около 8.5T токенов (меньше, чем у предшественника A.X K1) помогло достичь прироста качества за счёт более чистого и релевантного набора данных, несмотря на меньший объём.
Sparse Gated Attention (SGA) сочетает разреженное внимание и стробирование для эффективной обработки длинных контекстов (до 256K) и подавления "токенов-стоков", а Gated Norm (GN) нормализует с гейтом для стабилизации обучения и устойчивости к низкоточному (FP8 и FP4) выводу.
Метод слияния размышлений (Think-Fusion) посредством SFT на парных данных позволил одной модели по команде переключаться между режимами с длинной цепочкой размышлений ("thinking") и быстрым ответом ("non-thinking").
В результате она конкурентоспособна с передовыми открытыми моделями, лидируя в математических (AIME26, Apex) и корейских (KMMLU-Pro, CLIcK) бенчмарках, наряду с этим демонстрируя сильные агентные способности (τ²-Bench Telecom).


