Вышла новая модель Qwen3.8-Flash-Next
Показана новая модель Qwen3.8-Flash-Next (https://huggingface.co/collections/Qwen/qwen38-flash-next) с разреженным MoE, 125B параметров всего, 6B активирующимися на токен и ещё 51B параметров N-граммных эмбеддингов вне акселератора.
Токенное смешивание образует гибрид Gated DeltaNet (GDN) и глобального внимания, применяя полное внимание на каждом четвёртом слое. При продолжении обучения его заменяют на Qwen Sparse Attention (QSA) в виде сжатого индексера на уровне микроблоков, снижая стоимость индексации.
Gated Residual (GR) расширяет остаточный поток до 4 ветвей, читая данные через поэлементный гейт и добавляя ёмкость со стабильностью.
N-граммные эмбеддинги формируют один слой вне основного тела, подгружая таблицы из памяти хоста, масштабируя параметры без роста FLOPs.
Изменения оценивали по трём осям и, в частности, по качеству (потери и бенчмарки), стоимости (обучение, предварительное заполнение, декодирование), стабильности и оптимальным гиперпараметрам.
Функция потерь и качество на прикладных задачах не всегда коррелируют (рост N-граммного словаря снижает потери, но качество насыщается), вдобавок оптимизатор Muon сдвигает оптимальную скорость обучения и размер батча вверх, убирая необходимость прогрева размера батча и повышая стабильность, а стресс-тесты (завышенная скорость обучения) при проверке стабильности подтвердили, что GR даёт значительный запас прочности.
В результате модель превосходит предшественника 397B-A17B на 8 из 14 бенчмарков (отставание не более 2.6 пунктов) при одной трети активированных параметров, одной трети обучающих токенов и одной девятой вычислительных затрат.


