Вышла новая модель GLM-5.3-Flash
Объявлена первая нативно мультимодальная модель GLM-5.3-Flash (https://huggingface.co/zai-org/GLM-5.3-Flash) из серии GLM-5 с 320B всего и 18B активных параметров.
Архитектура представляет собой гибрид линейного и разреженного внимания, задействующий технологию Manifold-Constrained Hyper-Connections (mHC) и претрейн на 30T мультимодальных токенов.
Анонимно тестируемая ox-alpha (кодовое имя для GLM-5.3-Flash) стала самой популярной на OpenCode и OpenRouter, обслуживаясь на китайских ИИ-чипах.
Визуальный кодинг использует нативное зрение для фронтенда, игр и CUA, позволяя проводить самопроверку через рендеринг и RL с обратной связью среды.
Оптимизация обслуживания добилась 3-кратного ускорения и стоимости как у NVIDIA на кластере китайских чипов с SGLang-движком, W8A8-квантованием, ReplaySSM и EPD-декомпозицией.
В результате модель превосходит GLM-5.2 при цене в 10 раз ниже, приближаясь к Claude Opus 4.8 в кодинге и агентных задачах с эффективностью 57 баллов в AI Index v4.1.1 при 0,045 доллара за задачу, расходуя в 3 раза меньше вычислений внимания и в 4.4 раза меньше KV-кэша, чем у GLM-5.3, показывая 63.4 на DeepSWE (против 46.2 у GLM-5.2), 48.8 на AutomationBench (26.2), 84.3 на Terminal Bench и уровень почти как у Opus 4.8 на Z.ai Code Bench.



