Новости
211 постов
211 постов
42 поста
2 поста
8 постов
62 поста
12 постов
7 постов
Презентована новая модель Qwen-Drive-1.0 (https://huggingface.co/Qwen/Qwen-Drive-1.0-4B), делающая первый шаг к единой визуально-языковой базовой модели для автономного вождения, объединяющей 3D-восприятие, визуальные ответы на вопросы (VQA) и планирование движения без изменения архитектуры предобученной VLM.
Архитектура использует предобученную мультимодальную модель Qwen3.5-4B (общий визуальный энкодер и VLM) с добавленными двумя внешними модулями. BEV-голова восприятия выполняет 3D-детекцию, предсказание семантической занятости и сегментацию BEV-карты, работая "зондом" для извлечения 3D-информации из общих представлений. Эксперт по планированию генерирует будущую траекторию эго-агента через сопоставление потоков, используя кэшированные ключи и значения VLM.
Четыре этапа обучения стартовали с предобучения BEV-головы (заморожены VLM и энкодер, обучается только голова), после чего перешли к совместному обучению восприятия и VQA, обновляющему энкодер, VLM и BEV-голову, смешивая данные вождения и общие визуально-языковые данные для сохранения базовых возможностей. Затем предобучили эксперта по планированию, заморозив VLM и энкодер, обучая его только генерации траектории (сопоставление потоков) с опциональным текстовым рассуждением. Под конец провели обучение с подкреплением (RL), оптимизируя эксперта по планированию на целевых метриках (PDMS, RFS, ADE) с групповым относительным преимуществом.
Данные меток для восприятия унифицировали (nuScenes и OpenScene), приведя их к общим классам (7 для детекции, 10 для занятости, 6 для карты), дополняя метки офлайн и сохраняя нативные сетки. Визуально-языковые данные взяли из 24 открытых датасетов (перезапись, фильтрация консистентности, получили 3.09M), прибавив собственные данные (планирование-рассуждение, порядок камер, QA по восприятию). При планировании обратились к NAVSIM, OpenScene, WOD-E2E и PAI-AV (около 2.83M примеров) с единым форматом 50 точек (5 с, 10 Гц).
Вклад содержит первую (по заявлению) VLM-модель для вождения, объединяющую восприятие, VQA и планирование без архитектурных изменений. Также дан явный BEV-зонд для 3D-восприятия и изложен рецепт этапного обучения и унификации данных, смягчающий катастрофическое забывание. Помимо того, предоставлен эксперт по планированию на сопоставлении потоков с совместным обучением на нескольких датасетах и RL-оптимизацией.
Ограничения связаны с нестабильностью причинного рассуждения при множественных причинах, неполным соответствием траектории текстовому обоснованию и разными входными форматами задач, ограничивающими перенос.
В результате восприятие превосходит специализированные детекторы по mAP или mIoU на nuScenes и OpenScene, при этом добавление 3D-надзора улучшает общие VLM-представления. У VQA присутствует значительное улучшение по метрикам вождения (77.8 на LingoQA, 66.13 на SURDS, 7.78 на Ego3D RMSE) и сильный прирост в причинных рассуждениях (в целом 41.26 на PAI-AV-CoC) с сохранением общих способностей (среднее общее VQA 66.41 против 67.40 у Qwen3.5-4B). В навыках планирования отмечены 90.7 на PDMS (NAVSIM), 7.91 на RFS (тест WOD-E2E) и снижение частоты съезда с дороги в AlpaSim с 24% до 12% после RL, а рассуждение дало небольшой прирост.
Запущено новое семейство моделей Giga-Embeddings (https://huggingface.co/ai-sage/Giga-Embeddings-instruct-480M...) (https://huggingface.co/ai-sage/Giga-Embeddings-instruct-3B-0...) (https://huggingface.co/ai-sage/Giga-Embeddings-instruct-10B-...) для создания эффективных текстовых эмбеддингов за счёт sparse Mixture-of-Experts (MoE) архитектуры и дистилляции.
10B-A1.8B (MoE) обладает разреженным энкодером, активирующим лишь примерно 1.8B из 10B параметров. Плотная 3B представляет собой модель-середняк. Для ограниченных ресурсов есть компактная дистиллированная модель 480M.
Архитектуру декодерных LLM (Qwen3, DeepSeekMoE) переделали в двунаправленные энкодеры с полной видимостью контекста и усреднённым объединением векторов. Трёхэтапный процесс обучения содержал контрастное предобучение (InfoNCE), тонкую настройку на поиске информации и многозадачное обучение (поиск информации, классификация и так далее). Дистилляция для 480M модели применяла перенос знаний через KL-дивергенцию между распределениями схожести учителя и ученика (не зависит от размерности эмбеддингов).
Среди ограничений выделяют одиночные прогоны бенчмарков (нет оценок погрешности) и использование непубличных данных (невозможность полного воспроизведения), в то же время замеры скорости привязаны к конкретному окружению (vLLM).
В результате качество 10B MoE модели лучшее внутри семейства на всех бенчмарках (EN, RU, Multi Code), лидируя в русскоязычном MTEB. По скорости 10B MoE модель оказалась самой быстрой на выводе (на 25% быстрее плотной 3B и в 1.56-2.65 раза быстрее аналогов). По компактности 480M модель превосходит FRIDA (823M) в русском MTEB, будучи на 42% меньше.
Открыта новая модель GLiNER2.5 (https://huggingface.co/collections/fastino/gliner25-models) для эффективного извлечения информации без спанов, крупно обновляющая архитектуры GLiNER в трёх версиях (base 0.2B, multi 0.3B, small 74M) под лицензией Apache 2.0.
Внутри архитектуры отказались от перебора спанов в пользу предсказания границ (начало и конец сущности), линейно масштабируя вывод от длины документа. Обучение проводили на синтетических данных от Fastino Data Agent, покрывая комбинации задач, форматы и языки, отсутствующие в публичных датасетах.
Пять новых возможностей включают длинный контекст, обрабатывающий полные документы через нативное разбиение на фрагменты с сопоставлением смещений, безлимитную длину спанов, способствующую извлечению сущностей любого размера (адреса, пункты договоров), совместное извлечение сущностей и связей, строящее согласованные графы знаний за один проход, ограниченную классификацию, декодирующую с соблюдением пользовательских правил для гарантии валидности вывода, и атрибуты спанов, извлекающие дополнительные характеристики (например, тональность, отрицание) вместе с сущностями.
В результате средний macro F1 по 16 задачам составляет 56.17 у GLiNER2.5 Multi (против 56.09 у GLiNER2 Multi) и 54.87 у GLiNER2.5 Base (против 53.34 у GLiNER2 Base), а на XNLI значительный прирост +24.75 пункта у Multi-версии.
Сделана новая модель Breeze TTS 2 (https://huggingface.co/BreezeBlue/Breeze-TTS-2), объединяющая дизайн голоса, голосовое управление и стриминг с низкой задержкой, вместе с открытыми бенчмарками.
Парадигма переходит от создания статичного контента к интерактивному голосовому ИИ в реальном времени (игры, агенты) с новыми требованиями по разнообразию, управляемости и низкой задержке.
Дизайн голоса управляет созданием уникальных голосов под персонажа по текстовому описанию, занимая первое место в бенчмарке Role Fit и Diversity.
Управление голосом позволяет изменять эмоции и интонации на лету с сохранением персонажа, беря первое место в бенчмарке Voice Direction Score.
Выдача аудио с поддержкой Realtime API (WebSocket) самая быстрая (TTFB и TTFA) для живого диалога.
В результате поддерживаются 50 языков с контролем акцента.
Предложено новое семейство универсальных мультимодальных эмбеддингов WeMM-Embedding (https://huggingface.co/collections/tencent/wemm-embedding) (2B, 4B, 9B) для текста, изображений, видео, визуальных документов и смешанных входов с гибкой размерностью выходного вектора.
Первым этапом обучения масштабно выровняли сотни миллионов пар (слабо контролируемые подписи, поиск, классификация, QA, градуированная релевантность), приведя задачи к единому парному формату с функциями потерь InfoNCE, CoSENT-ранжирования и MRL.
Вторым этапом выполняли дообучение на курированных данных (меньше по объёму, лучше качество) с добавлением ресэмплирования на основе семантических ID для баланса семантики, очистки и генерации сложных отрицательных примеров, обучения под контролем реранкеров (избирательно), а также дистилляции от более крупной модели (9B в качестве слияния специализированных вариантов служит учителем для 2B и 4B).
Архитектуру создали на основе Qwen3.5, пулинга последнего токена с L2-нормализацией и поддержки MRL (обрезание первых d измерений).
Метод MRL при 256 измерениях сохраняет более 97% качества, но при 512 уже 99%. В абляциях этапа 1 больше всего влияют пакетирование с учётом согласованности задач (-3.4 без него), инструкции (-0.8) и маскировка дубликатов (-0.5), при этом на этапе 2 последовательное добавление отобранных данных, реранкера, дистилляции и расширенного визуального бюджета даёт +2.2 на MMEB-v2.
В результате продемонстрировано 77.9 на MMEB-v2 у 2B (лучше прежних 8B-моделей) и 80.6 у 9B (SOTA), набрано 59.5 на MMEB-v3 у 9B (SOTA среди открытых, без аудио), показано 81.7 в кросс-модальном поиске (12 датасетов) у 9B и 79.8 у 2B (лучше проприетарных аналогов), одновременно на внутренних тестах (26 задач WeChat) у 2B зафиксировано 72.0 против 60.9 у Qwen3-VL-Embedding-2B. В 14 A/B-тестах были замечены улучшения, что вызвало развёртывание в рекомендациях и поиске WeChat (Каналы, Официальные аккаунты, Моменты, электронная коммерция).
Выпущена новая модель GLM-5.3 (https://huggingface.co/zai-org/GLM-5.3), улучшенная на фоне GLM-5.2 только за счёт масштабирования пост-тренировки (без изменения базовой модели).
RL масштабировали на синтезированных длинно-горизонтных окружениях, автоматически генерируя и верифицируя задачи, перенося стратегии GLM-5.2 (SAO, уплотнение) и используя фреймворк Slime.
Ввели приватный бенчмарк Z.ai Code Bench для оценки агентного кодинга и совместно с командами безопасности нашли 2436 уязвимостей в 269 реальных проектах (включая 1097 критических и высоких), ведя публичный реестр раскрытия. API больше не поддерживает отключение мышления, оставляя только режим thinking enabled с тремя уровнями усилий (low, high, max). В slime улучшили алгоритмическую гибкость и производительность, увеличив пропускную способность RL в 2.3 раза.
В результате модель оказалась сильнейшей с открытыми весами для кодинга, достигнув прироста в 50% к GLM-5.2 на внутреннем Z.ai Code Bench и SOTA на ряде публичных бенчмарков, а кибервозможности неожиданно быстро выросли, значительно прогрессируя в поиске и эксплуатации уязвимостей, но всё ещё отстают от закрытых лидеров (Mythos 5, GPT-5.6).
Анонсирована новая open-source модель Hy4 preview (https://huggingface.co/collections/tencent/hy4-preview) с 770B параметров (49B активных) и контекстом 1M токенов от Tencent.
Фокусировались на наибольшем приросте в сложных задачах для долгосрочной программной инженерии, работы с документами и научных исследований.
Усиленное предобучение и постобучение привели к значительному скачку относительно Hy3 и лидерству среди открытых моделей по ряду бенчмарков.
Применения охватывают программирование с планированием, отладкой, верификацией длинных задач и качеством клиентской части, офисную аналитику путём обработки множества файлов, создания документов, таблиц, презентаций и финансовых моделей, геймдев с генерацией прототипов, работой с движками (Unity, Godot) и многошаговым уточнением, а ещё науку с ИИ-исследованиями, молекулярной динамикой, физикой конденсированного состояния и чистой математикой (например, прорыв в задаче Бляшке-Лебега).
Интеграцию уже воплотили в CodeBuddy, WorkBuddy, Yuanbao и ima, тогда как слепое сравнение с GLM 5.3 и Kimi K3 показало небольшое преимущество.
К известным недостаткам относятся избыточное рассуждение над сложными задачами и склонность к излишней самопроверке.
В результате модель сопоставима или лучше конкурентов в агентных и инженерных задачах, например, добившись 85.4 на Terminal Bench 2.1, 64.3 на DeepSWE, 43.4 на HLE text-only и в других тестах.
Объявлена первая нативно мультимодальная модель GLM-5.3-Flash (https://huggingface.co/zai-org/GLM-5.3-Flash) из серии GLM-5 с 320B всего и 18B активных параметров.
Архитектура представляет собой гибрид линейного и разреженного внимания, задействующий технологию Manifold-Constrained Hyper-Connections (mHC) и претрейн на 30T мультимодальных токенов.
Анонимно тестируемая ox-alpha (кодовое имя для GLM-5.3-Flash) стала самой популярной на OpenCode и OpenRouter, обслуживаясь на китайских ИИ-чипах.
Визуальный кодинг использует нативное зрение для фронтенда, игр и CUA, позволяя проводить самопроверку через рендеринг и RL с обратной связью среды.
Оптимизация обслуживания добилась 3-кратного ускорения и стоимости как у NVIDIA на кластере китайских чипов с SGLang-движком, W8A8-квантованием, ReplaySSM и EPD-декомпозицией.
В результате модель превосходит GLM-5.2 при цене в 10 раз ниже, приближаясь к Claude Opus 4.8 в кодинге и агентных задачах с эффективностью 57 баллов в AI Index v4.1.1 при 0,045 доллара за задачу, расходуя в 3 раза меньше вычислений внимания и в 4.4 раза меньше KV-кэша, чем у GLM-5.3, показывая 63.4 на DeepSWE (против 46.2 у GLM-5.2), 48.8 на AutomationBench (26.2), 84.3 на Terminal Bench и уровень почти как у Opus 4.8 на Z.ai Code Bench.