user4740118

user4740118

.
На Пикабу
Дата рождения: 4 июля
5108 рейтинг 65 подписчиков 4 подписки 502 поста 8 в горячем
Награды:
Пикабу 17 лет!В 2026 год с Пикабу! Праздничный постер Пикабу 16 лет!
2

Вышла новая модель для автономного вождения Qwen-Drive-1.0

Серия Новости

Презентована новая модель Qwen-Drive-1.0 (https://huggingface.co/Qwen/Qwen-Drive-1.0-4B), делающая первый шаг к единой визуально-языковой базовой модели для автономного вождения, объединяющей 3D-восприятие, визуальные ответы на вопросы (VQA) и планирование движения без изменения архитектуры предобученной VLM.

Архитектура использует предобученную мультимодальную модель Qwen3.5-4B (общий визуальный энкодер и VLM) с добавленными двумя внешними модулями. BEV-голова восприятия выполняет 3D-детекцию, предсказание семантической занятости и сегментацию BEV-карты, работая "зондом" для извлечения 3D-информации из общих представлений. Эксперт по планированию генерирует будущую траекторию эго-агента через сопоставление потоков, используя кэшированные ключи и значения VLM.

Четыре этапа обучения стартовали с предобучения BEV-головы (заморожены VLM и энкодер, обучается только голова), после чего перешли к совместному обучению восприятия и VQA, обновляющему энкодер, VLM и BEV-голову, смешивая данные вождения и общие визуально-языковые данные для сохранения базовых возможностей. Затем предобучили эксперта по планированию, заморозив VLM и энкодер, обучая его только генерации траектории (сопоставление потоков) с опциональным текстовым рассуждением. Под конец провели обучение с подкреплением (RL), оптимизируя эксперта по планированию на целевых метриках (PDMS, RFS, ADE) с групповым относительным преимуществом.

Данные меток для восприятия унифицировали (nuScenes и OpenScene), приведя их к общим классам (7 для детекции, 10 для занятости, 6 для карты), дополняя метки офлайн и сохраняя нативные сетки. Визуально-языковые данные взяли из 24 открытых датасетов (перезапись, фильтрация консистентности, получили 3.09M), прибавив собственные данные (планирование-рассуждение, порядок камер, QA по восприятию). При планировании обратились к NAVSIM, OpenScene, WOD-E2E и PAI-AV (около 2.83M примеров) с единым форматом 50 точек (5 с, 10 Гц).

Вклад содержит первую (по заявлению) VLM-модель для вождения, объединяющую восприятие, VQA и планирование без архитектурных изменений. Также дан явный BEV-зонд для 3D-восприятия и изложен рецепт этапного обучения и унификации данных, смягчающий катастрофическое забывание. Помимо того, предоставлен эксперт по планированию на сопоставлении потоков с совместным обучением на нескольких датасетах и RL-оптимизацией.

Ограничения связаны с нестабильностью причинного рассуждения при множественных причинах, неполным соответствием траектории текстовому обоснованию и разными входными форматами задач, ограничивающими перенос.

В результате восприятие превосходит специализированные детекторы по mAP или mIoU на nuScenes и OpenScene, при этом добавление 3D-надзора улучшает общие VLM-представления. У VQA присутствует значительное улучшение по метрикам вождения (77.8 на LingoQA, 66.13 на SURDS, 7.78 на Ego3D RMSE) и сильный прирост в причинных рассуждениях (в целом 41.26 на PAI-AV-CoC) с сохранением общих способностей (среднее общее VQA 66.41 против 67.40 у Qwen3.5-4B). В навыках планирования отмечены 90.7 на PDMS (NAVSIM), 7.91 на RFS (тест WOD-E2E) и снижение частоты съезда с дороги в AlpaSim с 24% до 12% после RL, а рассуждение дало небольшой прирост.

Показать полностью 3
1

Вышла новая модель Giga-Embeddings

Серия Новости
Вышла новая модель Giga-Embeddings

Запущено новое семейство моделей Giga-Embeddings (https://huggingface.co/ai-sage/Giga-Embeddings-instruct-480M...) (https://huggingface.co/ai-sage/Giga-Embeddings-instruct-3B-0...) (https://huggingface.co/ai-sage/Giga-Embeddings-instruct-10B-...) для создания эффективных текстовых эмбеддингов за счёт sparse Mixture-of-Experts (MoE) архитектуры и дистилляции.

10B-A1.8B (MoE) обладает разреженным энкодером, активирующим лишь примерно 1.8B из 10B параметров. Плотная 3B представляет собой модель-середняк. Для ограниченных ресурсов есть компактная дистиллированная модель 480M.

Архитектуру декодерных LLM (Qwen3, DeepSeekMoE) переделали в двунаправленные энкодеры с полной видимостью контекста и усреднённым объединением векторов. Трёхэтапный процесс обучения содержал контрастное предобучение (InfoNCE), тонкую настройку на поиске информации и многозадачное обучение (поиск информации, классификация и так далее). Дистилляция для 480M модели применяла перенос знаний через KL-дивергенцию между распределениями схожести учителя и ученика (не зависит от размерности эмбеддингов).

Среди ограничений выделяют одиночные прогоны бенчмарков (нет оценок погрешности) и использование непубличных данных (невозможность полного воспроизведения), в то же время замеры скорости привязаны к конкретному окружению (vLLM).

В результате качество 10B MoE модели лучшее внутри семейства на всех бенчмарках (EN, RU, Multi Code), лидируя в русскоязычном MTEB. По скорости 10B MoE модель оказалась самой быстрой на выводе (на 25% быстрее плотной 3B и в 1.56-2.65 раза быстрее аналогов). По компактности 480M модель превосходит FRIDA (823M) в русском MTEB, будучи на 42% меньше.

Показать полностью
1

Вышла новая модель GLiNER2.5

Серия Новости

Открыта новая модель GLiNER2.5 (https://huggingface.co/collections/fastino/gliner25-models) для эффективного извлечения информации без спанов, крупно обновляющая архитектуры GLiNER в трёх версиях (base 0.2B, multi 0.3B, small 74M) под лицензией Apache 2.0.

Внутри архитектуры отказались от перебора спанов в пользу предсказания границ (начало и конец сущности), линейно масштабируя вывод от длины документа. Обучение проводили на синтетических данных от Fastino Data Agent, покрывая комбинации задач, форматы и языки, отсутствующие в публичных датасетах.

Пять новых возможностей включают длинный контекст, обрабатывающий полные документы через нативное разбиение на фрагменты с сопоставлением смещений, безлимитную длину спанов, способствующую извлечению сущностей любого размера (адреса, пункты договоров), совместное извлечение сущностей и связей, строящее согласованные графы знаний за один проход, ограниченную классификацию, декодирующую с соблюдением пользовательских правил для гарантии валидности вывода, и атрибуты спанов, извлекающие дополнительные характеристики (например, тональность, отрицание) вместе с сущностями.

В результате средний macro F1 по 16 задачам составляет 56.17 у GLiNER2.5 Multi (против 56.09 у GLiNER2 Multi) и 54.87 у GLiNER2.5 Base (против 53.34 у GLiNER2 Base), а на XNLI значительный прирост +24.75 пункта у Multi-версии.

Показать полностью 3
2

Вышла новая модель для синтеза речи Breeze TTS 2

Серия Новости

Сделана новая модель Breeze TTS 2 (https://huggingface.co/BreezeBlue/Breeze-TTS-2), объединяющая дизайн голоса, голосовое управление и стриминг с низкой задержкой, вместе с открытыми бенчмарками.

Парадигма переходит от создания статичного контента к интерактивному голосовому ИИ в реальном времени (игры, агенты) с новыми требованиями по разнообразию, управляемости и низкой задержке.

Дизайн голоса управляет созданием уникальных голосов под персонажа по текстовому описанию, занимая первое место в бенчмарке Role Fit и Diversity.

Управление голосом позволяет изменять эмоции и интонации на лету с сохранением персонажа, беря первое место в бенчмарке Voice Direction Score.

Выдача аудио с поддержкой Realtime API (WebSocket) самая быстрая (TTFB и TTFA) для живого диалога.

В результате поддерживаются 50 языков с контролем акцента.

Показать полностью 2
1

Вышла новая модель WeMM-Embedding

Серия Новости

Предложено новое семейство универсальных мультимодальных эмбеддингов WeMM-Embedding (https://huggingface.co/collections/tencent/wemm-embedding) (2B, 4B, 9B) для текста, изображений, видео, визуальных документов и смешанных входов с гибкой размерностью выходного вектора.

Первым этапом обучения масштабно выровняли сотни миллионов пар (слабо контролируемые подписи, поиск, классификация, QA, градуированная релевантность), приведя задачи к единому парному формату с функциями потерь InfoNCE, CoSENT-ранжирования и MRL.

Вторым этапом выполняли дообучение на курированных данных (меньше по объёму, лучше качество) с добавлением ресэмплирования на основе семантических ID для баланса семантики, очистки и генерации сложных отрицательных примеров, обучения под контролем реранкеров (избирательно), а также дистилляции от более крупной модели (9B в качестве слияния специализированных вариантов служит учителем для 2B и 4B).

Архитектуру создали на основе Qwen3.5, пулинга последнего токена с L2-нормализацией и поддержки MRL (обрезание первых d измерений).

Метод MRL при 256 измерениях сохраняет более 97% качества, но при 512 уже 99%. В абляциях этапа 1 больше всего влияют пакетирование с учётом согласованности задач (-3.4 без него), инструкции (-0.8) и маскировка дубликатов (-0.5), при этом на этапе 2 последовательное добавление отобранных данных, реранкера, дистилляции и расширенного визуального бюджета даёт +2.2 на MMEB-v2.

В результате продемонстрировано 77.9 на MMEB-v2 у 2B (лучше прежних 8B-моделей) и 80.6 у 9B (SOTA), набрано 59.5 на MMEB-v3 у 9B (SOTA среди открытых, без аудио), показано 81.7 в кросс-модальном поиске (12 датасетов) у 9B и 79.8 у 2B (лучше проприетарных аналогов), одновременно на внутренних тестах (26 задач WeChat) у 2B зафиксировано 72.0 против 60.9 у Qwen3-VL-Embedding-2B. В 14 A/B-тестах были замечены улучшения, что вызвало развёртывание в рекомендациях и поиске WeChat (Каналы, Официальные аккаунты, Моменты, электронная коммерция).

Показать полностью 2
2

Вышла новая модель GLM-5.3

Серия Новости

Выпущена новая модель GLM-5.3 (https://huggingface.co/zai-org/GLM-5.3), улучшенная на фоне GLM-5.2 только за счёт масштабирования пост-тренировки (без изменения базовой модели).

RL масштабировали на синтезированных длинно-горизонтных окружениях, автоматически генерируя и верифицируя задачи, перенося стратегии GLM-5.2 (SAO, уплотнение) и используя фреймворк Slime.

Ввели приватный бенчмарк Z.ai Code Bench для оценки агентного кодинга и совместно с командами безопасности нашли 2436 уязвимостей в 269 реальных проектах (включая 1097 критических и высоких), ведя публичный реестр раскрытия. API больше не поддерживает отключение мышления, оставляя только режим thinking enabled с тремя уровнями усилий (low, high, max). В slime улучшили алгоритмическую гибкость и производительность, увеличив пропускную способность RL в 2.3 раза.

В результате модель оказалась сильнейшей с открытыми весами для кодинга, достигнув прироста в 50% к GLM-5.2 на внутреннем Z.ai Code Bench и SOTA на ряде публичных бенчмарков, а кибервозможности неожиданно быстро выросли, значительно прогрессируя в поиске и эксплуатации уязвимостей, но всё ещё отстают от закрытых лидеров (Mythos 5, GPT-5.6).

Показать полностью 2
1

Вышла новая модель Hy4 (Preview)

Серия Новости

Анонсирована новая open-source модель Hy4 preview (https://huggingface.co/collections/tencent/hy4-preview) с 770B параметров (49B активных) и контекстом 1M токенов от Tencent.

Фокусировались на наибольшем приросте в сложных задачах для долгосрочной программной инженерии, работы с документами и научных исследований.

Усиленное предобучение и постобучение привели к значительному скачку относительно Hy3 и лидерству среди открытых моделей по ряду бенчмарков.

Применения охватывают программирование с планированием, отладкой, верификацией длинных задач и качеством клиентской части, офисную аналитику путём обработки множества файлов, создания документов, таблиц, презентаций и финансовых моделей, геймдев с генерацией прототипов, работой с движками (Unity, Godot) и многошаговым уточнением, а ещё науку с ИИ-исследованиями, молекулярной динамикой, физикой конденсированного состояния и чистой математикой (например, прорыв в задаче Бляшке-Лебега).

Интеграцию уже воплотили в CodeBuddy, WorkBuddy, Yuanbao и ima, тогда как слепое сравнение с GLM 5.3 и Kimi K3 показало небольшое преимущество.

К известным недостаткам относятся избыточное рассуждение над сложными задачами и склонность к излишней самопроверке.

В результате модель сопоставима или лучше конкурентов в агентных и инженерных задачах, например, добившись 85.4 на Terminal Bench 2.1, 64.3 на DeepSWE, 43.4 на HLE text-only и в других тестах.

Показать полностью 1
1

Вышла новая модель GLM-5.3-Flash

Серия Новости

Объявлена первая нативно мультимодальная модель GLM-5.3-Flash (https://huggingface.co/zai-org/GLM-5.3-Flash) из серии GLM-5 с 320B всего и 18B активных параметров.

Архитектура представляет собой гибрид линейного и разреженного внимания, задействующий технологию Manifold-Constrained Hyper-Connections (mHC) и претрейн на 30T мультимодальных токенов.

Анонимно тестируемая ox-alpha (кодовое имя для GLM-5.3-Flash) стала самой популярной на OpenCode и OpenRouter, обслуживаясь на китайских ИИ-чипах.

Визуальный кодинг использует нативное зрение для фронтенда, игр и CUA, позволяя проводить самопроверку через рендеринг и RL с обратной связью среды.

Оптимизация обслуживания добилась 3-кратного ускорения и стоимости как у NVIDIA на кластере китайских чипов с SGLang-движком, W8A8-квантованием, ReplaySSM и EPD-декомпозицией.

В результате модель превосходит GLM-5.2 при цене в 10 раз ниже, приближаясь к Claude Opus 4.8 в кодинге и агентных задачах с эффективностью 57 баллов в AI Index v4.1.1 при 0,045 доллара за задачу, расходуя в 3 раза меньше вычислений внимания и в 4.4 раза меньше KV-кэша, чем у GLM-5.3, показывая 63.4 на DeepSWE (против 46.2 у GLM-5.2), 48.8 на AutomationBench (26.2), 84.3 на Terminal Bench и уровень почти как у Opus 4.8 на Z.ai Code Bench.

Показать полностью 3
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества