Серия «Новости»

1

Вышла новая модель для классификации контента и модерации безопасности Shieldstral

Серия Новости

Раскрыта новая модель Shieldstral (https://huggingface.co/mistralai/Shieldstral-1.0-3B), являющаяся политико-адаптивным мультимодальным (текст и изображение) классификатором безопасности на 3 млрд параметров (основанным на Ministral-3B).

Задачей установили сведение модерации контента к бинарному вопросно-ответному формату, когда по естественно-языковой инструкции, вопросу о безопасности и документу модель выдаёт оценку "да/нет", унифицируя разнородные политики и таксономии.

Данных собрали из примерно 54,1 млн примеров. 45,2 млн открытых текстовых сэмплов привели к единому шаблону с варьируемыми инструкциями и запросами. 4,4 млн синтетических контрастных пар включали один и тот же контент, сочетающийся с релевантным и нерелевантным запросом, а безопасные тексты переписывали в небезопасные под конкретные категории, чтобы научить модель различать тонкие границы политик. Ещё подготовили 4,5 млн мультимодальных примеров с аугментацией запросов и добавлением безопасных изображений из общих наборов данных.

Обучение произвели методом LoRA на Ministral-3B (один выходной токен). Следом две специализированные контрольные точки (открытые данные и их сочетание с сгенерированными) объединили через сферическую линейную интерполяцию (SLERP), добавив инструктивную версию базовой модели.

В результате степень защиты текста составляет F1 84,9%, соответствуя GPT-OSS-Safeguard-20B, несмотря на разницу примерно в 7 раз по размеру. Мультимодальная безопасность достигла среднего F1 83,8%, став новым state-of-the-art. Адаптивность к политике набрала F1 91,3% при оценивании по новым, независимо разработанным таксономиям с произвольными запросами на естественном языке.

Показать полностью 4

Вышла новая модель для генерации видео MiniMax H3

Серия Новости

Подготовлена новая универсальная мультимодальная генеративная модель MiniMax H3 (https://huggingface.co/collections/MiniMaxAI/minimax-h3), понимающая единый контекст из текста, изображений, видео и аудио, также генерирующая видео до 15 с, 2K, 24 fps, с нативным стереозвуком, ориентированная на коммерческое создание контента (реклама, брендинг, e-commerce, игры, UI/UX и другие) под лицензией MiniMax H3 Community License.

Основные технологии объединяют контекстуальное омни-представление (Contextual Omni Representation), H3-VAE в виде пространственно-временного видеоавтоэнкодера и стереоаудио-VAE, плотную модель H3-Omni Transformer с 33B для единого потока совместного предсказания видео и аудио. Кроме того, используется In-Context Regeneration, регенерирующий от 768p до 2K в контексте исходных условий.

Следуя философии обобщающей задачи, применили единую модель вместо набора специализированных экспертов, описывая обобщённое редактирование и реферирование естественным языком.

Система состоит из трёх модулей, включая H3-Context-IR для препроцессинга мультимодальных инструкций (через API), H3-Base, генерирующий видео и аудио 768p (открытый чекпоинт FL2VA и Ref2VA), и H3-Regenerate-2K, повышающий качество до 2K через контекстную регенерацию (API).

В результате ценовая эффективность высокая, ведь стоимость за секунду 2K менее трети от цены мейнстримных моделей, а 768p обходится дешевле половины цены 720p.

Показать полностью 2
4

Вышла новая модель Qwen3.8-Max

Серия Новости

Готова новая флагманская модель Qwen3.8-Max с 2.4T параметров (95B активных), которая первая в классе Max с открытыми весами (выходят через неделю).

Кодинг включает автономное выполнение многодневных проектов с самостоятельным строительством и доработкой системы (например, 16 дней, 265 коммитов, 127 PR), воспроизведение научной статьи по рассуждению LLM с нуля с дальнейшим улучшением метода (собственный поиск идей, +2.7% на AIME24 примерно за 5 дней) и участие в реальных соревнованиях, обойдя за 24 часа 87% человеческих команд на платформе Tianchi.

Работе помогло масштабирование RL-систем, давшее равномерный рост общих рабочих способностей (CoWorkBench, JobBench и другие). Благодаря этому сложные профессиональные задачи решаются "под ключ" в сотнях профессий (анализ нормативного соответствия за час вместо недели, UI и UX за один проход, меню ресторана, инженерные расчёты и прочие). За одну сессию можно построить полноценную квантовую стратегию (ротация ETF, факторный майнинг, параллельный обсчёт).

Модель автономно разработала дизайн микросхемы (аппаратный ускоритель GCD и RSA) от пустого шаблона до оптимизированного RTL, сократив число гейтов с 8298 до 678, уменьшив физический макет на 81% и выполнив трассировку с запасом по времени. В симуляции интернет-магазина на 365 дней модель училась на ходу, вела переговоры и управляла рисками, достигнув баланса ¥416,252 (рост в 4,16 раза) и обойдя сильных конкурентов.

Мультимодальные агенты понимают длинные документы и видео, превращая их в интерактивные структуры, создают визуальный контент (анимации, 3D, игры), сами проверяют и исправляют результат через визуальную обратную связь. Гибридные агенты (код и GUI) восстанавливают приложения "слепо" по интерфейсу (RecreationBench). Qwen-MM-Plugins позволяет расширить любые агентские фреймворки до мультимодальных.

В результате, по отзывам пользователей, она быстрая, стабильная, годится для самых тяжёлых инженерных и офисных задач, превосходя Opus4.8 по качеству, скорости и токен-эффективности. Дополнительно юристы, учёные, разработчики отмечают точность, прослеживаемость и пригодность к продакшену.

Показать полностью 3
0

Вышла новая модель K-EXAONE 2.0

Серия Новости

Размещена новая открытая фундаментальная MoE-модель K-EXAONE 2.0 (https://huggingface.co/collections/LGAI-EXAONE/k-exaone-20) от LG AI Research с контекстом до 256K токенов и поддержкой 10 языков (добавлены французский, итальянский, польский, португальский), созданная путём масштабирования предшественника K-EXAONE под лицензией Apache 2.0.

Архитектуру расширили до 750B общих и около 37B активных параметров, что в 3 раза больше.

Обучение предполагало непрерывное предварительное обучение, промежуточное обучение с упором на длинный контекст и сложные рассуждения, постобучение (SFT и предпочтительное обучение) для усиления инструкционного следования, агентного кодирования, мультиязычности и безопасности в корейском социокультурном контексте.

Вывод ускорили через многотокеновое предсказание и DSparK-драфтер.

В результате оценки по 9 категориям обнаружен наибольший рост над K-EXAONE в агентном кодировании, длинном контексте и безопасности, что позволило конкурировать с открытыми моделями при явных преимуществах в длинном извлечении и безопасности.

Показать полностью 3
1

Представлен новый фреймворк AI4AI и модель XYZ-Aquila от XYZ AI Lab

Серия Новости

Фреймворк AI4AI облегчил ограниченные исследования с верификацией для улучшения агентных систем, основываясь на задаваемых людьми контрактах оптимизации (цель, приватный бенчмарк, допустимые вмешательства, бюджет, риски, критерии приёмки). Внутри контракта AI-агенты диагностируют сбои и реализуют ограниченные изменения (данные, обучение, среда выполнения, инструменты, инфраструктура). Изолированный оценщик выдаёт доказательства без раскрытия ответов, исключая внешние бенчмарки из рутинной оптимизации. Общая память опыта сохраняет все исходы (принятые и отвергнутые) с происхождением.

Цикл улучшения запустили исследованием через анализ сбоев, генерацию предложений и выбор допустимого вмешательства. Продолжили, разрабатывая реализацию кандидата без запроса к оценочным воротам. Перешли к проверке по принципу изолированной оценки на приватном бенчмарке, когда ворота принимают, отвергают или эскалируют. Важно отметить, что каждый цикл создавал улики (конфигурации, метрики, решение), которые попадали в общую память. При этом человек управлял только через контракт и исключения, не одобряя каждый шаг.

Человеко-агентное взаимодействие происходит в общем чат-комнате через три парадигмы, включающие извлечение исследовательского опыта из обсуждений, сбор предложений людей как кандидатов с их заземлением в нужный момент и поэтапную отчётность с корректировкой по обратной связи. На случай нестандартных ситуаций предусмотрен исключительный контроль, но рутинные решения принимают ворота.

Для глубокого поиска развернули двух открытых агентов (https://huggingface.co/collections/XYZAILab/xyz-aquila), носящих названия XYZ-Aquila-mini (Qwen3.6-35B-A3B) и XYZ-Aquila-pro (Qwen3.5-397B-A17B), предусмотрев три инструмента (поиск, парсинг, Python), фиксированный интерфейс и скрытые ответы оценщика.

Задачи строились графо-ориентированно методом задания вопросов из связных графов источников, недоступных агенту, и проверки достижимости и уникальности ответа. Верного состояния SFT добились обучением на точном видимом агентом контексте (Vt), маскируя некорректные шаги и сохраняя восстановительные траектории. Внедрив фиксированные политики контекста и точное логирование состояний для воспроизводимости, сформировали среду и контекст-менеджмент. RL-расширение отсеялось, не войдя в релиз, пройдя только дешёвый скрининг.

На текущий момент ограничениями являются неустановленная причинная роль отдельных компонентов (взаимодействия, зависимость от пути), риск адаптивного переобучения на приватный бенчмарк, нуждающийся в ротации сплитов и слепых аудитах, неполная контролируемость сравнений (разные стеки, даты), требующая больше прямых воспроизведений, неизмеренная полная стоимость, задержки и усилия человека, а ещё не полностью валидированная RL-часть, отчего перенос на другие домены (кодинг, наука, медицина) требует отдельных контрактов.

В результате внешние бенчмарки (BrowseComp, BrowseComp-ZH, DeepSearchQA, GAIA, LiveBrowseComp, HLE, WideSearch) исключались из цикла оптимизации, однако по всем 7 бенчмаркам в категории открытых моделей менее 40B лидирует XYZ-Aquila-mini, а по всем 6 бенчмаркам в категории менее 400B лидирует XYZ-Aquila-pro, обладая рекордными баллами среди всех систем на BrowseComp-ZH, LiveBrowseComp и WideSearch. Также анализ трассировок показал адаптивное использование инструментов в зависимости от задачи.

Показать полностью 3
1

Вышла новая модель для понимания видео Mage-VL

Серия Новости

Презентована новая эффективная потоковая мультимодальная модель Mage-VL (https://huggingface.co/microsoft/Mage-VL), решающая парадокс Моравека (сильные в офлайн-рассуждениях, но неэффективные в потоковом восприятии) за счёт кодек-ориентированного подхода.

Зрительный токенизатор Mage-ViT вместо равномерной выборки кадров избирательно кодирует динамические, насыщенные информацией области, используя векторы движения и остаточную энергию на уровне патчей 16×16, сокращая потребление визуальных токенов более чем на 75% с сохранением пространственно-временного контекста.

Обучение с нуля на примерно 560M немаркированных изображений и 100M видеокадров позволило достичь или превзойти энкодеры, обученные на миллиардах пар изображение-текст (например, SigLIP2).

Архитектура двойной системы из лёгкого System 1 (гейт событий) и каузального System 2 (языковой декодер) для проактивного потокового взаимодействия предоставила модели возможность самой решать, когда реагировать на события в реальном времени.

Семь ключевых эмпирических выводов сводятся к тому, что веб-масштабное предобучение не обязательно для зрительных энкодеров, предобучение с переменным разрешением даёт монотонный рост качества с увеличением токенов, кодек-ориентированная токенизация создаёт превосходный компромисс точности и эффективности, явный SFT для длинных VideoQA избыточен, так как достаточно насыщенных видеоподписей и короткого SFT, динамическое видеообучение усиливает статическое пространственное мышление (синергия движения и геометрии), AI4AI-пайплайн с оптимизацией промтов и кода систематически повышает качество данных, а Zero-Vision SFT (чисто текстовый SFT перед RL) раскрывает мощные мультимодальные RL-способности.

В результате Mage-VL-4B сравним с Qwen3-VL-4B на статических задачах, значительно лучше в понимании видео и пространственном мышлении (2D и 3D), с ускорением вывода до 3,5 раза, превосходя 15B Phi-4-reasoning-vision.

Показать полностью 2
0

Вышла новая модель Instella-MoE

Серия Новости

Дебютировала новая полностью открытая MoE-модель Instella-MoE (https://huggingface.co/collections/amd/instella-moe) на 16B параметров (2.8B активны на токен), предназначенная для исследований с необходимой проверкой безопасности под лицензией Research RAIL.

Для обучения с нуля применяли графические процессоры AMD Instinct MI300X и MI325X совместно с ROCm, Primus и Miles.

Среди архитектурных решений можно выделить гейтированное многоголовое латентное внимание (Gated MLA) в виде обучаемого гейта на выходе внимания, а также FarSkip-Collective, совмещающий коммуникации и вычисления для снижения простоев, ускоряя претрейн на 12.7% и вывод (TTFT) до 39.2%.

Пайплайн обучения состоял из шести этапов. Сначала проводили претрейн на 7.1T смеси веба, кода, математики и науки. Потом мидтрейн на качественных STEM-данных со слиянием чекпоинтов. Затем контекст расширили до 64K с YaRN и маскировкой документов. Дальше наступил этап SFT на инструктивном и рассуждающем датасете с целевым добором примеров под ошибки. Вскоре приступили к обучению предпочтениям через DPO, отключив функцию потерь балансировки экспертов для стабильности. На заключительном двухэтапном RL (Miles) перешли от IF-специализированного GRPO к Multi-Teacher On-Policy Distillation (MOPD).

В результате Base-модель со средним показателем 76.7 сильнее всех полностью открытых моделей, обходя SmolLM3-3B и OLMo-3-7B, конкурируя с Qwen3.5-4B. Длинный контекст демонстрирует 41.5 на HELMET и 79.4 на RULER на 64k токенов. Think-модель со средним показателем 73.22 получилась лучшей среди полностью открытых, значительно улучшившись на IFEval до 83.7.

Показать полностью 3
2

Вышла новая модель Fara-1.5

Серия Новости

Придумана новая модель Fara-1.5 (https://huggingface.co/collections/microsoft/fara15) с масштабируемыми средами обучения для агентов компьютерного использования под лицензией MIT.

Сбор демонстрационных данных с участием людей дорог и медленный, поэтому требуются масштабируемые стратегии генерации синтетических данных.

Проблему решили пайплайном генерации данных FaraGen 1.5, состоящим из трёх модульных компонентов.

Среди сред были живые сайты для открытых задач без аутентификации и синтетические среды (FaraEnvs), представляющие собой песочницы, точно имитирующие домены с авторизацией и необратимыми действиями (почта, календарь, маркетплейс и другие), давая полный контроль и проверяемость через состояние бэкенда.

Решателем выступил одиночный агент на базе сильных моделей (например, GPT-5.4), работающий в цикле вызовов инструментов и зеркалирующий пространство действий будущего агента. Для создания многошаговых диалогов и разрешения неоднозначностей присутствует симулятор пользователя.

Траекторию принимали для обучения, только если проходили три независимые проверки. Корректность задачи на живых сайтах проверяли LLM-судьёй с рубрикой, в синтетических сравнивали с предвычисленным состоянием БД. Оценивали эффективность, исключая лишние, повторяющиеся или бесполезные действия. Также внимание уделяли соблюдению критических точек, чтобы агент запрашивал одобрение пользователя перед необратимыми действиями или вводом персональных данных.

Обучение провели с помощью SFT на основе Qwen3.5 в трёх размерах (4B, 9B, 27B), потребляя только скриншоты и генерируя низкоуровневые действия.

В результате семейство моделей теперь новый state-of-the-art для своего класса на бенчмарках браузерного использования. Fara1.5-9B показывает 63.4% на Online-Mind2Web (+29.3 пункта к Fara-7B) и 86.6% на WebVoyager. Между тем Fara1.5-27B имеет 72.3% на Online-Mind2Web, конкурируя с большими проприетарными системами вроде Gemini 2.5 Computer Use и OpenAI Operator.

Показать полностью 4
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества