0

Вышла новая модель Granite 4.2

Серия Новости

Озвучено первое семейство плотных рассуждающих только с декодером моделей Granite 4.2 (https://huggingface.co/collections/ibm-granite/granite-42-la...) от IBM в размерах 3B, 8B и 30B под лицензией Apache 2.0 с контекстом до 512K токенов.

Мышление переключается между "мышлением", "без мышления" и режимом низких усилий (короткое рассуждение для простых задач). Вызовы инструментов нативно поддерживаются и совместимы с форматом OpenAI.

Архитектура трансформера только с декодером эксплуатирует GQA, RoPE (θ=10M), SwiGLU, RMSNorm и раздельные эмбеддинги, причём версии 3B, 8B и 30B имеют 40, 40 и 64 слоя соответственно.

Претрейнинг начался с нуля на токенах объёмом около 15T, следуя стратегии из 5 фаз, отталкиваясь от веб-данных к высококачественному миксу и удлинению контекста.

Обучение с учителем (SFT) обладало объёмом около 7.2 млн сэмплов (примерно 100B токенов) и состояло из 31.6% агентных данных (код, терминал, поиск) и 68.4% неагентных (инструкции, код, математика), где качество контролировали LLM-судьями (GPT-OSS, Gemma), удаляя галлюцинации, битые вызовы инструментов и дубликаты, а у 30B была вторая фаза SFT с упором на агентный код.

Многостадийное и мультисредовое обучение с подкреплением (RL) осуществлялось по алгоритму Async GRPO (без сети оценки, групповые преимущества) на инфраструктуре из NeMo-RL (тренинг) и NeMo-Gym (среды).

На фундаментальном (все модели) этапе RL использовали RLVR с проверяемыми наградами (математика, код, наука, инструкции) и бустеры с короткими прогонами для прокачки навыков (IF, GPQA, код). На агентном (только 8B и 30B) этапе RL применили SWE Agent для решения задач в реальных репозиториях с тестами (OpenHands), Terminal Agent для работы в живом терминале (Harbor и Terminus) и Search Agent для многопроходного поиска в вебе (награда от LLM-судьи). На финальном (все модели) этапе RL прибегли к RLHF для юстировки под предпочтения человека и безопасность (с штрафом за длину рассуждений).

Версия 3B подверглась только фундаментальному RL и RLHF, в отличие от версий 8B и 30B, прошедших полный цикл, включая агентные стадии (от SWE до Terminal и Search).

Инфраструктура основывается на железе кластера NVIDIA GB200 NVL72 и софте из контейнеров .sqsh, PyTorch и NeMo-RL.

В результате 30B лидирует с 57.0 на SWE-Bench Verified и 89.17 на AIME25. 8B силен в агентности за свой размер с 47.67 на SWE-Bench и 50.29 на BFCL. 3B хорош в базовых задачах с 78.33 на AIME25.

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества