14 августа исследовательская лаборатория соцсети Xiaohongshu (в англоязычных источниках — Rednote) официально выложила в опенсорс dots3-note preview — первую публичную модель линейки dots3. Модель успела прославиться ещё до релиза: неделей раньше её архитектуру раскрыл черновой пул-реквест в репозитории vLLM, а сама лаборатория ранее заявляла о безупречном результате 42 из 42 баллов на Международной математической олимпиаде.
Как модель утекла раньше релиза
6 августа пользователь под ником KurodaKanbei — по собственному описанию, аспирант ETH Zürich, не сотрудник Xiaohongshu — открыл в vLLM пул-реквест с добавлением поддержки модели «Dots3 NOTE». На следующий день черновой статус с PR сняли, а в его собственных заметках о валидации нашлась деталь, которая выдавала автора: он запускал восьмигранную GPU-конфигурацию с «чекпоинтом Dots3 NOTE в FP8» — то есть уже держал в руках реальные веса, а не гипотезу об архитектуре. PR описывал модель как «структурно родственную DeepSeek-V3.2», но с гибридом двух типов внимания в одном стеке. Сегодняшний официальный релиз подтвердил утечку почти дословно.
Кто такие Dots Studio и при чём тут соцсеть
Xiaohongshu — китайская социальная платформа, а не AI-лаборатория в привычном смысле. До dots3-note её Dots Model Lab уже выпускала текстовую модель dots.llm1, модель для разбора документов dots.ocr и мультимодальную dots.vlm1 — dots3-note preview лаборатория описывает как модель, которая закрывает последний недостающий кусок для полноценного агента.
Важный нюанс позиционирования: несмотря на результат на IMO, компания прямо говорит, что это не математическая модель. Основной прицел — длинные, открытые задачи без единственно верного ответа: спланировать поездку, подготовиться к свадьбе, вести небольшой магазин, — сценарии, растянутые на часы или дни, а не на один запрос-ответ.
Что под капотом
По данным официальной модель-карты (приведены в обоих источниках):
Архитектура — mixture-of-experts, 280 млрд параметров всего, 16 млрд активных за проход: 256 маршрутизируемых экспертов плюс один общий, top-8 роутинг, 45 MoE-слоёв и 1 плотный слой.
Гибридное внимание — из 46 слоёв внимания 13 работают по схеме DeepSeek-style sparse attention (DSA, с индексацией top-2048), а 33 — sliding-window attention (SWA): грубо один разреженный слой на три плотных.
MTP-модуль — отдельный слой на 1,13 млрд параметров, предсказывающий до трёх токенов вперёд для спекулятивного декодирования.
Контекст — 512 000 токенов.
Мультимодальность — на входе текст, изображения, видео и аудио (encoder для зрения — MoE ViT на 7 млрд/1,2 млрд активных, для звука — плотная модель на 800 млн), на выходе только текст.
Лицензия — Apache 2.0, веса лежат на HuggingFace (dots-studio/dots3-note-prev), код и рецепты для запуска — на GitHub.
42 из 42 на IMO: что подтверждено, а что нет
25 июля Xiaohongshu заявила, что более ранняя версия — dots-note-3.0 — набрала полный балл, 42 из 42, на официальном разборе заданий 67-й Международной математической олимпиады в Шанхае: с таким результатом справились только 7 из 666 участников-людей, проходной балл на золото был 29, а предыдущий лучший результат ИИ (Gemini Deep Think) — 35 из 42. Оценка была выставлена официальным жюри олимпиады, но независимой проверки со стороны — как именно модель получала доступ к задачам, как контролировались сэмплирование и разметка — не было: весов не существовало в публичном доступе, проверять было нечем.
Сегодняшний релиз это меняет: веса теперь можно скачать и попытаться воспроизвести результат самостоятельно, но пока никто извне этого не сделал. Плюс к этому есть два уточнения, которые стоит держать в голове: во-первых, по данным китайских СМИ такой же результат — 42 из 42 в том же разборе — получила модель Celia от Huawei, то есть dots3-note не единственная, кто это сделал. Во-вторых, в X один из партнёров Menlo Ventures утверждал, что 42 из 42 в этом году также набирали модели OpenAI, Anthropic, Axiom Math и Kimi K3 от Moonshot — но это неподтверждённый пост в соцсети без официальной разметки за ним.
Другие заявленные результаты
По цифрам самой Dots Lab, на ARC-AGI-3 модель набирает около 0,35 балла при тестовых затратах меньше $500 — это ниже абсолютного результата Claude Opus 4.8 (high), но заметно дешевле по стоимости за очко. На агентных бенчмарках WebShop, HotpotQA и ALFWorld компания заявляет результаты на уровне или выше моделей, в несколько раз крупнее по числу активных параметров, с отдельным акцентом на сильное для своего размера зрение. Все эти цифры — собственная оценка Dots Lab, независимого прогона на момент публикации нет.
Отдельно лаборатория показала демо-кейсы, а не бенчмарки: модель прошла игру Slay the Spire II до 33 этажа, самостоятельно решила все 6 уровней ARC-AGI-3 за 320 шагов, разобрала пространственную задачу по перепланировке кухни по фото и чертежу, и с нуля собрала visionOS-приложение — 12 файлов на Swift, 1876 строк кода, сборка завершилась успешно. Это иллюстрации возможностей, а не измеримые результаты.
Как модель держит контекст на длинных задачах
Технически интересная часть — как модель работает с задачами, которые не помещаются в память целиком. Два механизма: файл memory.md, куда модель записывает текущее понимание среды и обновляет его по ходу задачи, и механизм self-critiquing — модель периодически оценивает собственные промежуточные шаги и переписывает ошибочные гипотезы. Обучали это через собственный метод Dots Lab — TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): длинная траектория режется на макро-шаги, и после каждого модель на время переключается из роли актора в роль критика, чтобы оценить собственный прогресс и сгенерировать сигнал для дальнейшего обучения — это должно решать проблему задач без единственного правильного ответа, где обычное обучение с подкреплением работает плохо.
Как получить доступ
Полный чекпоинт в FP8 официально рекомендуют запускать на 8 GPU NVIDIA H100 — это не модель для домашнего сервера. У Dots Lab есть собственный API-портал (dots.ai/platform), но публичной цены там на момент подготовки материала не нашли ни orcarouter, ни 36kr. На OpenRouter модель уже доступна с пометкой «Free» — обычно так помечают свежие опенсорсные релизы на льготных условиях, но не факт, что это постоянные условия, а не временная акция с лимитами.
Для тех, кто не готов поднимать восемь H100 ради теста одной модели, есть более простой путь — попробовать через агрегаторы вроде SpeShu.AI, где доступ к пулу нейросетей оплачивается по факту использования и по СБП.
Что пока не проверено
Независимого воспроизведения результата 42/42 на IMO ещё не было — теперь это технически возможно, но пока не сделано.
Все агентные и ARC-AGI бенчмарки — собственные цифры Dots Lab.
Реальная коммерческая цена доступа за пределами промо на OpenRouter не опубликована в официальных материалах.
По словам самой лаборатории, dots3-note preview — младшая модель линейки; более крупные версии (в материалах фигурируют кодовые имена jazz и aria) пока не вышли.
Если интересуют модели для агентных, а не чисто математических задач — это релиз стоит посмотреть хотя бы потому, что веса открыты и бесплатны: можно протестировать на своей задаче, не дожидаясь чужих бенчмарков. Но результат 42/42 и агентные цифры пока держатся на слове одной компании — стоит подождать независимых прогонов, прежде чем ссылаться на них как на факт.
Реклама. ООО «ЦНИС», ИНН: 9704271170