Вышла новая модель Needle 2
Предлагается новая агентная модель Needle 2 (https://huggingface.co/Cactus-Compute/needle2) для крошечных устройств с 45M параметров, одним бинарником на 14 МБ и сессионной памятью около 28 МБ, вызывающая инструменты, управляющая устройством и осуществляющая структурированное извлечение.
Основу построили на базе Simple Attention Network, сжатии CQ2-bit (Cactus Quants) и обучении модели сразу под 2-бит.
Скорость декодирования набирает около 500 ток/с на Raspberry Pi 5, 400-1500 на VR, 300-700 на дешёвых телефонах и более того работает на ESP32-S3.
Точность проявляется в 63.7 на Mobile Actions, 17.0 на DroidCall, 32.6 в домене и 28.7 вне домена на Seal-Tools, общий 42.6 на BFCL v4.
Цель сводится к созданию периферийного ИИ для устройств дешевле $200 без GPU или NPU с поддержкой офлайн-режима и приватности.
Архитектура опирается на многослойный перцептрон Адамара, engram-память на n-граммах, многоканальные остаточные связи, окно 256 токенов с закреплёнными описаниями инструментов и грамматику, гарантирующую валидные вызовы.
Движок обладает одним C++ бинарником, сквозным int8, не разворачивающимися в RAM весами и грамматикой, отсекающей до 98% вычислений на структурных токенах.
Обучение состояло из предобучения на 115B токенов, посттренировки на 38B, и есть возможность тонкой настройки на своём Mac или PC.
Готовность к продакшену уже присутствует, и, например, компания Pebble, известная как пионер в сфере современных носимых устройств, использует её локально в приложении Index 01, чтобы преобразовывать голосовые запросы в действия без подключения к сети.
В результате она сопоставима с LFM2.5 230M, FunctionGemma 270M и Apple FM, будучи в 5-70 раз меньше и при 2 битах против их f16.
