Вышла новая модель Ornith-1.5
Выложена новая модель Ornith-1.5 (https://huggingface.co/collections/ornith-ai/ornith-15) в версиях 397B MoE, 35B MoE и 9B dense (плюс мобильная 9B-Mobile), перешедшая к полному циклу самоулучшения, самостоятельно генерируя задачи, опорные структуры и варианты решений для обучения с подкреплением.
Цикл самоулучшения сперва генерирует новые, более трудные, чем решённые ранее задачи, далее генерирует опорные структуры, такие как инструкции, инструменты, декомпозиция и оркестрация, потом формирует варианты решения задачи, под конец обновляя все три стадии наградой через GRPO, обеспечивая устойчивый рост способностей модели в рассуждении, программировании и агентных задачах.
Система наград основывается на формуле задачи R_task = V(q,s) x D(q,s,{τ_i}) x N(q), где V обозначает валидность или проверяемость, D измеряет сложность у границы возможностей (p* ≈ 0.2), а N отражает новизну, между тем для опорной структуры применяется R_harness = C(q,h) x F(h,{τ_i}) x H(h), рассматривающая соответствие задаче, точность оценки и устойчивость к взлому системы вознаграждения, а вариант решения выражается формулой R_rollout(τ_i) = h(q,τ_i).
В результате версия 397B набрала 86.1 на Terminal-Bench 2.1, 56 на DeepSWE и 86 на SWE-bench Verified, будучи сопоставимой с Claude Opus 4.8, превосходя GLM-5.2 и DeepSeek-V4-Flash. Версия 35B превосходит Qwen3.6-35B, Gemma-4-31B и Muse-Glimmer-30B, а версия 9B превосходит более крупные Gemma-4-31B и Qwen3.6-35B, являясь пригодной для iPhone или Android.



