Раз в несколько месяцев в сети выходит новый рейтинг «лучшая нейросеть года» — и почти всегда с новым победителем. Полугодовой лидер тихо сползает на второе-третье место, никто не признаёт прошлый рейтинг ошибочным, просто выходит следующий с новым первым местом. Если присмотреться к тому, чем модели реально отличаются друг от друга, эта чехарда перестаёт удивлять: единой «лучшей» там нет — есть модели, каждая из которых уверенно выигрывает свой узкий класс задач и так же уверенно проигрывает в остальных.
Разница проявляется не в сумме баллов очередного бенчмарка, а в конкретных типах работы.
Связный читаемый текст из сухих тезисов большинство современных моделей, включая ChatGPT, делают быстро и уверенно: превращают три вымученных пункта в абзац за минуту, который не стыдно показать руководству. Но там же, где текст незаметно переходит в счёт — «на сколько выросли показатели», «сколько это в процентах», — уверенность в ответе не падает вместе с точностью. Одинаково гладко подаётся и верное число, и выдуманное: тон ответа не меняется ни разу. Отсюда простое бытовое правило — цифру в тексте от нейросети сверяют отдельно, вне зависимости от того, насколько убедительно она прозвучала.
Российская бюрократия — отдельный класс задач, где модели расходятся заметнее всего. На вопрос про конкретный пункт налогового вычета или формулировку в местной форме крупные международные модели вроде ChatGPT обычно отвечают максимально обтекаемо — «уточните в вашей инспекции», без опоры на конкретную норму. Модели, которые изначально учили на большем объёме русскоязычных законов и форм — в первую очередь GigaChat, — в этой узкой нише отвечают предметнее: называют номер пункта, а не отправляют искать его самостоятельно. При этом в задаче на живой деловой текст на русском те же модели нередко звучат суше и казённее, чем международные конкуренты.
Длинный документ — ещё одна ось разрыва. Модели с большим объёмом памяти на разговор, прежде всего Gemini и Claude, удерживают структуру многостраничного текста, не разваливаясь к последней странице, и разбирают сразу несколько файлов и изображений за один запрос. Расплата — короткий бытовой текст вроде делового письма на пару абзацев у них же иногда выходит с лёгким машинным привкусом, будто автор подглядывал в словарь.
Голосовые ассистенты вроде Алисы выигрывают там, где остальным вообще не место, — быстрый бытовой ответ вслух, когда руки заняты чем-то другим. Для серьёзного текста их лучше не звать: там они теряются на второй-третьей фразе.
Ни один из этих разрывов не баг конкретной компании — это специализация, которая просто не укладывается в рейтинг с одной итоговой цифрой места. Честная оговорка: это не протокол лабораторного теста с одинаковыми условиями для всех участников, а наблюдение, которое повторяется в разных независимых сравнениях. Но и рейтинг «топ-10» с единственным победителем такого протокола не проводит тоже — он просто выводит средний балл по набору задач, которые лично вам скорее всего не нужны все сразу.
Отсюда растущая привычка части пользователей — держать не одну подписку, а несколько моделей под разные типы работы вместо погони за универсальным победителем. Дороже по деньгам и по времени на переключение между окнами, зато результат предсказуемее.
Вопрос «какая нейросеть лучшая» в этом смысле сформулирован неправильно с самого начала — примерно как «что лучше, молоток или дрель». У него нет ответа не потому, что его ещё не нашли, а потому что сам вопрос некорректен. Рейтинги с единственным победителем при этом продолжат выходить каждые несколько месяцев и дальше — не потому что кто-то не в курсе этой разницы, а потому что заголовок «мы разобрались, какая модель нужна для чего» кликов не собирает, а «нашли ту самую лучшую» собирает исправно.