Лёха написал в субботу — не переписывались, кажется, с Нового года. Без предисловий: «слушай, ты ж в этих нейросетях сидишь, посоветуй, какую сейчас брать? Вроде за пару недель штук шесть новых вышло».
Не пять минут прошло. Прошёл вечер.
Штук шесть — это, кстати, не преувеличение. Шестого — ГигаЧат Ультра от Сбера. Восьмого — Grok, от компании Илона Маска. Девятого — сразу два флагмана в один день: новый GPT и модель от Meta. Ещё через неделю — китайская Kimi и первая модель совсем новой лаборатории, которую с нуля построила бывший технический директор OpenAI Мира Мурати. Шесть релизов от шести компаний за одиннадцать дней. Ну, думаю, отлично — сейчас разберусь и отвечу другу с видом эксперта.
Полез сравнивать — и нашёл не сравнение, а стену вранья. Первая же ссылка в выдаче — аккуратная табличка с процентами до десятой доли: одна модель показывает 97,2 балла по тесту с мудрёным английским названием, другая чуть ниже. Солидно, хочется поверить сразу. Погуглил этот тест отдельно. Такого теста не существует нигде — есть только эта табличка, которая сама на себя и ссылается.
Дальше не лучше. Ссылка на «оценку сорока двух специалистов» — без единого слова, кто эти люди и что у них вообще спрашивали. Чуть дальше — компания, которая, цитирую, «вышла на новый рынок в четвёртом квартале двадцать шестого года», с точностью до сорока пяти тысяч долларов. Мелкая проблема: четвёртый квартал этого года ещё не наступил. Кто-то в интернете уже подбил итоги будущего.
Посидел, повтыкал в монитор минут пять. Не подросток же — полтора года каждый день гоняю через нейросети письма клиентам, черновики, документы. А сравнить шесть версий, которые вышли одна за другой, не смог. Потом дошло: не я тупой. Сравнивать реально нечем — приличных данных просто нет, есть только шум с претензией на экспертизу.
Бросил таблички, полез в комментарии на форумах для разработчиков — туда, где люди этими штуками реально пользуются, а не пишут о них статьи. И там нашлось то, что всё объяснило.
Одна и та же нейросеть, на одном и том же тесте на логику: в одном прогоне — 92,5 балла, в другом — 42,5. Без смены версии, без обновлений — та же самая модель. Просто перед стартом ей выставили другую настройку: насколько сильно «думать» перед ответом. Один клик — и результат скачет почти вдвое.
Это как с бортовым компьютером в машине. Переключаешь режим движения с эконом на спорт — расход топлива на табло скачет чуть не вдвое. Двигатель при этом остаётся тем же самым. Цифра на табло не про мотор — она про кнопку, которую ты нажал. С нейросетями та же история, только никто не пишет мелким шрифтом, какой режим стоит в каждой табличке.
Вендоры это отлично понимают — и потому вообще перестали мериться одной линейкой. Одна компания отчиталась по своей новой модели всего по четырём тестам, и все — про код. Другая придумала себе собственный экзамен и сравнивает себя с конкурентами на нём же. Третья держится за старый тест, где сама уверенно лидирует, и не публикует те, где нет.
На Хабре одна колонка это отлично описала: релизы лабораторий превратились в расписание выставки — сегодня один запуск, завтра другой. И жёстче: гонка раскачала траты на обучение и маркетинг, а прироста будто и не видно, как раньше.
Один разработчик на форуме сформулировал то, что зацепило меня больше остального. С последних версий выгода от новой модели почти незаметна на фоне того, сколько толку приносит просто научиться разговаривать с той, что уже есть — подбирать формулировки, объяснять задачу нормальным языком. Не в модели дело чаще всего, а в том, насколько понятно ты сформулировал, чего хочешь.
Другой ответил ещё проще, без затей: чем это лучше того, чем я и так пользуюсь за пару баксов в месяц? Не собираюсь заводить у себя дома сервер — хочу открыть приложение и работать, как девяносто девять человек из ста.
Справедливости ради — балаган был не сплошной. Про Grok несколько разных людей написали одно и то же независимо друг от друга: после него перестали открывать прежнюю модель для рабочих задач.
А китайская Kimi неожиданно наступила на пятки закрытым лидерам — кто-то на форуме прогнал все опубликованные результаты и насчитал: из тридцати пяти тестов новая модель обошла прошлогоднего фаворита в тридцати. Правда, считал он по табличке самого производителя, так что верить на слово рано — независимой проверки пока нет.
Но самое важное за эти две недели прошло вообще мимо шума. Пока все спорили о процентах, одна из компаний тихо сделала модель уровня своей самой сильной — ту, что месяц назад стоила дорого — версией по умолчанию на бесплатном тарифе. Это единственная новость из всех, которая реально касается не программистов, а обычных людей вроде меня и Лёхи. И прошла она почти незамеченной.
Лёхе в итоге написал так: «Бери, что у тебя уже стоит, скорее всего оно само подтянулось до модели посильнее — глянь в настройках приложения. Гнаться за новыми — трата времени, разница чаще в галочках, чем в мозгах».
Через полчаса он ответил: «ты так и не сказал, какая самая лучшая».
Не ответил. Потому что лучшей — правда нет. Есть шесть табличек, которые об этом спорят между собой, и одна нейросеть, которая тихо стала бесплатной, пока все смотрели на остальные пять.