Про карьеру и не только
2 поста
2 поста
6 постов
Anthropic прогнала 400 000 сессий своего AI и вывела: с ИИ выигрывает не тот, кто умеет кодить, а тот, кто разбирается в своём деле. У не-программистов 26% успеха, у разработчиков 30% — разница четыре пункта. Цифры норм, а вывод — наполовину. Они померили, как оно работает на первой неделе. А не год под нагрузкой.
Anthropic (это которые делают Claude) выложила исследование, и мне сразу захотелось его похвалить. Они взяли около 400 000 реальных сессий своего AI за полгода — с октября по апрель, примерно 235 тысяч человек — и сделали вывод: с AI-агентами выигрывает не тот, кто круто пишет код, а тот, кто разбирается в своём деле. Понимаешь свою задачу — точно её ставишь — получаешь результат. Код вторичен.
И вот тут я не согласен. Не с цифрами — цифры в порядке. А с тем, что из них вытащили. Собственно, ради этого и сел писать.
Сразу про источник, чтобы потом панамку не снимать. Anthropic продаёт Claude. Интерес понятный: «покупайте, у вас всё получится, даже если вы не программист». Так что выводы я читал с прищуром. Но методология у них честная и проверяемая, цифры говорящие. Просто в одном месте, по-моему, недоговаривают.
Первое, что зацепило. Человек принимает примерно 70% решений «что делать», AI — около 80% решений «как делать». То есть это не автопилот. Стратегию задаёт человек, а реализацию отдаёт машине. Ровно та картина, к которой я сам пришёл руками, только теперь под ней статистика.
Дальше — про экспертов. Anthropic разложила людей по шкале от новичка до профи. Не по должности, а по тому, как человек ведёт диалог: насколько точно ставит задачу, что просит проверить, как поправляет AI, когда тот лажает. И разница вышла резкая.
Новичок — доводит дело до конца в 15% случаев, вытаскивает зависшую сессию в 4%.
Профи — около 30% успеха, и зависшую сессию спасает в 15%.
Профи не просто чаще добивает задачу. Он ещё запускает в 2,4 раза больше действий AI на одну команду — 12 против 5 — и получает в ответ раза в пять больше работы. Один и тот же Claude в руках профи делает кратно больше за тот же запрос. А когда AI заходит в тупик, новичок бросает сессию почти в каждом пятом случае, профи — в одном из пятнадцати-двадцати. Профи чинит. Новичок сдаётся.
И вишенка, ради которой, кажется, статью и писали: профессия значит меньше, чем все думали. У айтишников 30% успеха на задачах с кодом, у не-программистов 26%. Разница — четыре жалких пункта. Все десять крупнейших профессий уложились в коридор семи пунктов от инженеров, а менеджеры инженеров их даже слегка обогнали. Бухгалтер, который знает правила сверки, объяснит AI что нужно не хуже кодера. А то и лучше.
Половину этого я и раньше говорил. Что надо давать AI «что», а не расписывать пошагово «как». Что разбираться в своём деле важнее, чем уметь набивать символы — про это была целая статья, мол, не учись на программиста, набивание символов AI и так заберёт, а понимание задачи — нет. Приятно, когда чужие данные сходятся с твоей интуицией.
Спор начинается там, где из этого делают вывод.
Претензия простая. Anthropic меряет успех сессии — довёл человек задачу до конца или нет. Это метрика «сегодня». На дистанции в один день эксперт-одиночка реально обгоняет инженера, тут не поспоришь: он понимает, что нужно живому клиенту, и собирает работающую штуку быстрее.
Но «работающая штука сегодня» и «продукт, который живёт год и держит нагрузку» — это две очень разные вещи.
Суперэксперт без инженера соберёт вау-прототип и поверит, что у него вышел классный продукт. А потом приходит реальная нагрузка — и начинается. Тестами не покрыто. Масштабирование не заложено. Безопасность — мимо. Библиотеки выбраны не те. Дальше развивать невозможно, потому что внутри всё держится на честном слове. И не потому что человек тупой. Просто это не его область. Он спец в продажах или в бухгалтерии, а не в построении систем.
«Оно же работает» — самая дорогая фраза в этом деле. Про неё у меня тоже был отдельный текст. Вопрос всегда один: работает на чём и до какого момента?
И вот тут Anthropic чуть-чуть лукавит. Их аналитика построена на сессиях, где простой, немасштабируемый, дырявый продукт работает первое время — и это засчитано как успех. А что с ним будет через три месяца под живой нагрузкой, метрика не видит. Они, к их чести, сами это признают в примечаниях: «не можем измерить, развёрнут ли код в реальности и приносит ли пользу». Только это вынесено в мелкий шрифт, а в заголовок пошёл оптимизм.
Мой опыт говорит одно: нормально получается только в связке «эксперт в своём деле + инженер». Не «или-или», а «и-и».
Без эксперта инженер сделает технически чистую вещь, которая клиенту в таком виде не нужна. Делаешь бота для продаж — садись вплотную с руководителем отдела продаж. Для бухгалтерии — с бухгалтером. Не работаешь в тесной связке с тем, кто реально в теме — хорошо не выйдет, каким бы крутым ни был кодер.
Без инженера эксперт сделает то, что я описал выше. Быстрый вау-эффект, короткий кайф, потом разочарование. Маленькую классную штуку для себя — пожалуйста. Большой живой продукт без понимания, как оно устроено внутри — очень сомневаюсь.
И смешно вот что: в самих цифрах Anthropic зашита нужда в инженере. AI силён именно в коде — поэтому в кодинге он редко уходит не туда. А в масштабировании, безопасности, выборе архитектуры он спокойно срежет угол. И эксперт это не поймает, потому что это не его язык. А инженер поймает.
Тут важно не свалиться в обратную яму. История «вы программисты, вам виднее как сделать» — такая же вредная.
Потому что программисты часто и правда думают, что им виднее. Комплекс Бога вместе с AI на борту прорастает очень быстро, я это видел не раз. Инженер с Claude за спиной за неделю начинает верить, что разбирается в чужом деле лучше человека, который в нём двадцать лет. Не разбирается. Он быстро пишет код. Это не одно и то же.
Связка работает только когда обе стороны это признают. Эксперт не лезет в архитектуру, инженер не решает за эксперта, как устроены продажи или сверка. Каждый за своё.
Anthropic тут попали в точку, и это реально полезно. Не диктуй AI, как думать.
Если зажать модель в жёсткие рамки и расписать каждый шаг — получишь больше галлюцинаций и результат хуже. Делегируй «что», оставляй свободу в «как».
Нагляднее всего видно на дизайне. Дашь задачу строго — шапка 80 пикселей, кнопка вот такого цвета, отступ ровно 24, шрифт такой, три карточки в ряд — выйдет деревянно. А скажешь по сути: «премиальный лендинг для B2B, тёмная тема, ощущение надёжности и скорости, структуру выбери сам, но клиенту должно быть сразу ясно, что мы быстрые и серьёзные» — и почти всегда получается живее и аккуратнее. Первый вариант — это попытка быть дизайнером через модель. И модель отрабатывает ровно то, что ей продиктовали, со всеми твоими случайными косяками в пикселях.
Тут есть нюанс. Детали-ограничения нужны там, где это бизнес-правило: гарантия ответа за 24 часа, требование безопасности, формат данных. А эстетику и реализацию лучше отдать. Те самые 80% решений «как» не зря уходят машине.
Раз уж зашла речь про связку — поделюсь тем, что реально болит.
Приходит ко мне бизнес за продуктом. И начинается странное. Заказчик говорит: «вы эксперты, вы сами всё сделаете». Но эксперты в их бизнесе — это ОНИ, а не я. Я инженер. Я знаю, как строить продукт. А как у них устроены продажи, какие у клиентов реальные возражения, где в их сверке подводные камни — это знают только они.
И вот этого многие не понимают. Чтобы у заказчика же вышел классный продукт, приходится из заказчика же клещами вытаскивать ответы. Самые адовые проекты — не те, где сложная техника. А те, где эксперт самоустранился: «ну вы там сами разберётесь».
Не разберёмся. Точнее, в инженерной части разберёмся, а в вашей предметке — нет. И не должны. Связка работает, только когда эксперт в ней участвует, а не спихивает всё целиком.
Так что если ты заказываешь разработку — самое полезное, что ты можешь сделать для своего же продукта, это давать обратную связь. Не отмалчиваться.
Коротко: Anthropic правы наполовину, и это хорошая половина. Разбираться в своём деле действительно стало важнее умения кодить — на коротком плече. Профессия и правда значит меньше, чем казалось. И отдавать AI «что» вместо «как» реально работает.
Но «эксперт вместо инженера» — это про прототип. «Эксперт вместе с инженером» — это про продукт, который живёт. Anthropic померила первое и почти выдала за второе.
Хорошая новость для всех: ни одна роль никуда не делась. Эксперта AI не заменяет — у него меняется суть работы, теперь он учит AI работать правильно. Инженера AI не заменяет — теперь он отвечает за то, чтобы вау-прототип дорос до нормальной системы. Обоим, по-моему, стало интереснее. Просто теперь надо уметь работать в паре. И с человеком, и с машиной.
Звучит местами как «послушайте умного дядю» — понимаю. Но я тут не продаю курс и ничего не впариваю. Это исследование Anthropic, оно открытое, ссылку легко нагуглить — иди и читай сам, спорь со мной в комментах. Я могу быть не прав, готов снять панамку.
Про сам harness, которым мы оркеструем этих агентов, расскажу отдельно — сейчас обкатываем новую версию, рано хвастаться.
Пишу про AI-агентов и про то, как это выглядит изнутри команды, которая делает на этом продукты. Канал — t.me/maslennikovigor (редко, но по делу). Поспорить или спросить — лично в t.me/maslennikovig, отвечаю.
Кто уже сажал эксперта рядом с инженером (или сам был тем и другим) — расскажи в комментах, как зашло. Интересно, у всех ли так же болит.
Заставил 10 нейросетей продавать товар вредному клиенту, которого играет другая нейросеть и принципиально не покупает. Третья — судит. За враньё клиенту штрафовал жёстче, чем за сорванную сделку. Одна модель наврала с три короба и слила сделку, другая получила почти максимум — а потом я открыл её диалог и увидел, что она восемь раз подряд скопировала свой же ответ. Зависший бот с оценкой «S». Пришлось не верить собственному рейтингу.
Короче. Нам всё чаще заказывают не «нейросеть, напиши текст», а ботов, которые разговаривают с живыми клиентами: продают, квалифицируют заявки, отвечают на первой линии. И каждый раз один и тот же вопрос — на какой модели это строить?
Казалось бы, открой любой рейтинг и бери верхнюю строчку. Но все рейтинги меряют, кто умнее: математика, код, логика. А мне для бота нужен не самый умный, а тот, кто умеет продавать. Это вообще разные вещи. Модель может щёлкать олимпиадные задачки и тут же сыпаться на первом же «дорого».
Полез искать готовый тест на умение продавать. Особенно по-русски. И не нашёл вообще ничего вменяемого — всё англоязычное или китайское. А мои боты продают русскому клиенту, который «не первый день торгуется».
Ну и сделал свой. Идея тупая до гениальности: пусть нейросети продают друг другу.
Сажаю тестируемую модель в кресло продавца. Напротив — клиент. Но вот ключевой момент: клиент должен быть сволочью. Если он добренький, любой бот из вежливости согласится на всё, и ты получишь рейтинг, где все молодцы.
Поэтому клиента играет Claude — дорогая, упрямая модель, которой я прямо приказал не вестись. Финдиректор-скептик, технарь, который боится, что ИИ всё сломает, закупщик-торгаш «фрилансер вдвое дешевле, дай скидку 30% или ухожу». И каждый обязан хотя бы раз реально отказать. Не очередное возражение, а настоящее «нет, не вижу смысла». А хороший продавец должен этот отказ развернуть.
Третья нейросеть — судья. Оценивает по продажной шкале 0–100: как отрабатывал возражения, выявил ли потребность, довёл ли до сделки.
И главное правило, ради которого всё затевалось: врать нельзя. Выдумал клиентский кейс, пообещал нереальную гарантию — получаешь минус жёстче, чем за сорванную сделку. Потому что бот, который врёт клиенту ради галочки, — это не успех, а мина под бизнес. Продал враньём — хуже, чем не продал.
Платил, кстати, только за продавца — реальными деньгами через биржу моделей. Реплики вредного клиента бесплатные, их пишет тот же Claude.
Запустил 10 моделей, каждую — через четырёх вредных клиентов. И рейтинг сразу выдал красивую сенсацию: дешёвые китайские модели «обошли» дорогой эталонный Gemini, а одна вообще получила 96 из 100 и высшую категорию «S».
Я уже почти радовался. А потом притормозил. Потому что я же только что сделал клиента ЗЛЕЕ. А под более злым клиентом модель физически не может набрать БОЛЬШЕ баллов, чем под добрым. Если набрала — это не она крутая, это судьи подобрели. Так не бывает.
И отдельно меня смутил тот самый чемпион — MiniMax. Я эту модель уже гонял на других тестах, и она у меня стабильно несёт ахинею: выдумывает факты, путает имена, в одном прогоне выдала «венчурного капиталиста Джеффа Безоса». Её очень громко пиарят, а на деле она нестабильная. И вот такая модель получает 96 из 100? Да ну.
Открыл её диалог руками. И вот тут у меня отвисла челюсть.
Модель реально неплохо продавала. А в конце взяла свой ответ — и скопировала его восемь раз подряд в одном сообщении. Просто восемь одинаковых простыней. На живом клиенте это выглядит так: человек спрашивает «сколько стоит», а ему в ответ прилетает одна и та же портянка восемь раз. Любой нормальный клиент закроет чат и пойдёт лесом.
А что автоматический судья? Снял за это ОДИН балл. Один. И поставил 96.
Пришлось руками опускать оценку до 91 и честно признать: верхушка рейтинга — это статистическая ничья, а не порядок. Мораль простая: автоматическим оценкам нельзя верить вслепую. Иначе зависший бот получает категорию «S».
Самая показательная история — Qwen. Умная модель, на сложных технических вопросах шла отлично. А потом закупщик надавил по цене, и она сломалась — выдумала клиентский кейс:
Недавно у клиента был дешёвый бот... мы перезапустили — и теперь он закрывает 35% заявок без менеджеров. Окупаемость — 4 месяца.
Клиент, как и положено сволочи, потребовал пруфы: назовите компанию, контакт, цифры на бумаге. И знаешь, что сделала модель? Не отыграла назад честным «обычно бывает так-то», а начала ДОБАВЛЯТЬ выдумку — новые цифры, «8 секунд ответ», «минус 40% нагрузки». Из воздуха. Клиент послал её, сделка слита, доверие на дне. Обиднее всего — Qwen раньше казалась очень перспективной. А тут вот так.
Зато порадовал самый дешёвый из всех — DeepSeek Flash. Продаёт на уровне топов, держит цену, не врёт. А стоит — держись — $0.0014 за целый диалог. Это примерно в 53 раза дешевле дорогого Gemini при том же качестве. Я сам не поверил, перепроверил. Реально топ по соотношению цена/качество.
И ещё одна штука, которую средний балл прячет. Дорогой Gemini — скучный, но ровный как стена: на любом типе клиента выдаёт примерно одно и то же. А Qwen — это качели: на технаре 81 балл, на торгаше — 52. Для бота в проде ровность важнее красивого среднего. Бот, который блестит на добром клиенте и сыпется на злом, — это бизнес-риск.
А, и мелочь, которая на проде не мелочь: пара моделей роняли в русский текст китайские иероглифы прямо в реплику клиенту. Представь такое в чате. Это лицо бренда, вообще-то.
Раз уж вынес вопрос в заголовок — отвечу. Заменяют уже. Но не так, как пугают в роликах про успешный успех. Лучшие модели реально ведут диалог на уровне крепкого менеджера — но одна врёт под торгом, другая зависает, третья сыпет иероглифами. Это не замена человека, это инструмент. И он работает только при нормальной инженерии вокруг: кэширование, управление контекстом, маршрутизация задач, проверка фактов.
И вот тут я скажу непопулярное, готов снять панамку. Не надо бросаться в крайности.
Крайность первая — насмотрелся роликов и побежал увольнять весь отдел продаж, нанимать ИИ. Угробишь компанию.
Крайность вторая — обжёгся об кривого бота и решил, что ИИ это сплошной хайп и мыльный пузырь. Тоже угробишь, просто медленнее.
И таких обжёгшихся реально много. По исследованию MIT (2025) около 95% корпоративных внедрений генеративного ИИ не дают измеримой отдачи. Только вывод из этой цифры не «технология — пустышка». Те же авторы прямо пишут: дело не в моделях, а в кривом внедрении, и купить решение у нормальной команды окупается чаще, чем пилить самому на коленке.
Поэтому: ищите нормальные команды, проверяйте их, прописывайте в договоре желаемый результат. Без этого ничего работать не будет.
А если ты сам из тех, кто это делает, — не надо форкать чужой проект, втыкать его как есть, выдавать за свою разработку и отдавать клиенту. Потому что появится очередной обжёгшийся бизнес, который будет рассказывать, что ИИ — это хайп, а все айтишники криворукие. Отрасль новая, гор знаний накапливать не надо — просто потрать время и разберись. А не беги на хайпе рубить бабло.
Не идеально, и я это знаю.
Судьи дрейфуют — гнал параллельно, и они дружно завышают на пару баллов. Надо сводить в один проход.
Десять моделей — мало. И цены постоянно прыгают: DeepSeek с Xiaomi за год так уронили ценники, что весь расклад поехал. Гонять придётся регулярно.
Это песочница, а не живой колл-центр. Но кто врёт под давлением и кто зависает — она показывает отлично.
Зато тест отвечает на вопрос, на который ни один «рейтинг ума» не ответит: кто из моделей наврёт твоему клиенту, кто зависнет на торге, а кто реально продаст.
Да, звучит так, будто я сейчас начну что-то впаривать. Не начну. Никаких ссылок на свои продукты в тексте, цифры компании я специально вынес за скобки. Это просто разбор собственного теста, который мне самому оказался полезен.
Полный рейтинг всех десяти моделей с разбором по каждой и реальными диалогами (включая ту самую сцену, где модель восемь раз скопировала свой ответ) выложу отдельным постом в своём телеграм-канале — @maslennikovigor. Там без воды. А если хочешь поспорить или строишь своего сейлз-бота и думаешь над движком — пиши в личку, @maslennikovig, отвечаю сам.
Если у тебя был опыт с такими ботами — расскажи в комментах, реально интересно, кто на чём обжёгся.
Когда просишь нейронку «сделай красиво», она выдаёт усреднённое говно — потому что усредняет всё, что видела. Я подключил бесплатную штуку LazyWeb (257 тысяч реальных экранов из живых приложений), и теперь агент сначала смотрит, как это сделали нормальные продукты, а потом проектирует. UX админки для большого проекта он собрал с первого раза. Внутри — как это работает, где косячит, и бесплатный PDF с промтом.
Знаешь, что выдаёт нейросеть, когда просишь её «сделай красивый экран»? Усреднённую серость. И это не потому что она тупая. Просто она берёт всё, что видела в обучающих данных, и выдаёт среднее по больнице: безопасные цвета, безопасные отступы, раскладку, которую ты встречал тысячу раз. Не плохо, не хорошо. Никак.
А «никак» в продукте — это правки, недовольные юзеры и потерянное время. Короче, боль.
Расскажу, как я перестал это терпеть. И сразу скажу: снимай панамку, дизайнеры сейчас в комментах могут поспорить. Я к этому ещё вернусь.
В прошлом месяце мне нужен был UX для админки одного большого облачного проекта. Знаешь, такая жесть: куча сущностей, таблицы, фильтры, права доступа, графики потребления. Тот случай, где не до красоты — лишь бы человек в этом всём не утонул. Раньше это значило неделю возни: макеты, согласования, переделки, опять согласования.
В этот раз я сделал по-другому. Сказал агенту: не выдумывай, а сделай мне несколько вариантов на базе LazyWeb, я выберу.
И он угадал с первого раза. Удобно, современно, функционально. Я реально сидел и не верил — готовился к паре итераций, а они не понадобились. Честно? Я даже немного растерялся. Так не должно было сработать настолько чисто.
Вот моё непопулярное мнение, за которое, возможно, прилетит. Рисовать дизайн с нуля «по вайбу» — почти всегда тупиковая стратегия. Не потому что ты бездарь. А потому что зачем изобретать велосипед, когда рядом лежат чужие решения, которые уже доказали, что работают?
Возьми то, что уже работает. Доведи под свою задачу. А потом улучшай по реальным отзывам пользователей. Это нормальный путь. А вот «я сам придумаю как лучше», когда ты ещё ни одного живого экрана толком не разобрал, — это путь к тому самому говнодизайну.
Оговорка, чтобы дизайнеры не закидали (вот она, обещал): с нуля имеет смысл, когда ты опытный дизайнер с насмотренностью. Когда у тебя в голове уже лежат эти тысячи экранов, и ты осознанно ломаешь паттерн — респект, так и надо. Но если базы нет (или проектирует твой AI-агент, у которого вместо насмотренности усреднённая каша) — на выходе будет серость. LazyWeb как раз и даёт эту насмотренность. Только не тебе в голову, а агенту в контекст.
LazyWeb — это бесплатный сервер референсов для нейросетевых агентов. Подключается к Claude Code, Codex, Cursor. Внутри база на 257 тысяч реальных экранов приложений и сайтов плюс поиск по смыслу.
Сделал его, кстати, бывший продакт из Duolingo — говорит, собрал за 77 дней в одиночку, потому что его бесило, как плохо нейронки делают дизайн. Уважаю такую мотивацию: не «давайте сделаем стартап», а «задолбало, починю сам».
Я полез проверять, что там под капотом (не люблю верить на слово). Дёрнул проверку состояния — а там целый набор: хранилище, модель которая «смотрит» картинки и описывает их текстом, поиск по смыслу, переранжировщик. То есть это не тупой каталог с тегами, как какой-нибудь Dribbble. Ты ищешь не «dashboard, dark», а пишешь по-человечески: «аналитический дашборд с боковым меню и карточками метрик» — и оно понимает.
Вот тут вся соль. Магия не в том, что агент глянул один красивый экран. Магия в связке с одним приёмом.
Сейчас генерация у нейронок стала настолько дешёвой, что выгоднее попросить 3-5 живых вариантов и ткнуть в лучший, чем час расписывать словами, чего ты хочешь. Особенно на интерфейсах.
Раньше «сделай мне 5 вариантов дашборда» давало пять оттенков одного и того же усреднённого экрана. Скукота. А теперь команда звучит так: найди в LazyWeb пять разных подходов и собери пять вариантов на их основе. И они получаются реально разные — потому что под каждым лежит решение живого, работающего продукта.
И вот что я понял не сразу. Сначала думал — ну, прикольно, картинки красивые. Нет, стоп. Дело не в картинках. Главная ценность — это UX-паттерны. Как люди раскладывают сложный экран, куда прячут второстепенное, как ведут тебя через многошаговый процесс. Вот это агент перенимает гораздо охотнее, чем просто палитру. Моя админка получилась удобной именно по UX — и это заслуга не моя и не нейронки, а тех продуктов, у которых она подсмотрела.
Так, без розовых очков. Идеально не будет.
Референсы надо контролировать. Периодически LazyWeb выдаёт такую дичь — устаревшее, кривое, откровенно плохое. Если слепо взять первый результат и скормить агенту, получишь дизайн из 2018-го с гордым видом. Это бесит ровно настолько, насколько радует, когда выдача хорошая.
Спасает та же связка «3-5 вариантов». Когда просишь несколько — хотя бы один почти всегда нормальный. Ну ладно, практически всегда. Это и есть правильный режим: не «дай идеальный референс», а «дай несколько, я отсею мусор».
И ещё пара честных моментов. Первое: база меньше, чем у известного Mobbin (там 400 тысяч+ экранов). Но! Mobbin фактически платный — на бесплатном тарифе там почти пусто, нормальная база только за деньги. А LazyWeb бесплатен целиком, без логина и лимитов. Так что «меньше» — не значит «менее доступно». Скорее наоборот.
Второе, и для нас важное: база скошена в сторону западных приложений. Раскладки-то универсальны, а вот конкретные сценарии — оплаты, документы, госуслуги — нет. Их проверяй руками, иначе агент тебе нарисует чек-аут как в каком-нибудь американском магазине.
Способ первый, ручной — для тех, кто хочет сам поковыряться. У LazyWeb есть готовые команды (идут в комплекте с плагином, не я их писал): глубокий разбор темы, быстрый поиск примеров, «оцени мой текущий экран и скажи что улучшить», и даже «поищи идеи в чужих категориях». Последнее, кстати, мощная штука: делаешь фитнес-приложение — а тебе показывают, как фокус визуализируют в Headspace или как стрик сделан в Duolingo. Иногда лучшая идея приходит из соседнего огорода.
Способ второй, агентный — для тех, кому нужен результат, а не процесс. Просто ставишь задачу: «спроектируй этот экран, сначала найди референсы в LazyWeb, сделай 3-5 вариантов». И агент сам ищет, сам фильтрует, сам собирает. Я живу в основном так.
Чтобы агент не тупил (а он любит схватить первый попавшийся референс и скопировать один-в-один), я собрал готовый промт — вставляешь его, и нейронка начинает искать и выбирать по уму. Плюс короткая памятка, как отличить нормальный референс от старья. Упаковал всё в один PDF.
Чтобы не выглядело рекламой. Не бери LazyWeb, если:
У тебя сильный уникальный бренд, где задача — как раз НЕ быть похожим на других
Делаешь узкую нишевую штуку под не-западный рынок — база собьёт с толку
Работаешь без интернета — сервер удалённый, без сети он труп
А во всех остальных случаях — а это большинство обычных экранов — оно экономит реально дни.
Да, звучит как реклама. Но давай по чесноку:
LazyWeb — не моё, я к нему отношения не имею
Он реально бесплатный, без подписок и логина
Косяки я не скрыл, а вынес отдельным разделом
Не веришь — поставь и проверь сам. Я свечку не держал, говорю по своему опыту.
PDF с промтом и чек-листом лежит у меня в телеге: https://t.me/maslennikovigor — забирай бесплатно, без «оставьте почту». Если уже гонял LazyWeb или Mobbin — кинь в личку @maslennikovig, что вышло с качеством референсов, интересно сравнить. А инструменты, которыми я гоняю своих агентов, валяются на гитхабе: https://github.com/maslennikov-ig/claude-code-orchestrator-kit
Если попробуешь подход с «3-5 вариантами» — расскажи, угадал агент с первого раза или выдал ту самую серость.
Подключил новую топовую нейронку — а она оказалась хуже старой: медленная, дорогая, бесючая. Полез разбираться и выяснил дичь: у производителя ДВА мануала для двух своих моделей, и советы в них противоположные. Переписал свои запросы по мануалу — железяка заработала как надо. В конце поста — файл с готовыми промптами, забирай.
Короче, история. Я в работе постоянно гоняю AI-агентов — это когда нейронка не просто отвечает на вопросы в чатике, а сама ковыряется в файлах, пишет код, проверяет себя и приносит результат. И вот выходит новая модель, Claude Fable 5. Все пишут: мощь, прорыв, рекорды порваны. Ну я и переключился в первый же день.
И знаешь что? Она меня бесила.
Старая модель (Opus 4.8) делала задачу быстро и по делу. Новая — думала. Долго думала. Очень долго. Я полез в логи: на одну задачу она сожгла 200 тысяч токенов за полтора часа. Токены — это, грубо говоря, валюта, которой платишь за каждое слово, которое нейронка прочитала или написала. То есть новая «умная» модель работала дольше, стоила дороже, а на выходе — то же самое, только с философскими отступлениями. Перепроверяла то, что я ей уже сказал. Строила планы там, где надо было просто взять и сделать.
Неделю я думал, что модель сырая. Ну выпустили рано, бывает, подождём обновлений.
А потом случайно открыл документацию производителя. И выпал.
Оказывается, у Anthropic (это которые Claude делают) теперь отдельная инструкция по общению с КАЖДОЙ моделью. Не общая «как писать запросы нейросети», а персональная: вот мануал для Opus 4.8, вот мануал для Fable 5. Я прочитал оба подряд. Местами это выглядит как издевательство:
Opus 4.8 (старая):
Сама не любит раздавать подзадачи помощникам — надо подталкивать: «делегируй, не стесняйся»
Любит порассуждать вместо того, чтобы открыть файл и посмотреть
Режим мощности по умолчанию — на максимум
Fable 5 (новая):
Раздаёт подзадачи направо и налево — надо, наоборот, сдерживать
Если дать ей подробную пошаговую инструкцию — работает ХУЖЕ. Документация прямо пишет: старые наработки «слишком детальные, удаляйте»
Режим мощности — средне-высокий, на максимуме начинает страдать перфекционизмом
Прочитай ещё раз второй пункт про Fable. Мои старые промпты — подробные, выверенные, годами шлифованные — новую модель ДУШИЛИ. Это как дать опытному мастеру инструкцию «возьми отвёртку в правую руку, поверни по часовой»: он либо обидится, либо начнёт выполнять буквально и потратит час там, где нужно пять минут.
Я переписал свои запросы по мануалу: убрал пошаговщину, оставил только цель, критерии готовности и границы. И железяка, которая неделю меня бесила, внезапно заработала так, как обещали в рекламе. Быстро, чётко, без философии.
Нет, осадочек остался, конечно. Но виноват был я, а не робот.
Пока читал документацию, собрал коллекцию перлов. Это всё реальные официальные рекомендации, не шутки:
«Не показывайте модели счётчик оставшейся памяти». У Fable 5 есть особенность: если она видит, что рабочая память заканчивается, начинает нервничать — комкает работу, предлагает «давайте я подведу итоги и закончим». Лечится двумя способами: спрятать от неё счётчик или написать ей «памяти у тебя полно, работай спокойно». Прятать часы от сотрудника, чтобы не дёргался. Дожили.
Кремовый дизайн. У Opus 4.8 есть любимый стиль: если попросить её сделать сайт и не уточнить дизайн — она нарисует кремовый фон, изящный шрифт с засечками и терракотовые акценты. Всегда. Даже если ты просил панель управления для завода. Причём фразой «не надо кремового» не лечится — она просто выберет другой любимый цвет и будет рисовать его. Помогает только конкретное ТЗ по цветам.
Заблокировала слово «привет». У новой модели строгие фильтры безопасности, и в первые дни они так лютовали, что одному бедолаге заблокировало сессию, в которой было одно слово — «hello!». Фильтр сработал не на сообщение, а на служебную обвязку. Производитель потом извинился: мол, перестарались с настройкой, простите.
«Не просите её объяснить ход рассуждений». Раньше это был классический приём: «объясни, как ты пришла к выводу». На новой модели такая просьба официально считается попыткой выудить внутреннюю кухню — и нейронка отказывается отвечать. У меня эта фраза годами жила в рабочих шаблонах. Пришлось искать по всем файлам и вычищать.
У OpenAI (это которые ChatGPT) всё по-другому — но не так, как ты ждёшь.
Они пошли инженерным путём: вместо «уговаривайте модель текстом» вынесли главные настройки в отдельные крутилки. Сколько думать — крутилка. Насколько подробно отвечать — крутилка. Хочешь, чтобы модель писала короче, — не пишешь ей «будь лаконичнее, умоляю», а буквально ставишь параметр «краткость: высокая». Звучит как мелочь, а на деле — другая философия: у Anthropic ты воспитываешь сотрудника словами, у OpenAI — выставляешь ему настройки в админке.
Но в одном обе конторы сошлись, и это главная новость: обе официально пишут — сменил модель, переписывай запросы заново. Старые не переноси. То, что лечило прошлую модель, калечит новую.
(Отступление для тех, кто верстал сайты в нулевые: помнишь отдельные костыли под IE6, под Оперу, под ранний Файрфокс? Вот. Мы вернулись туда же, только теперь костыли — под нейронки. Я-то думал, что индустрия научилась. Ха.)
Если ты пользуешься нейронкой раз в неделю через чатик — вообще забей, тебя это всё не касается. Спрашивай как спрашивал.
А вот если гоняешь агентов, пишешь рабочие шаблоны запросов или строишь что-то поверх API — три правила, которые я вынес:
Пиши цель, а не процесс. Не «сначала открой файл, потом проверь то, потом это», а «вот результат, который мне нужен, вот как проверить, что он достигнут». Современные модели планируют лучше, чем твоя пошаговая инструкция.
Убери капс и угрозы. Все эти «ОБЯЗАТЕЛЬНО!!», «НИКОГДА не делай» — наследие старых тупых моделей. Новые слушаются с первого раза, а от криков начинают перегибать в другую сторону.
Новая модель — новые запросы. Не тащи старые шаблоны. Прочитай мануал конкретной модели (да, теперь у каждой свой) и собери заново. Полчаса вложений — недели сэкономленных нервов.
Чтобы не было ощущения, что я тут рекламирую светлое будущее. Новая модель всё ещё медленная — ходы по несколько минут это норма, и к этому надо привыкать. Фильтры безопасности иногда срабатывают на ровном месте. А ещё мне теперь приходится держать ТРИ набора шаблонов: под Opus, под Fable и под ChatGPT. Это решаемо, но бесит. Чувствую себя коллекционером инструкций к утюгам.
И да, минусы прилетят от тех, кто скажет «нечего вообще с этими нейронками возиться». Понимаю. Но они уже возят половину моей рутины, так что выбора особо нет.
Я свои переписанные промпты выложил файлом в телеграм-канал: базовый шаблон, надстройки под Fable 5 и Opus 4.8 и заготовки для раздачи задач агентам — бери и адаптируй под себя. Канал: t.me/maslennikovigor, файл прикреплён к последнему посту.
Вопросы и «у меня не так» — в комменты или в телегу @maslennikovig, отвечаю сам.
Прогнал восемь языковых моделей на реальных рабочих задачах. Лучшей по соотношению цена/качество снова оказалась та, что вышла ещё год назад (июль 2025). Самые раскрученные новинки на деле выдумывают факты и сыпят иероглифами. Мораль: не ведись на хайп, проверяй сам.
Короче, я чуть не написал глупость.
Сидел, смотрел на свои цифры и почти сделал громкий вывод: «крошечная нейросеть обошла по качеству старшую от того же разработчика». Звучит же красиво — маленькая бьёт большую, размер не главное, все дела. Я уже почти панамку надел и собрался хвастаться.
А потом притормозил. Что-то не сходится. С чего бы младшей модели быть умнее старшей? Полез проверять — и понял, в чём подвох. Я сравнивал баллы из разных тестов, сделанных в разные месяцы. А так нельзя: между замерами у меня и темы менялись, и настроение, и сама методика чуть-чуть. Разброс — пара баллов туда-сюда. И вот на этом шуме я чуть не построил целый «инсайт».
Поэтому сделал по-человечески: взял эти две модели и закинул в один общий прогон. Одна сессия, один судья, одни и те же задачи. А заодно докинул туда ещё парочку — чтоб сравнить всех честно, в одном котле.
И тут понеслось интересное.
Никакого «маленькая обошла большую» в честном прогоне не оказалось. Обе нейросетки шли вровень, разница в пределах погрешности. Скучно, зато честно: маленькая просто быстрее и дешевле, а по качеству — то же самое. Не «обходит». Идёт вровень. Разница в одном слове, а вывод противоположный.
Зато на освободившееся место выехала другая история. В том же котле первое место по соотношению «деньги/качество» снова заняла модель Qwen3-235B. И тут я предлагаю тебе посмотреть на её полное имя — там в конце стоит 2507. Это дата. 25-07. Июль 2025 года.
То есть модели почти год. Для нейросетей это как для телефона лет десять. Я специально полез проверить дату, чтоб не соврать — да, выпустили её 21 июля 2025-го.
И вот что меня реально цепляет. За этот год рынок перетряхнуло несколько раз. Одна контора прыгнула с позорных 57 баллов до 97 — это вообще другая нейросеть стала. Другую я гонял три раза за два месяца. Третью все хвалят как «убийцу всех». А по деньгам первое место как держал этот июльский старичок, так и держит. Я уже год жду, когда же его кто-нибудь подвинет. Никто не может.
Честно? Меня это даже немного напрягает. Со всех сторон орут, что ИИ — это «мыльный пузырь», что прогресс бешеный, модели умнеют каждый месяц. А лучшую по деньгам модель год никто не обходит. Либо прогресс не такой бодрый, как его рисуют. Либо новинки продают тебе красивые баллы, но не реальную выгоду. Я не знаю, что из этого правда, и мне от этого слегка не по себе.
Вот тут будет непопулярное мнение, и минусы, наверное, прилетят. Но скажу.
Я не понимаю всеобщего восторга вокруг MiniMax. Про него сейчас трубят из каждого утюга: обзоры, ролики, тесты, где он «всех обходит» и «выглядит лучше всех». На бумаге — да, циферки красивые, стоит рядом с топами.
А я его запускаю на своих задачах — и он мне на голубом глазу выдумывает «венчурного капиталиста Джеффа Безоса». Я перечитал дважды. Безос, на минуточку, основатель Amazon, а не венчурный инвестор. Дальше — больше: несуществующий фреймворк «Toyota TECS», выдуманный автор методики, точные циферки по компаниям, взятые из воздуха. Выглядит гладко, читается уверенно — и всё это враньё, которое в работе спокойно уедет клиенту. Худший вид брака: тот, что проходит беглый взгляд.
А предыдущая его версия любила вставлять китайские иероглифы прямо в русский текст. Прямо посреди слова. Я сначала подумал — глюк разовый. Нет, ловлю регулярно.
Знаешь, это часто называют «эффектом айфона»: продукт боготворят даже с косяками. Но к MiniMax это, по-честному, не лепится. Айфон в мире нейросетей — это скорее ChatGPT и Claude, к ним реально привязаны, им прощают по любви. А тут не любовь, а раскрутка. Модель, которую громко пиарят и которая «побеждает» в тестах, а на твоей задаче выясняется, что побеждала она на картинке.
И не думай, что дорогущий премиум — это автоматом спасение. Самый свежий флагман Anthropic, Claude Opus 4.8, многие держат за абсолютную вершину. У меня в тесте он сильный, но не первый. И со своей подлянкой: он жадничает на объём. Просишь урок «на 20 минут» — он пишет так плотно, что читается за 12–13. Вроде умно и красиво, но недодаёт. Если гонишь такое потоком, приходится подпирать его костылём, иначе он молча тебя обсчитывает.
Чтоб не думали, что я тут один такой жадный. Microsoft этим летом отбирает у своих инженеров доступ к дорогому AI-инструменту для кода — потому что счёт за токены сожрал годовой бюджет, по 500–2000 баксов на человека в месяц. Uber, по слухам, спалил весь годовой бюджет на AI-кодинг за четыре месяца. Это компании, которым переплатить — не вопрос. И даже они схватились за голову.
А мораль для нас, простых смертных, которые платят свои деньги, ещё проще.
Чтоб по-честному — мой «чемпион» Qwen тоже не идеальный, я его не боготворю:
Он самый медленный из всех. Где другие управляются за минуту, он молотит почти три.
Иногда ломает диаграммы — ставит не те кавычки, и картинка не рисуется.
И сам грешит выдуманными цифрами в кейсах — так что фактуру за ним проверять всё равно надо.
Поэтому мы у себя его реально используем, но не везде: в новые проекты не ставим как раз из-за скорости. Берём туда, где нужен максимум выгоды, а подождать не страшно — какие-нибудь фоновые задачи без жёстких сроков. Там он по деньгам незаменим, а его тормоза никому не мешают.
Видишь? Идеальных нет. Есть подходящие под конкретную задачу. В этом весь смысл.
Главное, что я вынес из этого прогона — оно даже не про конкретные нейросети. Оно про то, как мы выбираем.
Дата релиза не говорит ничего. Ни «новее — значит лучше», ни «старше — значит отстой». Свежий распиаренный флагман может сыпать иероглифы, а годовалый «старичок» — спокойно держать первое место по деньгам. Громкое имя и место в чужом рейтинге — это просто гипотезы. Проверяются они одним способом: берёшь и гоняешь на своих задачах. Доверять чужому тесту — это как покупать ботинки не примеряя. Я так не советую.
И вот этот тихий чемпион, про которого не снимают восторженных роликов, частенько и сидит внизу таблицы по цене. Просто его надо найти.
Да, я понимаю, как это читается: «мужик в интернете говорит, что разбирается в нейросетях лучше блогеров». Готов к минусам. Но я не прошу верить на слово — все цифры, цены и скорости по каждой модели лежат в открытом виде на лидерборде, ссылку дам ниже. Зайди, потыкай, не сойдись со мной во мнении — нормально.
Полный технический разбор со всеми таблицами — на Хабре. А живой лидерборд, который я обновляю по мере новых тестов, и сами цифры — в Telegram-канале: https://t.me/maslennikovigor. Если захочешь поспорить или поделиться своими замерами — пиши в личку @maslennikovig, я за здоровый срач по делу.
Кто сам ловил у нейросетей китайские иероглифы или выдуманные «факты» — расскажите в комментах, интересно, это только у меня так или общая беда.
Есть на гитхабе мега-популярный гайд по Claude Code (это нейронка, которая пишет код в терминале) — 56 тысяч звёзд. Внутри — советы в том числе от самого создателя инструмента. И вот один из этих советов спорит с тем, что я каждый день делаю на работе. Полез разбираться, кто из нас дурак. По дороге выяснил, что важное архитектурное решение в Claude Code приняли не по тестам, а «потому что так ощущалось лучше». И, кажется, это норма.
Короче. Я каждый день работаю с этими AI-кодерами — Claude Code, Codex, вот это всё. Это не чат-бот в браузере, а штука, которая живёт прямо в терминале и реально пишет код: лазает по файлам, чинит баги, гоняет тесты. Часть моей работы — заставить эту ораву делать дело, а не имитировать.
И вот мне скидывают ссылку на гитхаб. Гайд по Claude Code. 56 тысяч звёзд, первое место в трендах, автор — парень из Пакистана. Внутри аккуратно разложено всё: как настраивать, как давать задачи, 83 совета, 13 разных «методологий». Часть советов — прямые цитаты Бориса Черни, человека, который Claude Code и сделал.
Первая мысль была не самая благородная: «блин, я же про это весь год пишу по кусочкам, а парень собрал всё в одну кучу и поднял 56 тысяч звёзд». Позавидовал, чё уж там. Потом отпустило. Потому что карта — это не территория. На карте написано, где что лежит. А ходил по этим местам я.
Залезаю внутрь, читаю. И натыкаюсь на историю, после которой зауважал этих ребят сильнее, чем за все 83 совета.
Claude Code не хранит твой код в «умной базе для поиска по смыслу» (это называется RAG, если по-умному). Он тупо ищет по словам — как Ctrl+F, только на стероидах. И я полез смотреть: почему так? Это же вроде каменный век.
А создатель, Борис Черни, на одном подкасте честно рассказывает: в ранних версиях Claude Code как раз и была эта умная база. Попробовали по-настоящему. А потом выкинули — потому что тупой поиск по словам «обошёл всё, и это было неожиданно». И дальше дословно: оценивали мы это «в основном по ощущениям. По внутренним vibes. Просто ощущалось лучше».
Вдумайся. Инструмент, на котором сейчас пол-индустрии пишет код. За ним — одна из крупнейших AI-компаний мира. У них исследования по безопасности ИИ, отчёты на сорок страниц. А ключевую штуку — как искать по твоему коду — выбрали потому, что «нам так зашло».
Я перечитал дважды. Не показалось.
И знаешь, я не знаю, ржать или снимать шляпу. С одной стороны — несолидно для конторы такого размера. С другой — а кто из нас делает иначе? Я свои решения по этим агентам ровно так же половину времени принимаю: попробовал, вроде норм, оставил. Просто за мной не стоит 56 тысяч звёзд, поэтому мне можно.
Тот самый совет, из-за которого я вообще полез копать: гайд говорит — забей на умную индексацию кода, поиск по словам решает всё.
А у меня прямо сейчас на всех проектах внедряется штука под названием Graphify. Это не «поиск по смыслу», это карта твоего кода: что где объявлено, что куда зовётся, кто на кого ссылается. И она работает. Быстро, точно, жрёт меньше токенов (токены — это то, за что ты платишь нейронке; чем меньше, тем дешевле).
И вот вопрос на миллион: кто дурак? Я, который пихает индекс везде, или гайд на 56к звёзд, за которым стоит Anthropic?
Не люблю верить на слово, даже когда вывод мне приятен. Полез в реальные замеры. Их немного, но они есть — есть даже исследование с честным названием «Is Grep All You Need?» («А поиск по словам — это всё, что тебе нужно?»). И вот что вылезло.
Поиск по словам и правда часто точнее «умного». Логика простая: функция createHttpClient либо есть в файле, либо нет. А «умный» поиск тащит тебе всё «близкое по смыслу» — и для кода это обычно мусор, а не помощь. Плюс он не устаревает: код поменялся — поиск сразу видит. А умную базу надо постоянно пересчитывать.
Звучит как «я проиграл, гайд прав». Но нет.
Потому что Graphify — это вообще не та «умная база», которую выкинули в Anthropic. Они выкинули поиск по смыслу. А карта связей кода — это другое животное. Она даёт ту самую точность, за которую все хвалят поиск по словам, и при этом чинит его единственную реальную проблему — расход токенов.
И тут я должен поправить сам себя. Я уже было записал свою карту в «третий вариант». Нет. Замеры говорят проще: побеждает не «или-или», а гибрид. Берёшь поиск по словам, добавляешь карту структуры — и вот это бьёт и тупой поиск, и умный по отдельности. То есть «выкиньте умную базу» и «я внедряю Graphify» — это не спор. Это две половинки одной и той же штуки, просто я и гайд смотрим с разных концов.
Согласен ли я полностью? Процентов на семьдесят. Мне всё ещё не хватает цифр на моих собственных задачах — не чужих бенчмарков, а своих. Поэтому окончательный вердикт вынесу, когда сам всё прогоню и посчитаю. Как обычно.
Знаешь, что меня в этом гайде зацепило сильнее всего? Не советы. А то, что любой такой гайд по определению — это сборник опыта, которого ни у кого толком ещё нет.
Смотри. Всем этим нейронкам-кодерам — от силы год-два. Они обновляются каждые несколько недель, и поведение меняется от версии к версии. В таком мире «лучшая практика» живёт месяца три. Потом половина советов протухает: фича переехала, подешевела или просто исчезла.
Это не наезд на автора гайда — он молодец, собрал отличную карту. Это про сам момент. И вывод из него один: в области, где чужой опыт устаревает за квартал, дороже всего стоят твои собственные эксперименты и нормальное человеческое обсуждение. Ради второго я, в общем, и пишу.
Не буду делать вид, что во всём разобрался.
Свой вердикт по спору про поиск я вынес наполовину — по логике и чужим замерам, а не по своим цифрам. Это не то же самое, что «проверил руками». Так что если ты гонял поиск по словам против индекса на реальном большом проекте и считал токены — напиши, мне правда интересно сверить.
И ещё одна штука, которая меня лично бесит. У Claude Code огромное «окно памяти» — миллион токенов (это сколько текста модель держит в голове за раз). Звучит как подарок. На деле это гемор: за этим окном надо следить руками, потому что нейронка тупеет задолго до того, как его заполнит — где-то на 40%. А у Codex и ChatGPT окно меньше, зато оно само себя поджимает, и ты вообще не думаешь об этом. Вот тебе и «больше — лучше».
Раз уж я весь этот гайд перелопатил — собрал по нему навигатор на русском. Не перевод (на Пикабу английский все и так читают), а сортировку по реальной пользе: что ставить сегодня, что на любителя, что переоценено, а что вообще мимо (тот же разрекламированный режим песочницы я, например, так и не попробовал — мне проще иначе). Бесплатно, PDF, без регистрации и смс. Лежит в телеге.
Да, в конце я даю ссылку на свой канал — значит, можно крикнуть «реклама!». Крикнуть можно. Но навигатор бесплатный, гайд чужой и тоже бесплатный, а ничего платного я тут не продаю. Так что это скорее «зашёл сам — поделился с тобой».
Готов снять панамку, если по спору про поиск я где-то перегнул — для того и выкладываю, чтобы спорили.
Сам гайд легко гуглится по «claude-code-best-practice». Мой навигатор по нему и заметки про эту кухню — в телеге: t.me/maslennikovigor. Поспорить или скинуть свои замеры — туда же в личку: @maslennikovig. А мои инструменты для всей этой оркестрации лежат на гитхабе, бесплатно.
Если сам гонял индекс против grep на большом репо — очень жду твои цифры в комментах. Серьёзно, это полезнее любого гайда.
AI-помощник для кода (Cursor, Codex, Claude Code) при поиске по проекту тупо читает кучу файлов подряд — жрёт токены пачками и всё равно мажет. Лечится «графом кода»: это как оглавление вместо листания всей книги. Разобрал две тулзы — CodeGraph (лёгкий, гоняю сам) и Graphify (тяжёлый, про всё сразу). Обе бесплатные, к обеим отношения не имею.
Короче. Если ты пользуешься AI для кода — Cursor, Codex, Claude Code, неважно — ты наверняка ловил вот это. Даёшь ему задачу попроще: «найди, где тут проверяется логин, и поправь». А он начинает… искать. Открывает один файл целиком. Потом второй. Потом ещё пятнадцать. Перечитывает полпроекта, чтобы понять, что с чем связано.
И вот тут две беды сразу. Первая — он сжигает токены вагонами. На большом проекте один такой поиск — это сотни тысяч токенов только на то, чтобы понять, где вообще лежит ответ. А подписки сейчас и так глючат и режут лимиты так, что плакать хочется. Вторая беда — он ещё и мажет. Прочитал не те файлы, сделал вывод на половине, пошёл чинить не там. И ты сидишь, смотришь на это, и думаешь: ну ты чего, тупой, что ли?
Не тупой. Просто ищет по-дурацки.
Представь книгу на тыщу страниц. Тебе надо найти слово «авторизация». Можно листать страницу за страницей и читать всё подряд — найдёшь, но к вечеру и с дёргающимся глазом. А можно открыть оглавление (или предметный указатель в конце) и за пять секунд понять, где оно.
Вот AI без всякой подготовки делает первое — листает всю книгу. Каждый раз заново. А «граф кода» — это как раз то самое оглавление. Специальная программа один раз пробегает по всему проекту и строит карту: какие есть функции, какие классы, кто кого вызывает, кто откуда что тащит. И складывает это в маленькую базу.
Дальше AI не перечитывает двадцать файлов. Он спрашивает у карты: «кто вызывает функцию проверить_токен?» — и получает точный ответ мгновенно. Один запрос вместо двадцати чтений. Кто работал с базами данных — это ровно как индекс: можно тупо перебирать миллион строк, а можно построить индекс и доставать за миллисекунды. Идея старая как мир, просто к AI её прикрутили недавно.
Я сижу в основном в Codex, и поставил себе штуку под названием CodeGraph. Она ровно про это: строит лёгкую карту кода, целиком у тебя на компе, никуда ничего не отправляет. Поставил, она один раз проиндексировала проект — и дальше AI ходит в карту вместо того, чтобы листать файлы.
Честно расскажу про главную засаду. Поставить — не проблема, пара команд. Проблема была заставить агента реально пользоваться этой картой, а не игнорировать её и по привычке лезть листать файлы. Он, зараза, как студент: ему сказали «есть оглавление», а он всё равно открывал книгу с начала. Пришлось повозиться с настройками и отдельно прописать ему инструкцию: сначала смотри в карту, потом уже всё остальное. Вот после этого заработало как надо.
Стало ли лучше? Субъективно — да, заметно. AI перестал лазить в десяток лишних файлов, отвечает быстрее и точнее. Но честно скажу сразу, чтобы потом не было «а где пруфы»: своих замеров я не делал. По ощущению — кайф, но циферку нарисовать не могу. У авторов в их тестах заявлено что-то вроде −57% токенов и −70% обращений к файлам. Это их цифры на их проектах, я лично не перепроверял. Но по ощущениям порядок похож на правду — когда двадцать чтений схлопываются в один запрос, экономия реально большая.
Тут многие путаются, поэтому держи. Есть вторая тулза, Graphify, и на первый взгляд кажется «то же самое». А вот фиг.
CodeGraph — это лёгкий индекс только кода, для скорости. А Graphify строит карту всего проекта: не только код, но и документацию, PDF-ки, картинки, даже видео. То есть он не столько ускоряет AI в ежедневной работе, сколько помогает въехать в проект целиком — особенно если проект чужой или старый, и знание размазано по коду и куче документов. На выходе даёт даже красивую интерактивную картинку-граф, по которой видно, что с чем связано.
Я его пока только собираюсь попробовать, вживую не гонял — врать не буду. По докам разобрался в одной важной штуке: сам код он, как и CodeGraph, разбирает бесплатно, у тебя на компе. Платишь токенами только за документы и картинки — их он скармливает нейросети, чтобы вытащить смысл. И что приятно: если запускать его прямо изнутри своей IDE, отдельный платный ключ не нужен — он берёт модель из твоей же подписки. А если документы тебе не нужны, можно сказать ему «работай только по коду» — и тогда он вообще ничего не тратит, превращаясь по сути в тот же CodeGraph.
Вот тут отдельная история, на которой я набил шишку. Я работаю с нескольких компов и часто с командой. И первая мысль была логичная: раз карта полезная — давай положу её в общее место, в облако или в гит, чтобы у всех была и не пересобирать каждому.
Не делай так. Серьёзно.
У CodeGraph эта карта лежит в файле базы (SQLite), а такие файлы на сетевых дисках и особенно в WSL2 любят залипать в блокировках — у них это даже в известных багах записано. Плюс бинарный файл в гите — это конфликты при каждом коммите и распухшая история. Я потыкался и понял простую вещь: эту карту вообще не надо никуда таскать. Она строится из кода за секунды. Источник правды — это сам код. Каждый у себя на компе один раз сказал «построй» — и всё, дальше она сама обновляется. Синхронизируешь код, а не карту. Никаких блокировок, никакой боли.
А вот у Graphify наоборот — его карта это обычный текстовый файл, и авторы прямо советуют закоммитить его в гит, чтобы команда пользовалась готовым. Потому что построить его дорого (токены же). Логика разная, потому что и тулзы про разное.
CodeGraph — если бесит, что AI жрёт токены и тупит при поиске по коду. Лёгкий, локальный, поставил и забыл. Рабочая лошадка на каждый день.
Graphify — если надо въехать в незнакомый или старый проект целиком, со всей документацией, и посмотреть на него «сверху». Инструмент понимания, а не скорости.
И да, мир на этих двух не сошёлся. Есть ещё пачка похожих штук — Gortex (помощнее, тащит сразу кучу репозиториев и 256 языков), Sourcegraph (это уже для больших контор с сотней репозиториев, и он платный), Cognee (а вот это вообще не про поиск кода, а про «долгую память» AI — другая тема). Но если ты только начинаешь — не парься, начни с CodeGraph, его за глаза.
Не буду продавать тебе мечту. Если у тебя проект на три файла — забей, никакая индексация не нужна, AI и так всё найдёт мгновенно. Вся эта история начинает иметь смысл, когда проект большой и AI реально тонет в нём. На мелочи ты только время потратишь на настройку.
И вторая честность: я не делал строгих замеров. Всё, что я говорю про «быстрее и точнее» — это мои ощущения на моих проектах. Может, у тебя стек другой и зайдёт хуже. Попробуй на кошке, прежде чем тащить в боевой проект.
Мне постоянно пишут: «Да зачем тебе эта индексация, если у тебя подписка дорогая и токенов вагон? Не выпендривайся, пусть AI листает как листал».
Так вот — дело вообще не в токенах. Точнее, не только. Главное — AI с картой находит нужное с первого раза, а не читает двадцать файлов и гадает на половине. Он реже мажет. А значит — я реже за ним переделываю и реже сижу проверяю. Я экономлю своё время и получаю результат лучше. Токены, которые при этом тоже экономятся — приятный бонус, но не главное.
Отказываться от этого, потому что «токенов и так хватает» — это как сказать «у меня сервер мощный, зачем мне индексы в базе». Ну хватает, да. Просто можно сделать быстрее, точнее и дешевле разом. Не вижу ни одной причины этого не делать.
Звучит как реклама CodeGraph? Понимаю. Но я к нему вообще никакого отношения не имею — это чужой опенсорс, бесплатный, мне просто зашло. Я тут ничего не продаю и денег с этого не имею. Не веришь — так и не надо, поставь сам да проверь, благо бесплатно.
Ссылки на обе тулзы, готовые промпты, которыми их ставишь (копируешь в своего AI-агента — он сам разворачивает инструмент и прописывает себе правило лезть в карту, а не листать файлы), и до кучи мой маленький setup-skill graphify-project — не вместо стандартного, а в довесок. У самого Graphify уже есть огромный runtime-skill, который сам ставится командой graphify install — он гоняет всю боевую работу. Мой делает другое: помогает один раз правильно установить Graphify в репо без боли, если у тебя нет gcc на машине (внутри fallback на zig-cc), и не даёт агенту втихую сжечь токены через внешний backend. Всё это кидать сюда не буду — Пикабу ссылки не любит, да и забанит ещё. Сложил в свою телегу: t.me/maslennikovigor. Кто реально пробовал Graphify на боевом — напишите в комменты, мне правда интересно, я-то его ещё не гонял. А если хочешь поспорить или спросить — я в личке @maslennikovig, отвечаю сам, не бот.
Прогнал пять свежих нейросетей через свой тест на генерацию текста по-русски. Google наконец догнал OpenAI по качеству и стоит в 2.5 раза дешевле. А по соотношению цена/качество вообще все верхние места заняли китайцы — DeepSeek, Tencent, Qwen. Плюс честно расскажу, как полгода считал цены с ошибкой в два раза и сам не замечал.
Я уже год гоняю нейросети через свой собственный тест. Не тот, который меряет «кто умнее вообще», а свой, практический: какая модель лучше всех пишет нормальный текст на русском — уроки, методички, бизнес-разборы. Мы на этом реально работаем, генерим контент для клиентов, тысячи запросов в месяц. И каждый лишний цент за запрос превращается в тысячи долларов в месяц. Поэтому выбор модели для нас — это не «вау, новинка», а чистая бухгалтерия.
В этот раз прогнал пять штук: два американских флагмана (GPT-5.5 от OpenAI и Gemini-3.5-flash от Google) и три китайских. И знаешь что? Расклад на рынке поменялся так, что я аж присвистнул.
Раньше картина была простая: топ по качеству держат американцы — OpenAI и Anthropic (это которые Claude). Google вечно плёлся на итерацию позади. В прошлый раз их модель набрала вообще 57 баллов из 100 — это уровень «ну, сойдёт для черновика».
А тут Gemini-3.5-flash взял 97 из 100. Ровно столько же, сколько новейший GPT-5.5. Впервые на моём тесте Google встал ровно рядом с OpenAI. За полтора месяца прыжок с 57 до 97 — это не «доработали», это будто другую модель выкатили.
Но дальше начинается интересное — цена. GPT-5.5 за один запрос берёт примерно $0.23. Gemini за тот же результат — $0.09. В 2.5 раза дешевле. На наших объёмах (10 тысяч запросов в месяц) это $2290 против $898. Разница — почти полторы тысячи баксов в месяц. За одно и то же качество. Ну и зачем мне тогда переплачивать?
Вот тут самое сочное. Если смотреть не на голое качество, а на соотношение цена/качество — верхние места занимают вообще не американцы.
Смотри сам:
DeepSeek V4 Pro — качество 87 из 100, цена меньше половины цента за запрос
Tencent Hy3 (да, тот самый Tencent, который WeChat и игрушки) — качество 81, а цена вообще $0.0017. Это в 134 раза дешевле GPT-5.5. В СТО ТРИДЦАТЬ ЧЕТЫРЕ раза, я не опечатался
Qwen от Alibaba — тоже крепкий середнячок по качеству
То есть американцы держат вершину по чистому качеству — тут не поспоришь, 97 баллов это их территория. Но как только начинаешь считать деньги, оказывается, что лучшие по балансу — китайские. И это, по-моему, отлично. Должна быть конкуренция, должен быть выбор. А то привыкли, что «ну есть OpenAI, ну есть Claude, и всё».
DeepSeek V4 Pro я гонял уже третий раз за два месяца. И вот что обидно: качество как стояло на 87-89, так и стоит. Я честно ждал, что модель дозреет, станет умнее. Не стала. На длинном русском тексте она пишет грамотно, но суховато — как методичка, без огонька.
Зато китайцы взяли и уронили цену в 5 с лишним раз. Просто снизили тариф. И вот эта самая модель, которую в апреле я считал «дорогой и не оправдавшей ожиданий», теперь снова в деле — не потому что поумнела, а потому что подешевела. Иногда так тоже бывает: модель та же, а решение по ней — другое. Чисто из-за ценника.
На Qwen 3.7 Max у меня были большие надежды. Предыдущая версия, 3.6, была хороша — и по качеству, и, главное, без косяков. А новая взяла и выдала фокус, от которого я схватился за голову.
Она вставляет китайские иероглифы прямо в русский текст. Не в отдельный блок, а прямо в середину слова. Вот реальная цитата из теста:
«Денежная мотивация имеет предел边际ной полезности»
Видишь вот эти закорючки в слове «предельной»? Это китайское слово «marginal», которое модель воткнула прямо в русское слово. Она как бы «думает» по-китайски внутри, и иногда китайский токен прорывается наружу.
И самое обидное — в прошлой версии, 3.6, этого не было. То есть они умеют это чинить, видели у них уже починенным. А в новой версии оно вернулось. При том что Qwen стоит как премиум — в 40 раз дороже того же Tencent. Дорого, и с тараканами. Пас. Будем надеяться, в следующей версии починят.
Дальше будет история, за которую мне немножко стыдно, но рассказать надо — потому что она полезная.
Пока я собирал этот тест, полез перепроверить старые цены в своей базе. И обнаружил, что полгода считал стоимость запросов по кривой формуле. Я брал примерную прикидку: мол, столько-то текста на входе, столько-то на выходе, умножаем на тариф. Прикидка была удобная, но неправильная — для русского текста с разметкой, формулами и таблицами она занижала реальную цену на 50–140%.
То есть я полгода рассказывал людям цены, которые были занижены местами в два с лишним раза. И никто не замечал — включая меня. Потому что относительный расклад (кто дешевле, кто дороже) оставался плюс-минус правильным, а вот абсолютные цифры врали.
Спалился случайно: сравнивал новые данные со старыми, и они не сошлись. Полез разбираться — а там вон оно что. Теперь беру реальные цифры расхода напрямую от сервиса, а не прикидываю на глазок. Неприятно было это обнаружить, но публиковать новый тест и молчать про старый косяк — это уже не честный тест, а самолюбование. Так что вот, рассказал.
Раз пошла такая пьянка — выскажу то, за что меня, может, и минуснут.
В 90% случаев вам НЕ нужна самая дорогая модель. Вот это вот «давайте поставим GPT-5 или Claude Opus, чтобы наверняка» — это чаще всего просто слив денег. Для большинства задач (сгенерить текст, ответить в поддержке, разобрать документ) разница между топовой моделью за 23 цента и нормальной за 0.3 цента не видна обычному человеку. Оба текста пройдут как «нормально». А счёт за месяц отличается в сто раз.
Но есть и обратная крайность, тоже дурная: воткнуть самую дешёвую модель, не проверив. И потом удивляться, почему клиенту в текст налезли китайские иероглифы (привет, Qwen) или почему сгенерилась какая-то дичь. Дёшево — не значит хорошо, как и дорого — не значит хорошо.
Правильный путь скучный: берёшь, тестируешь на СВОИХ задачах, считаешь деньги. И почти всегда оптимум оказывается где-то посередине. А посередине сейчас, сюрприз, сидят китайцы.
Чтобы не выглядело, будто я тут продаю «китайские нейросети — топ»:
Мой тест — про длинный текст на русском. Если тебе нужен код, математика или английский — расклад будет другой, и там американцы скорее всего рулят.
Качество я мерю одной моделью-судьёй (Claude). Это не идеально, у любого судьи свои загибы.
«Лучше по цене/качеству» не равно «лучше вообще». Если деньги не считаешь и нужен максимум качества — бери американский флагман, тут вопросов нет.
Это срез на конкретный месяц. Через два месяца выйдет что-то новое, и таблица снова переедет. Так каждый раз.
Главная мысль простая: рынок нейросетей меняется так быстро, что вчерашний лидер сегодня уже не лидер. И если ты строишь что-то на нейросетях — закладывай возможность легко поменять модель. Не прибивай её гвоздями к коду. Через пару месяцев выйдет что-то лучше и дешевле, и ты захочешь переключиться одной кнопкой, а не переписывать половину проекта.
А ещё — не верь чужим тестам слепо. Включая мой. Прогони на своих задачах сам. Это как ботинки: пока не примеришь, не поймёшь, жмут или нет.
Дисклеймер. Звучит, может, как будто я топлю за китайцев — но нет. Я просто считаю деньги и показываю цифры. Завтра американцы уронят цены или выкатят что-то открытое и бесплатное — расклад поменяется, и я честно напишу про это. Никакой рекламы тут нет, ничего не продаю, просто делюсь тем, что намерил сам.
Полный лидерборд со всеми цифрами держу в своём телеграм-канале — там же выкладываю новые тесты по мере выхода моделей: t.me/maslennikovigor. Если хочешь поспорить или рассказать свой опыт — пиши в личку @maslennikovig, отвечаю.
Если сам гонял нейросети на русском тексте — кидай в комменты, что у тебя выходило. Особенно интересно, ловил ли кто иероглифы у других моделей.
