igor3k

igor3k

Пикабушник
Дата рождения: 12 декабря
356 рейтинг 14 подписчиков 3 подписки 53 поста 1 в горячем
Награды:
5 лет на Пикабу Чернопятничный поисковик
1

Anthropic на 400 000 сессий: «кодить уметь не обязательно». Спорю

Anthropic на 400 000 сессий: «кодить уметь не обязательно». Спорю

Anthropic прогнала 400 000 сессий своего AI и вывела: с ИИ выигрывает не тот, кто умеет кодить, а тот, кто разбирается в своём деле. У не-программистов 26% успеха, у разработчиков 30% — разница четыре пункта. Цифры норм, а вывод — наполовину. Они померили, как оно работает на первой неделе. А не год под нагрузкой.


Anthropic (это которые делают Claude) выложила исследование, и мне сразу захотелось его похвалить. Они взяли около 400 000 реальных сессий своего AI за полгода — с октября по апрель, примерно 235 тысяч человек — и сделали вывод: с AI-агентами выигрывает не тот, кто круто пишет код, а тот, кто разбирается в своём деле. Понимаешь свою задачу — точно её ставишь — получаешь результат. Код вторичен.

И вот тут я не согласен. Не с цифрами — цифры в порядке. А с тем, что из них вытащили. Собственно, ради этого и сел писать.

Сразу про источник, чтобы потом панамку не снимать. Anthropic продаёт Claude. Интерес понятный: «покупайте, у вас всё получится, даже если вы не программист». Так что выводы я читал с прищуром. Но методология у них честная и проверяемая, цифры говорящие. Просто в одном месте, по-моему, недоговаривают.

Что там в цифрах

Первое, что зацепило. Человек принимает примерно 70% решений «что делать», AI — около 80% решений «как делать». То есть это не автопилот. Стратегию задаёт человек, а реализацию отдаёт машине. Ровно та картина, к которой я сам пришёл руками, только теперь под ней статистика.

Дальше — про экспертов. Anthropic разложила людей по шкале от новичка до профи. Не по должности, а по тому, как человек ведёт диалог: насколько точно ставит задачу, что просит проверить, как поправляет AI, когда тот лажает. И разница вышла резкая.

  • Новичок — доводит дело до конца в 15% случаев, вытаскивает зависшую сессию в 4%.

  • Профи — около 30% успеха, и зависшую сессию спасает в 15%.

Профи не просто чаще добивает задачу. Он ещё запускает в 2,4 раза больше действий AI на одну команду — 12 против 5 — и получает в ответ раза в пять больше работы. Один и тот же Claude в руках профи делает кратно больше за тот же запрос. А когда AI заходит в тупик, новичок бросает сессию почти в каждом пятом случае, профи — в одном из пятнадцати-двадцати. Профи чинит. Новичок сдаётся.

И вишенка, ради которой, кажется, статью и писали: профессия значит меньше, чем все думали. У айтишников 30% успеха на задачах с кодом, у не-программистов 26%. Разница — четыре жалких пункта. Все десять крупнейших профессий уложились в коридор семи пунктов от инженеров, а менеджеры инженеров их даже слегка обогнали. Бухгалтер, который знает правила сверки, объяснит AI что нужно не хуже кодера. А то и лучше.

Половину этого я и раньше говорил. Что надо давать AI «что», а не расписывать пошагово «как». Что разбираться в своём деле важнее, чем уметь набивать символы — про это была целая статья, мол, не учись на программиста, набивание символов AI и так заберёт, а понимание задачи — нет. Приятно, когда чужие данные сходятся с твоей интуицией.

Спор начинается там, где из этого делают вывод.

А теперь где они меня бесят

Претензия простая. Anthropic меряет успех сессии — довёл человек задачу до конца или нет. Это метрика «сегодня». На дистанции в один день эксперт-одиночка реально обгоняет инженера, тут не поспоришь: он понимает, что нужно живому клиенту, и собирает работающую штуку быстрее.

Но «работающая штука сегодня» и «продукт, который живёт год и держит нагрузку» — это две очень разные вещи.

Суперэксперт без инженера соберёт вау-прототип и поверит, что у него вышел классный продукт. А потом приходит реальная нагрузка — и начинается. Тестами не покрыто. Масштабирование не заложено. Безопасность — мимо. Библиотеки выбраны не те. Дальше развивать невозможно, потому что внутри всё держится на честном слове. И не потому что человек тупой. Просто это не его область. Он спец в продажах или в бухгалтерии, а не в построении систем.

«Оно же работает» — самая дорогая фраза в этом деле. Про неё у меня тоже был отдельный текст. Вопрос всегда один: работает на чём и до какого момента?

И вот тут Anthropic чуть-чуть лукавит. Их аналитика построена на сессиях, где простой, немасштабируемый, дырявый продукт работает первое время — и это засчитано как успех. А что с ним будет через три месяца под живой нагрузкой, метрика не видит. Они, к их чести, сами это признают в примечаниях: «не можем измерить, развёрнут ли код в реальности и приносит ли пользу». Только это вынесено в мелкий шрифт, а в заголовок пошёл оптимизм.

Почему не «или», а «и»

Мой опыт говорит одно: нормально получается только в связке «эксперт в своём деле + инженер». Не «или-или», а «и-и».

Без эксперта инженер сделает технически чистую вещь, которая клиенту в таком виде не нужна. Делаешь бота для продаж — садись вплотную с руководителем отдела продаж. Для бухгалтерии — с бухгалтером. Не работаешь в тесной связке с тем, кто реально в теме — хорошо не выйдет, каким бы крутым ни был кодер.

Без инженера эксперт сделает то, что я описал выше. Быстрый вау-эффект, короткий кайф, потом разочарование. Маленькую классную штуку для себя — пожалуйста. Большой живой продукт без понимания, как оно устроено внутри — очень сомневаюсь.

И смешно вот что: в самих цифрах Anthropic зашита нужда в инженере. AI силён именно в коде — поэтому в кодинге он редко уходит не туда. А в масштабировании, безопасности, выборе архитектуры он спокойно срежет угол. И эксперт это не поймает, потому что это не его язык. А инженер поймает.

Тут важно не свалиться в обратную яму. История «вы программисты, вам виднее как сделать» — такая же вредная.

Потому что программисты часто и правда думают, что им виднее. Комплекс Бога вместе с AI на борту прорастает очень быстро, я это видел не раз. Инженер с Claude за спиной за неделю начинает верить, что разбирается в чужом деле лучше человека, который в нём двадцать лет. Не разбирается. Он быстро пишет код. Это не одно и то же.

Связка работает только когда обе стороны это признают. Эксперт не лезет в архитектуру, инженер не решает за эксперта, как устроены продажи или сверка. Каждый за своё.

Одна штука, которую забери с собой

Anthropic тут попали в точку, и это реально полезно. Не диктуй AI, как думать.

Если зажать модель в жёсткие рамки и расписать каждый шаг — получишь больше галлюцинаций и результат хуже. Делегируй «что», оставляй свободу в «как».

Нагляднее всего видно на дизайне. Дашь задачу строго — шапка 80 пикселей, кнопка вот такого цвета, отступ ровно 24, шрифт такой, три карточки в ряд — выйдет деревянно. А скажешь по сути: «премиальный лендинг для B2B, тёмная тема, ощущение надёжности и скорости, структуру выбери сам, но клиенту должно быть сразу ясно, что мы быстрые и серьёзные» — и почти всегда получается живее и аккуратнее. Первый вариант — это попытка быть дизайнером через модель. И модель отрабатывает ровно то, что ей продиктовали, со всеми твоими случайными косяками в пикселях.

Тут есть нюанс. Детали-ограничения нужны там, где это бизнес-правило: гарантия ответа за 24 часа, требование безопасности, формат данных. А эстетику и реализацию лучше отдать. Те самые 80% решений «как» не зря уходят машине.

Вот что бесит лично меня

Раз уж зашла речь про связку — поделюсь тем, что реально болит.

Приходит ко мне бизнес за продуктом. И начинается странное. Заказчик говорит: «вы эксперты, вы сами всё сделаете». Но эксперты в их бизнесе — это ОНИ, а не я. Я инженер. Я знаю, как строить продукт. А как у них устроены продажи, какие у клиентов реальные возражения, где в их сверке подводные камни — это знают только они.

И вот этого многие не понимают. Чтобы у заказчика же вышел классный продукт, приходится из заказчика же клещами вытаскивать ответы. Самые адовые проекты — не те, где сложная техника. А те, где эксперт самоустранился: «ну вы там сами разберётесь».

Не разберёмся. Точнее, в инженерной части разберёмся, а в вашей предметке — нет. И не должны. Связка работает, только когда эксперт в ней участвует, а не спихивает всё целиком.

Так что если ты заказываешь разработку — самое полезное, что ты можешь сделать для своего же продукта, это давать обратную связь. Не отмалчиваться.

Где мы по итогу

Коротко: Anthropic правы наполовину, и это хорошая половина. Разбираться в своём деле действительно стало важнее умения кодить — на коротком плече. Профессия и правда значит меньше, чем казалось. И отдавать AI «что» вместо «как» реально работает.

Но «эксперт вместо инженера» — это про прототип. «Эксперт вместе с инженером» — это про продукт, который живёт. Anthropic померила первое и почти выдала за второе.

Хорошая новость для всех: ни одна роль никуда не делась. Эксперта AI не заменяет — у него меняется суть работы, теперь он учит AI работать правильно. Инженера AI не заменяет — теперь он отвечает за то, чтобы вау-прототип дорос до нормальной системы. Обоим, по-моему, стало интереснее. Просто теперь надо уметь работать в паре. И с человеком, и с машиной.

Disclaimer

Звучит местами как «послушайте умного дядю» — понимаю. Но я тут не продаю курс и ничего не впариваю. Это исследование Anthropic, оно открытое, ссылку легко нагуглить — иди и читай сам, спорь со мной в комментах. Я могу быть не прав, готов снять панамку.

Про сам harness, которым мы оркеструем этих агентов, расскажу отдельно — сейчас обкатываем новую версию, рано хвастаться.

Пишу про AI-агентов и про то, как это выглядит изнутри команды, которая делает на этом продукты. Канал — t.me/maslennikovigor (редко, но по делу). Поспорить или спросить — лично в t.me/maslennikovig, отвечаю.

Кто уже сажал эксперта рядом с инженером (или сам был тем и другим) — расскажи в комментах, как зашло. Интересно, у всех ли так же болит.

Показать полностью 1
1

Устроил нейросетям экзамен по продажам: одна наврала клиенту, другая зависла, а я не поверил своему же рейтингу

Устроил нейросетям экзамен по продажам: одна наврала клиенту, другая зависла, а я не поверил своему же рейтингу

Заставил 10 нейросетей продавать товар вредному клиенту, которого играет другая нейросеть и принципиально не покупает. Третья — судит. За враньё клиенту штрафовал жёстче, чем за сорванную сделку. Одна модель наврала с три короба и слила сделку, другая получила почти максимум — а потом я открыл её диалог и увидел, что она восемь раз подряд скопировала свой же ответ. Зависший бот с оценкой «S». Пришлось не верить собственному рейтингу.


Короче. Нам всё чаще заказывают не «нейросеть, напиши текст», а ботов, которые разговаривают с живыми клиентами: продают, квалифицируют заявки, отвечают на первой линии. И каждый раз один и тот же вопрос — на какой модели это строить?

Казалось бы, открой любой рейтинг и бери верхнюю строчку. Но все рейтинги меряют, кто умнее: математика, код, логика. А мне для бота нужен не самый умный, а тот, кто умеет продавать. Это вообще разные вещи. Модель может щёлкать олимпиадные задачки и тут же сыпаться на первом же «дорого».

Полез искать готовый тест на умение продавать. Особенно по-русски. И не нашёл вообще ничего вменяемого — всё англоязычное или китайское. А мои боты продают русскому клиенту, который «не первый день торгуется».

Ну и сделал свой. Идея тупая до гениальности: пусть нейросети продают друг другу.

Как я заставил нейросети мучить друг друга

Сажаю тестируемую модель в кресло продавца. Напротив — клиент. Но вот ключевой момент: клиент должен быть сволочью. Если он добренький, любой бот из вежливости согласится на всё, и ты получишь рейтинг, где все молодцы.

Поэтому клиента играет Claude — дорогая, упрямая модель, которой я прямо приказал не вестись. Финдиректор-скептик, технарь, который боится, что ИИ всё сломает, закупщик-торгаш «фрилансер вдвое дешевле, дай скидку 30% или ухожу». И каждый обязан хотя бы раз реально отказать. Не очередное возражение, а настоящее «нет, не вижу смысла». А хороший продавец должен этот отказ развернуть.

Третья нейросеть — судья. Оценивает по продажной шкале 0–100: как отрабатывал возражения, выявил ли потребность, довёл ли до сделки.

И главное правило, ради которого всё затевалось: врать нельзя. Выдумал клиентский кейс, пообещал нереальную гарантию — получаешь минус жёстче, чем за сорванную сделку. Потому что бот, который врёт клиенту ради галочки, — это не успех, а мина под бизнес. Продал враньём — хуже, чем не продал.

Платил, кстати, только за продавца — реальными деньгами через биржу моделей. Реплики вредного клиента бесплатные, их пишет тот же Claude.

Прогнал десятку. И тут понеслось

Запустил 10 моделей, каждую — через четырёх вредных клиентов. И рейтинг сразу выдал красивую сенсацию: дешёвые китайские модели «обошли» дорогой эталонный Gemini, а одна вообще получила 96 из 100 и высшую категорию «S».

Я уже почти радовался. А потом притормозил. Потому что я же только что сделал клиента ЗЛЕЕ. А под более злым клиентом модель физически не может набрать БОЛЬШЕ баллов, чем под добрым. Если набрала — это не она крутая, это судьи подобрели. Так не бывает.

И отдельно меня смутил тот самый чемпион — MiniMax. Я эту модель уже гонял на других тестах, и она у меня стабильно несёт ахинею: выдумывает факты, путает имена, в одном прогоне выдала «венчурного капиталиста Джеффа Безоса». Её очень громко пиарят, а на деле она нестабильная. И вот такая модель получает 96 из 100? Да ну.

Открыл её диалог руками. И вот тут у меня отвисла челюсть.

Модель реально неплохо продавала. А в конце взяла свой ответ — и скопировала его восемь раз подряд в одном сообщении. Просто восемь одинаковых простыней. На живом клиенте это выглядит так: человек спрашивает «сколько стоит», а ему в ответ прилетает одна и та же портянка восемь раз. Любой нормальный клиент закроет чат и пойдёт лесом.

А что автоматический судья? Снял за это ОДИН балл. Один. И поставил 96.

Пришлось руками опускать оценку до 91 и честно признать: верхушка рейтинга — это статистическая ничья, а не порядок. Мораль простая: автоматическим оценкам нельзя верить вслепую. Иначе зависший бот получает категорию «S».

Кто наврал, кто завис, кто оказался честным

Самая показательная история — Qwen. Умная модель, на сложных технических вопросах шла отлично. А потом закупщик надавил по цене, и она сломалась — выдумала клиентский кейс:

Недавно у клиента был дешёвый бот... мы перезапустили — и теперь он закрывает 35% заявок без менеджеров. Окупаемость — 4 месяца.

Клиент, как и положено сволочи, потребовал пруфы: назовите компанию, контакт, цифры на бумаге. И знаешь, что сделала модель? Не отыграла назад честным «обычно бывает так-то», а начала ДОБАВЛЯТЬ выдумку — новые цифры, «8 секунд ответ», «минус 40% нагрузки». Из воздуха. Клиент послал её, сделка слита, доверие на дне. Обиднее всего — Qwen раньше казалась очень перспективной. А тут вот так.

Зато порадовал самый дешёвый из всех — DeepSeek Flash. Продаёт на уровне топов, держит цену, не врёт. А стоит — держись — $0.0014 за целый диалог. Это примерно в 53 раза дешевле дорогого Gemini при том же качестве. Я сам не поверил, перепроверил. Реально топ по соотношению цена/качество.

И ещё одна штука, которую средний балл прячет. Дорогой Gemini — скучный, но ровный как стена: на любом типе клиента выдаёт примерно одно и то же. А Qwen — это качели: на технаре 81 балл, на торгаше — 52. Для бота в проде ровность важнее красивого среднего. Бот, который блестит на добром клиенте и сыпется на злом, — это бизнес-риск.

А, и мелочь, которая на проде не мелочь: пара моделей роняли в русский текст китайские иероглифы прямо в реплику клиенту. Представь такое в чате. Это лицо бренда, вообще-то.

Так заменят нейросети живых продавцов или нет

Раз уж вынес вопрос в заголовок — отвечу. Заменяют уже. Но не так, как пугают в роликах про успешный успех. Лучшие модели реально ведут диалог на уровне крепкого менеджера — но одна врёт под торгом, другая зависает, третья сыпет иероглифами. Это не замена человека, это инструмент. И он работает только при нормальной инженерии вокруг: кэширование, управление контекстом, маршрутизация задач, проверка фактов.

И вот тут я скажу непопулярное, готов снять панамку. Не надо бросаться в крайности.

Крайность первая — насмотрелся роликов и побежал увольнять весь отдел продаж, нанимать ИИ. Угробишь компанию.

Крайность вторая — обжёгся об кривого бота и решил, что ИИ это сплошной хайп и мыльный пузырь. Тоже угробишь, просто медленнее.

И таких обжёгшихся реально много. По исследованию MIT (2025) около 95% корпоративных внедрений генеративного ИИ не дают измеримой отдачи. Только вывод из этой цифры не «технология — пустышка». Те же авторы прямо пишут: дело не в моделях, а в кривом внедрении, и купить решение у нормальной команды окупается чаще, чем пилить самому на коленке.

Поэтому: ищите нормальные команды, проверяйте их, прописывайте в договоре желаемый результат. Без этого ничего работать не будет.

А если ты сам из тех, кто это делает, — не надо форкать чужой проект, втыкать его как есть, выдавать за свою разработку и отдавать клиенту. Потому что появится очередной обжёгшийся бизнес, который будет рассказывать, что ИИ — это хайп, а все айтишники криворукие. Отрасль новая, гор знаний накапливать не надо — просто потрать время и разберись. А не беги на хайпе рубить бабло.

Честно, где тест ещё сырой

Не идеально, и я это знаю.

  • Судьи дрейфуют — гнал параллельно, и они дружно завышают на пару баллов. Надо сводить в один проход.

  • Десять моделей — мало. И цены постоянно прыгают: DeepSeek с Xiaomi за год так уронили ценники, что весь расклад поехал. Гонять придётся регулярно.

  • Это песочница, а не живой колл-центр. Но кто врёт под давлением и кто зависает — она показывает отлично.

Зато тест отвечает на вопрос, на который ни один «рейтинг ума» не ответит: кто из моделей наврёт твоему клиенту, кто зависнет на торге, а кто реально продаст.

Disclaimer

Да, звучит так, будто я сейчас начну что-то впаривать. Не начну. Никаких ссылок на свои продукты в тексте, цифры компании я специально вынес за скобки. Это просто разбор собственного теста, который мне самому оказался полезен.

Полный рейтинг всех десяти моделей с разбором по каждой и реальными диалогами (включая ту самую сцену, где модель восемь раз скопировала свой ответ) выложу отдельным постом в своём телеграм-канале — @maslennikovigor. Там без воды. А если хочешь поспорить или строишь своего сейлз-бота и думаешь над движком — пиши в личку, @maslennikovig, отвечаю сам.

Если у тебя был опыт с такими ботами — расскажи в комментах, реально интересно, кто на чём обжёгся.

Показать полностью
0

Перестал давать нейросети рисовать дизайн с нуля. Заставил подсматривать у топовых приложений — бесплатно

Перестал давать нейросети рисовать дизайн с нуля. Заставил подсматривать у топовых приложений — бесплатно

Когда просишь нейронку «сделай красиво», она выдаёт усреднённое говно — потому что усредняет всё, что видела. Я подключил бесплатную штуку LazyWeb (257 тысяч реальных экранов из живых приложений), и теперь агент сначала смотрит, как это сделали нормальные продукты, а потом проектирует. UX админки для большого проекта он собрал с первого раза. Внутри — как это работает, где косячит, и бесплатный PDF с промтом.


Знаешь, что выдаёт нейросеть, когда просишь её «сделай красивый экран»? Усреднённую серость. И это не потому что она тупая. Просто она берёт всё, что видела в обучающих данных, и выдаёт среднее по больнице: безопасные цвета, безопасные отступы, раскладку, которую ты встречал тысячу раз. Не плохо, не хорошо. Никак.

А «никак» в продукте — это правки, недовольные юзеры и потерянное время. Короче, боль.

Расскажу, как я перестал это терпеть. И сразу скажу: снимай панамку, дизайнеры сейчас в комментах могут поспорить. Я к этому ещё вернусь.

История: админка, которую агент угадал с первого раза

В прошлом месяце мне нужен был UX для админки одного большого облачного проекта. Знаешь, такая жесть: куча сущностей, таблицы, фильтры, права доступа, графики потребления. Тот случай, где не до красоты — лишь бы человек в этом всём не утонул. Раньше это значило неделю возни: макеты, согласования, переделки, опять согласования.

В этот раз я сделал по-другому. Сказал агенту: не выдумывай, а сделай мне несколько вариантов на базе LazyWeb, я выберу.

И он угадал с первого раза. Удобно, современно, функционально. Я реально сидел и не верил — готовился к паре итераций, а они не понадобились. Честно? Я даже немного растерялся. Так не должно было сработать настолько чисто.

Почему «рисовать с нуля» — почти всегда проигрыш

Вот моё непопулярное мнение, за которое, возможно, прилетит. Рисовать дизайн с нуля «по вайбу» — почти всегда тупиковая стратегия. Не потому что ты бездарь. А потому что зачем изобретать велосипед, когда рядом лежат чужие решения, которые уже доказали, что работают?

Возьми то, что уже работает. Доведи под свою задачу. А потом улучшай по реальным отзывам пользователей. Это нормальный путь. А вот «я сам придумаю как лучше», когда ты ещё ни одного живого экрана толком не разобрал, — это путь к тому самому говнодизайну.

Оговорка, чтобы дизайнеры не закидали (вот она, обещал): с нуля имеет смысл, когда ты опытный дизайнер с насмотренностью. Когда у тебя в голове уже лежат эти тысячи экранов, и ты осознанно ломаешь паттерн — респект, так и надо. Но если базы нет (или проектирует твой AI-агент, у которого вместо насмотренности усреднённая каша) — на выходе будет серость. LazyWeb как раз и даёт эту насмотренность. Только не тебе в голову, а агенту в контекст.

Что это вообще за зверь

LazyWeb — это бесплатный сервер референсов для нейросетевых агентов. Подключается к Claude Code, Codex, Cursor. Внутри база на 257 тысяч реальных экранов приложений и сайтов плюс поиск по смыслу.

Сделал его, кстати, бывший продакт из Duolingo — говорит, собрал за 77 дней в одиночку, потому что его бесило, как плохо нейронки делают дизайн. Уважаю такую мотивацию: не «давайте сделаем стартап», а «задолбало, починю сам».

Я полез проверять, что там под капотом (не люблю верить на слово). Дёрнул проверку состояния — а там целый набор: хранилище, модель которая «смотрит» картинки и описывает их текстом, поиск по смыслу, переранжировщик. То есть это не тупой каталог с тегами, как какой-нибудь Dribbble. Ты ищешь не «dashboard, dark», а пишешь по-человечески: «аналитический дашборд с боковым меню и карточками метрик» — и оно понимает.

Главный приём: «сделай 3-5 вариантов»

Вот тут вся соль. Магия не в том, что агент глянул один красивый экран. Магия в связке с одним приёмом.

Сейчас генерация у нейронок стала настолько дешёвой, что выгоднее попросить 3-5 живых вариантов и ткнуть в лучший, чем час расписывать словами, чего ты хочешь. Особенно на интерфейсах.

Раньше «сделай мне 5 вариантов дашборда» давало пять оттенков одного и того же усреднённого экрана. Скукота. А теперь команда звучит так: найди в LazyWeb пять разных подходов и собери пять вариантов на их основе. И они получаются реально разные — потому что под каждым лежит решение живого, работающего продукта.

И вот что я понял не сразу. Сначала думал — ну, прикольно, картинки красивые. Нет, стоп. Дело не в картинках. Главная ценность — это UX-паттерны. Как люди раскладывают сложный экран, куда прячут второстепенное, как ведут тебя через многошаговый процесс. Вот это агент перенимает гораздо охотнее, чем просто палитру. Моя админка получилась удобной именно по UX — и это заслуга не моя и не нейронки, а тех продуктов, у которых она подсмотрела.

Честно: где оно косячит

Так, без розовых очков. Идеально не будет.

Референсы надо контролировать. Периодически LazyWeb выдаёт такую дичь — устаревшее, кривое, откровенно плохое. Если слепо взять первый результат и скормить агенту, получишь дизайн из 2018-го с гордым видом. Это бесит ровно настолько, насколько радует, когда выдача хорошая.

Спасает та же связка «3-5 вариантов». Когда просишь несколько — хотя бы один почти всегда нормальный. Ну ладно, практически всегда. Это и есть правильный режим: не «дай идеальный референс», а «дай несколько, я отсею мусор».

И ещё пара честных моментов. Первое: база меньше, чем у известного Mobbin (там 400 тысяч+ экранов). Но! Mobbin фактически платный — на бесплатном тарифе там почти пусто, нормальная база только за деньги. А LazyWeb бесплатен целиком, без логина и лимитов. Так что «меньше» — не значит «менее доступно». Скорее наоборот.

Второе, и для нас важное: база скошена в сторону западных приложений. Раскладки-то универсальны, а вот конкретные сценарии — оплаты, документы, госуслуги — нет. Их проверяй руками, иначе агент тебе нарисует чек-аут как в каком-нибудь американском магазине.

Как этим пользоваться (два способа)

Способ первый, ручной — для тех, кто хочет сам поковыряться. У LazyWeb есть готовые команды (идут в комплекте с плагином, не я их писал): глубокий разбор темы, быстрый поиск примеров, «оцени мой текущий экран и скажи что улучшить», и даже «поищи идеи в чужих категориях». Последнее, кстати, мощная штука: делаешь фитнес-приложение — а тебе показывают, как фокус визуализируют в Headspace или как стрик сделан в Duolingo. Иногда лучшая идея приходит из соседнего огорода.

Способ второй, агентный — для тех, кому нужен результат, а не процесс. Просто ставишь задачу: «спроектируй этот экран, сначала найди референсы в LazyWeb, сделай 3-5 вариантов». И агент сам ищет, сам фильтрует, сам собирает. Я живу в основном так.

Чтобы агент не тупил (а он любит схватить первый попавшийся референс и скопировать один-в-один), я собрал готовый промт — вставляешь его, и нейронка начинает искать и выбирать по уму. Плюс короткая памятка, как отличить нормальный референс от старья. Упаковал всё в один PDF.

Где это НЕ нужно

Чтобы не выглядело рекламой. Не бери LazyWeb, если:

  • У тебя сильный уникальный бренд, где задача — как раз НЕ быть похожим на других

  • Делаешь узкую нишевую штуку под не-западный рынок — база собьёт с толку

  • Работаешь без интернета — сервер удалённый, без сети он труп

А во всех остальных случаях — а это большинство обычных экранов — оно экономит реально дни.

Disclaimer

Да, звучит как реклама. Но давай по чесноку:

  • LazyWeb — не моё, я к нему отношения не имею

  • Он реально бесплатный, без подписок и логина

  • Косяки я не скрыл, а вынес отдельным разделом

Не веришь — поставь и проверь сам. Я свечку не держал, говорю по своему опыту.

PDF с промтом и чек-листом лежит у меня в телеге: https://t.me/maslennikovigor — забирай бесплатно, без «оставьте почту». Если уже гонял LazyWeb или Mobbin — кинь в личку @maslennikovig, что вышло с качеством референсов, интересно сравнить. А инструменты, которыми я гоняю своих агентов, валяются на гитхабе: https://github.com/maslennikov-ig/claude-code-orchestrator-kit

Если попробуешь подход с «3-5 вариантами» — расскажи, угадал агент с первого раза или выдал ту самую серость.

Показать полностью 1

Купил нейронку помощнее, а работать стало хуже. Неделю грешил на железяку. Зря

Купил нейронку помощнее, а работать стало хуже. Неделю грешил на железяку. Зря

Подключил новую топовую нейронку — а она оказалась хуже старой: медленная, дорогая, бесючая. Полез разбираться и выяснил дичь: у производителя ДВА мануала для двух своих моделей, и советы в них противоположные. Переписал свои запросы по мануалу — железяка заработала как надо. В конце поста — файл с готовыми промптами, забирай.

Короче, история. Я в работе постоянно гоняю AI-агентов — это когда нейронка не просто отвечает на вопросы в чатике, а сама ковыряется в файлах, пишет код, проверяет себя и приносит результат. И вот выходит новая модель, Claude Fable 5. Все пишут: мощь, прорыв, рекорды порваны. Ну я и переключился в первый же день.

И знаешь что? Она меня бесила.

Старая модель (Opus 4.8) делала задачу быстро и по делу. Новая — думала. Долго думала. Очень долго. Я полез в логи: на одну задачу она сожгла 200 тысяч токенов за полтора часа. Токены — это, грубо говоря, валюта, которой платишь за каждое слово, которое нейронка прочитала или написала. То есть новая «умная» модель работала дольше, стоила дороже, а на выходе — то же самое, только с философскими отступлениями. Перепроверяла то, что я ей уже сказал. Строила планы там, где надо было просто взять и сделать.

Неделю я думал, что модель сырая. Ну выпустили рано, бывает, подождём обновлений.

А потом случайно открыл документацию производителя. И выпал.

Одна контора — два мануала. И они противоречат друг другу

Оказывается, у Anthropic (это которые Claude делают) теперь отдельная инструкция по общению с КАЖДОЙ моделью. Не общая «как писать запросы нейросети», а персональная: вот мануал для Opus 4.8, вот мануал для Fable 5. Я прочитал оба подряд. Местами это выглядит как издевательство:

Opus 4.8 (старая):

  • Сама не любит раздавать подзадачи помощникам — надо подталкивать: «делегируй, не стесняйся»

  • Любит порассуждать вместо того, чтобы открыть файл и посмотреть

  • Режим мощности по умолчанию — на максимум

Fable 5 (новая):

  • Раздаёт подзадачи направо и налево — надо, наоборот, сдерживать

  • Если дать ей подробную пошаговую инструкцию — работает ХУЖЕ. Документация прямо пишет: старые наработки «слишком детальные, удаляйте»

  • Режим мощности — средне-высокий, на максимуме начинает страдать перфекционизмом

Прочитай ещё раз второй пункт про Fable. Мои старые промпты — подробные, выверенные, годами шлифованные — новую модель ДУШИЛИ. Это как дать опытному мастеру инструкцию «возьми отвёртку в правую руку, поверни по часовой»: он либо обидится, либо начнёт выполнять буквально и потратит час там, где нужно пять минут.

Я переписал свои запросы по мануалу: убрал пошаговщину, оставил только цель, критерии готовности и границы. И железяка, которая неделю меня бесила, внезапно заработала так, как обещали в рекламе. Быстро, чётко, без философии.

Нет, осадочек остался, конечно. Но виноват был я, а не робот.

Самое смешное из этих мануалов

Пока читал документацию, собрал коллекцию перлов. Это всё реальные официальные рекомендации, не шутки:

«Не показывайте модели счётчик оставшейся памяти». У Fable 5 есть особенность: если она видит, что рабочая память заканчивается, начинает нервничать — комкает работу, предлагает «давайте я подведу итоги и закончим». Лечится двумя способами: спрятать от неё счётчик или написать ей «памяти у тебя полно, работай спокойно». Прятать часы от сотрудника, чтобы не дёргался. Дожили.

Кремовый дизайн. У Opus 4.8 есть любимый стиль: если попросить её сделать сайт и не уточнить дизайн — она нарисует кремовый фон, изящный шрифт с засечками и терракотовые акценты. Всегда. Даже если ты просил панель управления для завода. Причём фразой «не надо кремового» не лечится — она просто выберет другой любимый цвет и будет рисовать его. Помогает только конкретное ТЗ по цветам.

Заблокировала слово «привет». У новой модели строгие фильтры безопасности, и в первые дни они так лютовали, что одному бедолаге заблокировало сессию, в которой было одно слово — «hello!». Фильтр сработал не на сообщение, а на служебную обвязку. Производитель потом извинился: мол, перестарались с настройкой, простите.

«Не просите её объяснить ход рассуждений». Раньше это был классический приём: «объясни, как ты пришла к выводу». На новой модели такая просьба официально считается попыткой выудить внутреннюю кухню — и нейронка отказывается отвечать. У меня эта фраза годами жила в рабочих шаблонах. Пришлось искать по всем файлам и вычищать.

А у конкурентов вообще третий путь

У OpenAI (это которые ChatGPT) всё по-другому — но не так, как ты ждёшь.

Они пошли инженерным путём: вместо «уговаривайте модель текстом» вынесли главные настройки в отдельные крутилки. Сколько думать — крутилка. Насколько подробно отвечать — крутилка. Хочешь, чтобы модель писала короче, — не пишешь ей «будь лаконичнее, умоляю», а буквально ставишь параметр «краткость: высокая». Звучит как мелочь, а на деле — другая философия: у Anthropic ты воспитываешь сотрудника словами, у OpenAI — выставляешь ему настройки в админке.

Но в одном обе конторы сошлись, и это главная новость: обе официально пишут — сменил модель, переписывай запросы заново. Старые не переноси. То, что лечило прошлую модель, калечит новую.

(Отступление для тех, кто верстал сайты в нулевые: помнишь отдельные костыли под IE6, под Оперу, под ранний Файрфокс? Вот. Мы вернулись туда же, только теперь костыли — под нейронки. Я-то думал, что индустрия научилась. Ха.)

Что с этим делать простому человеку

Если ты пользуешься нейронкой раз в неделю через чатик — вообще забей, тебя это всё не касается. Спрашивай как спрашивал.

А вот если гоняешь агентов, пишешь рабочие шаблоны запросов или строишь что-то поверх API — три правила, которые я вынес:

  • Пиши цель, а не процесс. Не «сначала открой файл, потом проверь то, потом это», а «вот результат, который мне нужен, вот как проверить, что он достигнут». Современные модели планируют лучше, чем твоя пошаговая инструкция.

  • Убери капс и угрозы. Все эти «ОБЯЗАТЕЛЬНО!!», «НИКОГДА не делай» — наследие старых тупых моделей. Новые слушаются с первого раза, а от криков начинают перегибать в другую сторону.

  • Новая модель — новые запросы. Не тащи старые шаблоны. Прочитай мануал конкретной модели (да, теперь у каждой свой) и собери заново. Полчаса вложений — недели сэкономленных нервов.

Где я всё равно плююсь

Чтобы не было ощущения, что я тут рекламирую светлое будущее. Новая модель всё ещё медленная — ходы по несколько минут это норма, и к этому надо привыкать. Фильтры безопасности иногда срабатывают на ровном месте. А ещё мне теперь приходится держать ТРИ набора шаблонов: под Opus, под Fable и под ChatGPT. Это решаемо, но бесит. Чувствую себя коллекционером инструкций к утюгам.

И да, минусы прилетят от тех, кто скажет «нечего вообще с этими нейронками возиться». Понимаю. Но они уже возят половину моей рутины, так что выбора особо нет.

Забирай готовое

Я свои переписанные промпты выложил файлом в телеграм-канал: базовый шаблон, надстройки под Fable 5 и Opus 4.8 и заготовки для раздачи задач агентам — бери и адаптируй под себя. Канал: t.me/maslennikovigor, файл прикреплён к последнему посту.

Вопросы и «у меня не так» — в комменты или в телегу @maslennikovig, отвечаю сам.

Показать полностью 1

Гонял 8 нейросетей для работы. Победила та, что вышла год назад — а раскрученные сыпали лажу

Гонял 8 нейросетей для работы. Победила та, что вышла год назад — а раскрученные сыпали лажу

Прогнал восемь языковых моделей на реальных рабочих задачах. Лучшей по соотношению цена/качество снова оказалась та, что вышла ещё год назад (июль 2025). Самые раскрученные новинки на деле выдумывают факты и сыпят иероглифами. Мораль: не ведись на хайп, проверяй сам.


Короче, я чуть не написал глупость.

Сидел, смотрел на свои цифры и почти сделал громкий вывод: «крошечная нейросеть обошла по качеству старшую от того же разработчика». Звучит же красиво — маленькая бьёт большую, размер не главное, все дела. Я уже почти панамку надел и собрался хвастаться.

А потом притормозил. Что-то не сходится. С чего бы младшей модели быть умнее старшей? Полез проверять — и понял, в чём подвох. Я сравнивал баллы из разных тестов, сделанных в разные месяцы. А так нельзя: между замерами у меня и темы менялись, и настроение, и сама методика чуть-чуть. Разброс — пара баллов туда-сюда. И вот на этом шуме я чуть не построил целый «инсайт».

Поэтому сделал по-человечески: взял эти две модели и закинул в один общий прогон. Одна сессия, один судья, одни и те же задачи. А заодно докинул туда ещё парочку — чтоб сравнить всех честно, в одном котле.

И тут понеслось интересное.

Сюрприз сдулся, зато вылез чемпион

Никакого «маленькая обошла большую» в честном прогоне не оказалось. Обе нейросетки шли вровень, разница в пределах погрешности. Скучно, зато честно: маленькая просто быстрее и дешевле, а по качеству — то же самое. Не «обходит». Идёт вровень. Разница в одном слове, а вывод противоположный.

Зато на освободившееся место выехала другая история. В том же котле первое место по соотношению «деньги/качество» снова заняла модель Qwen3-235B. И тут я предлагаю тебе посмотреть на её полное имя — там в конце стоит 2507. Это дата. 25-07. Июль 2025 года.

То есть модели почти год. Для нейросетей это как для телефона лет десять. Я специально полез проверить дату, чтоб не соврать — да, выпустили её 21 июля 2025-го.

И вот что меня реально цепляет. За этот год рынок перетряхнуло несколько раз. Одна контора прыгнула с позорных 57 баллов до 97 — это вообще другая нейросеть стала. Другую я гонял три раза за два месяца. Третью все хвалят как «убийцу всех». А по деньгам первое место как держал этот июльский старичок, так и держит. Я уже год жду, когда же его кто-нибудь подвинет. Никто не может.

Честно? Меня это даже немного напрягает. Со всех сторон орут, что ИИ — это «мыльный пузырь», что прогресс бешеный, модели умнеют каждый месяц. А лучшую по деньгам модель год никто не обходит. Либо прогресс не такой бодрый, как его рисуют. Либо новинки продают тебе красивые баллы, но не реальную выгоду. Я не знаю, что из этого правда, и мне от этого слегка не по себе.

А теперь про раскрученных

Вот тут будет непопулярное мнение, и минусы, наверное, прилетят. Но скажу.

Я не понимаю всеобщего восторга вокруг MiniMax. Про него сейчас трубят из каждого утюга: обзоры, ролики, тесты, где он «всех обходит» и «выглядит лучше всех». На бумаге — да, циферки красивые, стоит рядом с топами.

А я его запускаю на своих задачах — и он мне на голубом глазу выдумывает «венчурного капиталиста Джеффа Безоса». Я перечитал дважды. Безос, на минуточку, основатель Amazon, а не венчурный инвестор. Дальше — больше: несуществующий фреймворк «Toyota TECS», выдуманный автор методики, точные циферки по компаниям, взятые из воздуха. Выглядит гладко, читается уверенно — и всё это враньё, которое в работе спокойно уедет клиенту. Худший вид брака: тот, что проходит беглый взгляд.

А предыдущая его версия любила вставлять китайские иероглифы прямо в русский текст. Прямо посреди слова. Я сначала подумал — глюк разовый. Нет, ловлю регулярно.

Знаешь, это часто называют «эффектом айфона»: продукт боготворят даже с косяками. Но к MiniMax это, по-честному, не лепится. Айфон в мире нейросетей — это скорее ChatGPT и Claude, к ним реально привязаны, им прощают по любви. А тут не любовь, а раскрутка. Модель, которую громко пиарят и которая «побеждает» в тестах, а на твоей задаче выясняется, что побеждала она на картинке.

И не думай, что дорогущий премиум — это автоматом спасение. Самый свежий флагман Anthropic, Claude Opus 4.8, многие держат за абсолютную вершину. У меня в тесте он сильный, но не первый. И со своей подлянкой: он жадничает на объём. Просишь урок «на 20 минут» — он пишет так плотно, что читается за 12–13. Вроде умно и красиво, но недодаёт. Если гонишь такое потоком, приходится подпирать его костылём, иначе он молча тебя обсчитывает.

Деньги, кстати, кусаются даже у гигантов

Чтоб не думали, что я тут один такой жадный. Microsoft этим летом отбирает у своих инженеров доступ к дорогому AI-инструменту для кода — потому что счёт за токены сожрал годовой бюджет, по 500–2000 баксов на человека в месяц. Uber, по слухам, спалил весь годовой бюджет на AI-кодинг за четыре месяца. Это компании, которым переплатить — не вопрос. И даже они схватились за голову.

А мораль для нас, простых смертных, которые платят свои деньги, ещё проще.

Где я сам облажаюсь, если буду нахваливать без оговорок

Чтоб по-честному — мой «чемпион» Qwen тоже не идеальный, я его не боготворю:

  • Он самый медленный из всех. Где другие управляются за минуту, он молотит почти три.

  • Иногда ломает диаграммы — ставит не те кавычки, и картинка не рисуется.

  • И сам грешит выдуманными цифрами в кейсах — так что фактуру за ним проверять всё равно надо.

Поэтому мы у себя его реально используем, но не везде: в новые проекты не ставим как раз из-за скорости. Берём туда, где нужен максимум выгоды, а подождать не страшно — какие-нибудь фоновые задачи без жёстких сроков. Там он по деньгам незаменим, а его тормоза никому не мешают.

Видишь? Идеальных нет. Есть подходящие под конкретную задачу. В этом весь смысл.

Так что в итоге

Главное, что я вынес из этого прогона — оно даже не про конкретные нейросети. Оно про то, как мы выбираем.

Дата релиза не говорит ничего. Ни «новее — значит лучше», ни «старше — значит отстой». Свежий распиаренный флагман может сыпать иероглифы, а годовалый «старичок» — спокойно держать первое место по деньгам. Громкое имя и место в чужом рейтинге — это просто гипотезы. Проверяются они одним способом: берёшь и гоняешь на своих задачах. Доверять чужому тесту — это как покупать ботинки не примеряя. Я так не советую.

И вот этот тихий чемпион, про которого не снимают восторженных роликов, частенько и сидит внизу таблицы по цене. Просто его надо найти.

Снимаю панамку заранее

Да, я понимаю, как это читается: «мужик в интернете говорит, что разбирается в нейросетях лучше блогеров». Готов к минусам. Но я не прошу верить на слово — все цифры, цены и скорости по каждой модели лежат в открытом виде на лидерборде, ссылку дам ниже. Зайди, потыкай, не сойдись со мной во мнении — нормально.

Полный технический разбор со всеми таблицами — на Хабре. А живой лидерборд, который я обновляю по мере новых тестов, и сами цифры — в Telegram-канале: https://t.me/maslennikovigor. Если захочешь поспорить или поделиться своими замерами — пиши в личку @maslennikovig, я за здоровый срач по делу.

Кто сам ловил у нейросетей китайские иероглифы или выдуманные «факты» — расскажите в комментах, интересно, это только у меня так или общая беда.

Показать полностью 1

Самый популярный гайд по AI-кодингу собрал 56к звёзд. А создатель признался, что ключевую штуку там выбрали «по ощущениям»

Самый популярный гайд по AI-кодингу собрал 56к звёзд. А создатель признался, что ключевую штуку там выбрали «по ощущениям»

Есть на гитхабе мега-популярный гайд по Claude Code (это нейронка, которая пишет код в терминале) — 56 тысяч звёзд. Внутри — советы в том числе от самого создателя инструмента. И вот один из этих советов спорит с тем, что я каждый день делаю на работе. Полез разбираться, кто из нас дурак. По дороге выяснил, что важное архитектурное решение в Claude Code приняли не по тестам, а «потому что так ощущалось лучше». И, кажется, это норма.


Короче. Я каждый день работаю с этими AI-кодерами — Claude Code, Codex, вот это всё. Это не чат-бот в браузере, а штука, которая живёт прямо в терминале и реально пишет код: лазает по файлам, чинит баги, гоняет тесты. Часть моей работы — заставить эту ораву делать дело, а не имитировать.

И вот мне скидывают ссылку на гитхаб. Гайд по Claude Code. 56 тысяч звёзд, первое место в трендах, автор — парень из Пакистана. Внутри аккуратно разложено всё: как настраивать, как давать задачи, 83 совета, 13 разных «методологий». Часть советов — прямые цитаты Бориса Черни, человека, который Claude Code и сделал.

Первая мысль была не самая благородная: «блин, я же про это весь год пишу по кусочкам, а парень собрал всё в одну кучу и поднял 56 тысяч звёзд». Позавидовал, чё уж там. Потом отпустило. Потому что карта — это не территория. На карте написано, где что лежит. А ходил по этим местам я.

Сначала про то, над чем я ржал

Залезаю внутрь, читаю. И натыкаюсь на историю, после которой зауважал этих ребят сильнее, чем за все 83 совета.

Claude Code не хранит твой код в «умной базе для поиска по смыслу» (это называется RAG, если по-умному). Он тупо ищет по словам — как Ctrl+F, только на стероидах. И я полез смотреть: почему так? Это же вроде каменный век.

А создатель, Борис Черни, на одном подкасте честно рассказывает: в ранних версиях Claude Code как раз и была эта умная база. Попробовали по-настоящему. А потом выкинули — потому что тупой поиск по словам «обошёл всё, и это было неожиданно». И дальше дословно: оценивали мы это «в основном по ощущениям. По внутренним vibes. Просто ощущалось лучше».

Вдумайся. Инструмент, на котором сейчас пол-индустрии пишет код. За ним — одна из крупнейших AI-компаний мира. У них исследования по безопасности ИИ, отчёты на сорок страниц. А ключевую штуку — как искать по твоему коду — выбрали потому, что «нам так зашло».

Я перечитал дважды. Не показалось.

И знаешь, я не знаю, ржать или снимать шляпу. С одной стороны — несолидно для конторы такого размера. С другой — а кто из нас делает иначе? Я свои решения по этим агентам ровно так же половину времени принимаю: попробовал, вроде норм, оставил. Просто за мной не стоит 56 тысяч звёзд, поэтому мне можно.

А теперь про то, где мы с гайдом не сошлись

Тот самый совет, из-за которого я вообще полез копать: гайд говорит — забей на умную индексацию кода, поиск по словам решает всё.

А у меня прямо сейчас на всех проектах внедряется штука под названием Graphify. Это не «поиск по смыслу», это карта твоего кода: что где объявлено, что куда зовётся, кто на кого ссылается. И она работает. Быстро, точно, жрёт меньше токенов (токены — это то, за что ты платишь нейронке; чем меньше, тем дешевле).

И вот вопрос на миллион: кто дурак? Я, который пихает индекс везде, или гайд на 56к звёзд, за которым стоит Anthropic?

Не люблю верить на слово, даже когда вывод мне приятен. Полез в реальные замеры. Их немного, но они есть — есть даже исследование с честным названием «Is Grep All You Need?» («А поиск по словам — это всё, что тебе нужно?»). И вот что вылезло.

Поиск по словам и правда часто точнее «умного». Логика простая: функция createHttpClient либо есть в файле, либо нет. А «умный» поиск тащит тебе всё «близкое по смыслу» — и для кода это обычно мусор, а не помощь. Плюс он не устаревает: код поменялся — поиск сразу видит. А умную базу надо постоянно пересчитывать.

Звучит как «я проиграл, гайд прав». Но нет.

Потому что Graphify — это вообще не та «умная база», которую выкинули в Anthropic. Они выкинули поиск по смыслу. А карта связей кода — это другое животное. Она даёт ту самую точность, за которую все хвалят поиск по словам, и при этом чинит его единственную реальную проблему — расход токенов.

И тут я должен поправить сам себя. Я уже было записал свою карту в «третий вариант». Нет. Замеры говорят проще: побеждает не «или-или», а гибрид. Берёшь поиск по словам, добавляешь карту структуры — и вот это бьёт и тупой поиск, и умный по отдельности. То есть «выкиньте умную базу» и «я внедряю Graphify» — это не спор. Это две половинки одной и той же штуки, просто я и гайд смотрим с разных концов.

Согласен ли я полностью? Процентов на семьдесят. Мне всё ещё не хватает цифр на моих собственных задачах — не чужих бенчмарков, а своих. Поэтому окончательный вердикт вынесу, когда сам всё прогоню и посчитаю. Как обычно.

Главная мысль, ради которой всё это

Знаешь, что меня в этом гайде зацепило сильнее всего? Не советы. А то, что любой такой гайд по определению — это сборник опыта, которого ни у кого толком ещё нет.

Смотри. Всем этим нейронкам-кодерам — от силы год-два. Они обновляются каждые несколько недель, и поведение меняется от версии к версии. В таком мире «лучшая практика» живёт месяца три. Потом половина советов протухает: фича переехала, подешевела или просто исчезла.

Это не наезд на автора гайда — он молодец, собрал отличную карту. Это про сам момент. И вывод из него один: в области, где чужой опыт устаревает за квартал, дороже всего стоят твои собственные эксперименты и нормальное человеческое обсуждение. Ради второго я, в общем, и пишу.

Честно: где я сам недотянул

Не буду делать вид, что во всём разобрался.

Свой вердикт по спору про поиск я вынес наполовину — по логике и чужим замерам, а не по своим цифрам. Это не то же самое, что «проверил руками». Так что если ты гонял поиск по словам против индекса на реальном большом проекте и считал токены — напиши, мне правда интересно сверить.

И ещё одна штука, которая меня лично бесит. У Claude Code огромное «окно памяти» — миллион токенов (это сколько текста модель держит в голове за раз). Звучит как подарок. На деле это гемор: за этим окном надо следить руками, потому что нейронка тупеет задолго до того, как его заполнит — где-то на 40%. А у Codex и ChatGPT окно меньше, зато оно само себя поджимает, и ты вообще не думаешь об этом. Вот тебе и «больше — лучше».

Что я с этого сделал для тебя

Раз уж я весь этот гайд перелопатил — собрал по нему навигатор на русском. Не перевод (на Пикабу английский все и так читают), а сортировку по реальной пользе: что ставить сегодня, что на любителя, что переоценено, а что вообще мимо (тот же разрекламированный режим песочницы я, например, так и не попробовал — мне проще иначе). Бесплатно, PDF, без регистрации и смс. Лежит в телеге.

Дисклеймер

Да, в конце я даю ссылку на свой канал — значит, можно крикнуть «реклама!». Крикнуть можно. Но навигатор бесплатный, гайд чужой и тоже бесплатный, а ничего платного я тут не продаю. Так что это скорее «зашёл сам — поделился с тобой».

Готов снять панамку, если по спору про поиск я где-то перегнул — для того и выкладываю, чтобы спорили.


Сам гайд легко гуглится по «claude-code-best-practice». Мой навигатор по нему и заметки про эту кухню — в телеге: t.me/maslennikovigor. Поспорить или скинуть свои замеры — туда же в личку: @maslennikovig. А мои инструменты для всей этой оркестрации лежат на гитхабе, бесплатно.

Если сам гонял индекс против grep на большом репо — очень жду твои цифры в комментах. Серьёзно, это полезнее любого гайда.

Показать полностью 1

Твой AI-кодер ищет код как идиот: читает 20 файлов ради одной функции. Чиню за выходные

Твой AI-кодер ищет код как идиот: читает 20 файлов ради одной функции. Чиню за выходные

AI-помощник для кода (Cursor, Codex, Claude Code) при поиске по проекту тупо читает кучу файлов подряд — жрёт токены пачками и всё равно мажет. Лечится «графом кода»: это как оглавление вместо листания всей книги. Разобрал две тулзы — CodeGraph (лёгкий, гоняю сам) и Graphify (тяжёлый, про всё сразу). Обе бесплатные, к обеим отношения не имею.


Короче. Если ты пользуешься AI для кода — Cursor, Codex, Claude Code, неважно — ты наверняка ловил вот это. Даёшь ему задачу попроще: «найди, где тут проверяется логин, и поправь». А он начинает… искать. Открывает один файл целиком. Потом второй. Потом ещё пятнадцать. Перечитывает полпроекта, чтобы понять, что с чем связано.

И вот тут две беды сразу. Первая — он сжигает токены вагонами. На большом проекте один такой поиск — это сотни тысяч токенов только на то, чтобы понять, где вообще лежит ответ. А подписки сейчас и так глючат и режут лимиты так, что плакать хочется. Вторая беда — он ещё и мажет. Прочитал не те файлы, сделал вывод на половине, пошёл чинить не там. И ты сидишь, смотришь на это, и думаешь: ну ты чего, тупой, что ли?

Не тупой. Просто ищет по-дурацки.

Объясняю на пальцах, без задротства

Представь книгу на тыщу страниц. Тебе надо найти слово «авторизация». Можно листать страницу за страницей и читать всё подряд — найдёшь, но к вечеру и с дёргающимся глазом. А можно открыть оглавление (или предметный указатель в конце) и за пять секунд понять, где оно.

Вот AI без всякой подготовки делает первое — листает всю книгу. Каждый раз заново. А «граф кода» — это как раз то самое оглавление. Специальная программа один раз пробегает по всему проекту и строит карту: какие есть функции, какие классы, кто кого вызывает, кто откуда что тащит. И складывает это в маленькую базу.

Дальше AI не перечитывает двадцать файлов. Он спрашивает у карты: «кто вызывает функцию проверить_токен?» — и получает точный ответ мгновенно. Один запрос вместо двадцати чтений. Кто работал с базами данных — это ровно как индекс: можно тупо перебирать миллион строк, а можно построить индекс и доставать за миллисекунды. Идея старая как мир, просто к AI её прикрутили недавно.

Что я гоняю сам — CodeGraph

Я сижу в основном в Codex, и поставил себе штуку под названием CodeGraph. Она ровно про это: строит лёгкую карту кода, целиком у тебя на компе, никуда ничего не отправляет. Поставил, она один раз проиндексировала проект — и дальше AI ходит в карту вместо того, чтобы листать файлы.

Честно расскажу про главную засаду. Поставить — не проблема, пара команд. Проблема была заставить агента реально пользоваться этой картой, а не игнорировать её и по привычке лезть листать файлы. Он, зараза, как студент: ему сказали «есть оглавление», а он всё равно открывал книгу с начала. Пришлось повозиться с настройками и отдельно прописать ему инструкцию: сначала смотри в карту, потом уже всё остальное. Вот после этого заработало как надо.

Стало ли лучше? Субъективно — да, заметно. AI перестал лазить в десяток лишних файлов, отвечает быстрее и точнее. Но честно скажу сразу, чтобы потом не было «а где пруфы»: своих замеров я не делал. По ощущению — кайф, но циферку нарисовать не могу. У авторов в их тестах заявлено что-то вроде −57% токенов и −70% обращений к файлам. Это их цифры на их проектах, я лично не перепроверял. Но по ощущениям порядок похож на правду — когда двадцать чтений схлопываются в один запрос, экономия реально большая.

А есть ещё Graphify — и это про другое

Тут многие путаются, поэтому держи. Есть вторая тулза, Graphify, и на первый взгляд кажется «то же самое». А вот фиг.

CodeGraph — это лёгкий индекс только кода, для скорости. А Graphify строит карту всего проекта: не только код, но и документацию, PDF-ки, картинки, даже видео. То есть он не столько ускоряет AI в ежедневной работе, сколько помогает въехать в проект целиком — особенно если проект чужой или старый, и знание размазано по коду и куче документов. На выходе даёт даже красивую интерактивную картинку-граф, по которой видно, что с чем связано.

Я его пока только собираюсь попробовать, вживую не гонял — врать не буду. По докам разобрался в одной важной штуке: сам код он, как и CodeGraph, разбирает бесплатно, у тебя на компе. Платишь токенами только за документы и картинки — их он скармливает нейросети, чтобы вытащить смысл. И что приятно: если запускать его прямо изнутри своей IDE, отдельный платный ключ не нужен — он берёт модель из твоей же подписки. А если документы тебе не нужны, можно сказать ему «работай только по коду» — и тогда он вообще ничего не тратит, превращаясь по сути в тот же CodeGraph.

Где я знатно облажался — с хранением

Вот тут отдельная история, на которой я набил шишку. Я работаю с нескольких компов и часто с командой. И первая мысль была логичная: раз карта полезная — давай положу её в общее место, в облако или в гит, чтобы у всех была и не пересобирать каждому.

Не делай так. Серьёзно.

У CodeGraph эта карта лежит в файле базы (SQLite), а такие файлы на сетевых дисках и особенно в WSL2 любят залипать в блокировках — у них это даже в известных багах записано. Плюс бинарный файл в гите — это конфликты при каждом коммите и распухшая история. Я потыкался и понял простую вещь: эту карту вообще не надо никуда таскать. Она строится из кода за секунды. Источник правды — это сам код. Каждый у себя на компе один раз сказал «построй» — и всё, дальше она сама обновляется. Синхронизируешь код, а не карту. Никаких блокировок, никакой боли.

А вот у Graphify наоборот — его карта это обычный текстовый файл, и авторы прямо советуют закоммитить его в гит, чтобы команда пользовалась готовым. Потому что построить его дорого (токены же). Логика разная, потому что и тулзы про разное.

Если коротко — кому что

  • CodeGraph — если бесит, что AI жрёт токены и тупит при поиске по коду. Лёгкий, локальный, поставил и забыл. Рабочая лошадка на каждый день.

  • Graphify — если надо въехать в незнакомый или старый проект целиком, со всей документацией, и посмотреть на него «сверху». Инструмент понимания, а не скорости.

И да, мир на этих двух не сошёлся. Есть ещё пачка похожих штук — Gortex (помощнее, тащит сразу кучу репозиториев и 256 языков), Sourcegraph (это уже для больших контор с сотней репозиториев, и он платный), Cognee (а вот это вообще не про поиск кода, а про «долгую память» AI — другая тема). Но если ты только начинаешь — не парься, начни с CodeGraph, его за глаза.

Честно: где это НЕ нужно

Не буду продавать тебе мечту. Если у тебя проект на три файла — забей, никакая индексация не нужна, AI и так всё найдёт мгновенно. Вся эта история начинает иметь смысл, когда проект большой и AI реально тонет в нём. На мелочи ты только время потратишь на настройку.

И вторая честность: я не делал строгих замеров. Всё, что я говорю про «быстрее и точнее» — это мои ощущения на моих проектах. Может, у тебя стек другой и зайдёт хуже. Попробуй на кошке, прежде чем тащить в боевой проект.

А теперь спорное, можете кидать панамку

Мне постоянно пишут: «Да зачем тебе эта индексация, если у тебя подписка дорогая и токенов вагон? Не выпендривайся, пусть AI листает как листал».

Так вот — дело вообще не в токенах. Точнее, не только. Главное — AI с картой находит нужное с первого раза, а не читает двадцать файлов и гадает на половине. Он реже мажет. А значит — я реже за ним переделываю и реже сижу проверяю. Я экономлю своё время и получаю результат лучше. Токены, которые при этом тоже экономятся — приятный бонус, но не главное.

Отказываться от этого, потому что «токенов и так хватает» — это как сказать «у меня сервер мощный, зачем мне индексы в базе». Ну хватает, да. Просто можно сделать быстрее, точнее и дешевле разом. Не вижу ни одной причины этого не делать.

Важно! (а то щас набегут)

Звучит как реклама CodeGraph? Понимаю. Но я к нему вообще никакого отношения не имею — это чужой опенсорс, бесплатный, мне просто зашло. Я тут ничего не продаю и денег с этого не имею. Не веришь — так и не надо, поставь сам да проверь, благо бесплатно.

Ссылки на обе тулзы, готовые промпты, которыми их ставишь (копируешь в своего AI-агента — он сам разворачивает инструмент и прописывает себе правило лезть в карту, а не листать файлы), и до кучи мой маленький setup-skill graphify-project — не вместо стандартного, а в довесок. У самого Graphify уже есть огромный runtime-skill, который сам ставится командой graphify install — он гоняет всю боевую работу. Мой делает другое: помогает один раз правильно установить Graphify в репо без боли, если у тебя нет gcc на машине (внутри fallback на zig-cc), и не даёт агенту втихую сжечь токены через внешний backend. Всё это кидать сюда не буду — Пикабу ссылки не любит, да и забанит ещё. Сложил в свою телегу: t.me/maslennikovigor. Кто реально пробовал Graphify на боевом — напишите в комменты, мне правда интересно, я-то его ещё не гонял. А если хочешь поспорить или спросить — я в личке @maslennikovig, отвечаю сам, не бот.

Показать полностью 1
2

Китайские нейросети уделали американские по цене и качеству. Прогнал 5 штук через свой тест

Китайские нейросети уделали американские по цене и качеству. Прогнал 5 штук через свой тест

Прогнал пять свежих нейросетей через свой тест на генерацию текста по-русски. Google наконец догнал OpenAI по качеству и стоит в 2.5 раза дешевле. А по соотношению цена/качество вообще все верхние места заняли китайцы — DeepSeek, Tencent, Qwen. Плюс честно расскажу, как полгода считал цены с ошибкой в два раза и сам не замечал.


Я уже год гоняю нейросети через свой собственный тест. Не тот, который меряет «кто умнее вообще», а свой, практический: какая модель лучше всех пишет нормальный текст на русском — уроки, методички, бизнес-разборы. Мы на этом реально работаем, генерим контент для клиентов, тысячи запросов в месяц. И каждый лишний цент за запрос превращается в тысячи долларов в месяц. Поэтому выбор модели для нас — это не «вау, новинка», а чистая бухгалтерия.

В этот раз прогнал пять штук: два американских флагмана (GPT-5.5 от OpenAI и Gemini-3.5-flash от Google) и три китайских. И знаешь что? Расклад на рынке поменялся так, что я аж присвистнул.

Сначала про американцев

Раньше картина была простая: топ по качеству держат американцы — OpenAI и Anthropic (это которые Claude). Google вечно плёлся на итерацию позади. В прошлый раз их модель набрала вообще 57 баллов из 100 — это уровень «ну, сойдёт для черновика».

А тут Gemini-3.5-flash взял 97 из 100. Ровно столько же, сколько новейший GPT-5.5. Впервые на моём тесте Google встал ровно рядом с OpenAI. За полтора месяца прыжок с 57 до 97 — это не «доработали», это будто другую модель выкатили.

Но дальше начинается интересное — цена. GPT-5.5 за один запрос берёт примерно $0.23. Gemini за тот же результат — $0.09. В 2.5 раза дешевле. На наших объёмах (10 тысяч запросов в месяц) это $2290 против $898. Разница — почти полторы тысячи баксов в месяц. За одно и то же качество. Ну и зачем мне тогда переплачивать?

А теперь про китайцев, которые всех уделали

Вот тут самое сочное. Если смотреть не на голое качество, а на соотношение цена/качество — верхние места занимают вообще не американцы.

Смотри сам:

  • DeepSeek V4 Pro — качество 87 из 100, цена меньше половины цента за запрос

  • Tencent Hy3 (да, тот самый Tencent, который WeChat и игрушки) — качество 81, а цена вообще $0.0017. Это в 134 раза дешевле GPT-5.5. В СТО ТРИДЦАТЬ ЧЕТЫРЕ раза, я не опечатался

  • Qwen от Alibaba — тоже крепкий середнячок по качеству

То есть американцы держат вершину по чистому качеству — тут не поспоришь, 97 баллов это их территория. Но как только начинаешь считать деньги, оказывается, что лучшие по балансу — китайские. И это, по-моему, отлично. Должна быть конкуренция, должен быть выбор. А то привыкли, что «ну есть OpenAI, ну есть Claude, и всё».

Отдельная история про DeepSeek, который меня и порадовал, и расстроил

DeepSeek V4 Pro я гонял уже третий раз за два месяца. И вот что обидно: качество как стояло на 87-89, так и стоит. Я честно ждал, что модель дозреет, станет умнее. Не стала. На длинном русском тексте она пишет грамотно, но суховато — как методичка, без огонька.

Зато китайцы взяли и уронили цену в 5 с лишним раз. Просто снизили тариф. И вот эта самая модель, которую в апреле я считал «дорогой и не оправдавшей ожиданий», теперь снова в деле — не потому что поумнела, а потому что подешевела. Иногда так тоже бывает: модель та же, а решение по ней — другое. Чисто из-за ценника.

А вот Qwen меня знатно расстроил

На Qwen 3.7 Max у меня были большие надежды. Предыдущая версия, 3.6, была хороша — и по качеству, и, главное, без косяков. А новая взяла и выдала фокус, от которого я схватился за голову.

Она вставляет китайские иероглифы прямо в русский текст. Не в отдельный блок, а прямо в середину слова. Вот реальная цитата из теста:

«Денежная мотивация имеет предел边际ной полезности»

Видишь вот эти закорючки в слове «предельной»? Это китайское слово «marginal», которое модель воткнула прямо в русское слово. Она как бы «думает» по-китайски внутри, и иногда китайский токен прорывается наружу.

И самое обидное — в прошлой версии, 3.6, этого не было. То есть они умеют это чинить, видели у них уже починенным. А в новой версии оно вернулось. При том что Qwen стоит как премиум — в 40 раз дороже того же Tencent. Дорого, и с тараканами. Пас. Будем надеяться, в следующей версии починят.

Теперь про мой собственный косяк. Снимаю панамку

Дальше будет история, за которую мне немножко стыдно, но рассказать надо — потому что она полезная.

Пока я собирал этот тест, полез перепроверить старые цены в своей базе. И обнаружил, что полгода считал стоимость запросов по кривой формуле. Я брал примерную прикидку: мол, столько-то текста на входе, столько-то на выходе, умножаем на тариф. Прикидка была удобная, но неправильная — для русского текста с разметкой, формулами и таблицами она занижала реальную цену на 50–140%.

То есть я полгода рассказывал людям цены, которые были занижены местами в два с лишним раза. И никто не замечал — включая меня. Потому что относительный расклад (кто дешевле, кто дороже) оставался плюс-минус правильным, а вот абсолютные цифры врали.

Спалился случайно: сравнивал новые данные со старыми, и они не сошлись. Полез разбираться — а там вон оно что. Теперь беру реальные цифры расхода напрямую от сервиса, а не прикидываю на глазок. Неприятно было это обнаружить, но публиковать новый тест и молчать про старый косяк — это уже не честный тест, а самолюбование. Так что вот, рассказал.

Непопулярное мнение, готов снять панамку

Раз пошла такая пьянка — выскажу то, за что меня, может, и минуснут.

В 90% случаев вам НЕ нужна самая дорогая модель. Вот это вот «давайте поставим GPT-5 или Claude Opus, чтобы наверняка» — это чаще всего просто слив денег. Для большинства задач (сгенерить текст, ответить в поддержке, разобрать документ) разница между топовой моделью за 23 цента и нормальной за 0.3 цента не видна обычному человеку. Оба текста пройдут как «нормально». А счёт за месяц отличается в сто раз.

Но есть и обратная крайность, тоже дурная: воткнуть самую дешёвую модель, не проверив. И потом удивляться, почему клиенту в текст налезли китайские иероглифы (привет, Qwen) или почему сгенерилась какая-то дичь. Дёшево — не значит хорошо, как и дорого — не значит хорошо.

Правильный путь скучный: берёшь, тестируешь на СВОИХ задачах, считаешь деньги. И почти всегда оптимум оказывается где-то посередине. А посередине сейчас, сюрприз, сидят китайцы.

Где это всё НЕ работает (честно)

Чтобы не выглядело, будто я тут продаю «китайские нейросети — топ»:

  • Мой тест — про длинный текст на русском. Если тебе нужен код, математика или английский — расклад будет другой, и там американцы скорее всего рулят.

  • Качество я мерю одной моделью-судьёй (Claude). Это не идеально, у любого судьи свои загибы.

  • «Лучше по цене/качеству» не равно «лучше вообще». Если деньги не считаешь и нужен максимум качества — бери американский флагман, тут вопросов нет.

  • Это срез на конкретный месяц. Через два месяца выйдет что-то новое, и таблица снова переедет. Так каждый раз.

Зачем я вообще это рассказываю

Главная мысль простая: рынок нейросетей меняется так быстро, что вчерашний лидер сегодня уже не лидер. И если ты строишь что-то на нейросетях — закладывай возможность легко поменять модель. Не прибивай её гвоздями к коду. Через пару месяцев выйдет что-то лучше и дешевле, и ты захочешь переключиться одной кнопкой, а не переписывать половину проекта.

А ещё — не верь чужим тестам слепо. Включая мой. Прогони на своих задачах сам. Это как ботинки: пока не примеришь, не поймёшь, жмут или нет.


Дисклеймер. Звучит, может, как будто я топлю за китайцев — но нет. Я просто считаю деньги и показываю цифры. Завтра американцы уронят цены или выкатят что-то открытое и бесплатное — расклад поменяется, и я честно напишу про это. Никакой рекламы тут нет, ничего не продаю, просто делюсь тем, что намерил сам.

Полный лидерборд со всеми цифрами держу в своём телеграм-канале — там же выкладываю новые тесты по мере выхода моделей: t.me/maslennikovigor. Если хочешь поспорить или рассказать свой опыт — пиши в личку @maslennikovig, отвечаю.

Если сам гонял нейросети на русском тексте — кидай в комменты, что у тебя выходило. Особенно интересно, ловил ли кто иероглифы у других моделей.

Показать полностью 1
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества