1

Ответ на пост «Поведение разных моделей при вайбкодинге»

А какой у вас опыт в этом?

Сегодня убил часов 5 на вайб-кодинг одного html-приложения для генерации улучшенных промптов: чтоб по API (гугла и опенроутера) модельки подтягивал, был выбор какую именно юзать, улучшал и тестировал получившиеся промпты.

Тестировал в Канвасе самого Джемини версии 2.5 Про. Что я хочу сказать? Я вообще-то гуманитарий и кроме тэгов <br> и <p> мало что помню в хатэмээле :)

Но за 4 часа насилования близнеца я всё-таки добился от него примерно того, чего и хотел. Но это были пот и слезы. Если он сначала простое делает хорошо, то потом при попытке доработать функционал или добавить новые компоненты - он ПОСТОЯННО что-то ломает из того, что раньше уже было написано, протестировано и работало хорошо!

Токмачешь его мордой в эти косяки а он такой:

Вы правы, приношу свои извинения! В последнем обновлении я допустил серьёзную ошибку, которая сломала генерацию того-то и этого-то. Я всё нашёл и исправил. Бла-бла-бла...

И так по кругу. Еле поборол его косяки. Устал как вагон угля разгрузил, и ушел пить пиво.

Готовый проект не покажу - он еще сыроват и делался под меня. :)

Показать полностью
2

Поведение разных моделей при вайбкодинге

Поведение разных моделей при вайбкодинге

Это стоит обсудить на фоне прошлого того, как Cursor попытался сделать хитрый финт, чтобы собрать кучу денег с подписчиков, но у него не получилось.
По сути, у нас не так-то много качественных вариантов.

Claude Opus 4 — это царь. Но самый дорогой. Есть вариант thinking.

• Он умеет планировать, дебажить и работать над сложными задачами.

• Ему лучше всего давать какую-то комплексную задачу или список задач.

• Стоит сразу указать файлы и папки, с которыми ему предстоит работать + добавить нужное в контекст, хотя в целом он сам неплохо ищет — просто каждый поиск стоит денег.

• Он доведёт список задач до самого конца, попытавшись максимально точно разложить задачу. Идеально — если у него ещё и таск-лист есть.

• При этом он хорошо следует инструкции и редко добавляет отсебятину.

• Контекст — до 200 тыс. токенов.

Claude Sonnet 4 — это рабочая лошадка. Недорого и всё ещё хорошо. Есть вариант thinking.

• Он умеет работать над достаточно сложными задачами, неплохо дебажит, хотя иногда не может найти первопричину.

• К нему применимы все те же советы, что и к Opus. Он также старается довести дело до конца. Просто немного поглупее. Однако это можно считать базовой моделью для любой разработки.

• Также достаточно редко добавляет отсебятину. Любит тестировать результат и очень любит создавать отчёты-гайды.

• Контекст — до 200 тыс. токенов.

GPT-o3 / o3 pro — снайпер. o3 — стал на уровне Sonnet по цене, а o3 pro — как Opus. Обе — только thinking.

• Планирует плохо. Превосходно дебажит: если Claude не справляется и ходит кругами — o3 может помочь. Создаёт новые фичи неплохо, но чересчур лаконично.

• Поставишь ему несколько задач — а он часто вместо того, чтобы выполнить их за 1 запрос, делает по 1 запросу на каждую. Это неудобно и дороже.

• Когда не нужно, чтобы модель что-то додумывала — o3 подходит идеально. Она даже рассуждения свои не показывает, только отчёт в конце.

• С её помощью всё ещё можно создавать что-то, хотя и менее эффективно. Она в среднем глупее Claude.

• Контекст — до 200 тыс. токенов.

Gemini 2.5-pro — это стратег. По цене достаточно дешёвый. Только thinking.

• Очень хорошо планирует — с ним можно обсуждать будущий функционал. Из-за того, что он графоманит, получается очень подробный план или классное многостроннее обсуждение. Он старается учесть всё. Но это и его недостаток.

• Он плохо находит реальные баги и во многих местах пытается лишний раз перестраховаться.

• При создании фичей постоянно додумывает и создаёт лишний код, который его не просили.

• Считаю его не очень эффективной моделью для написания кода, но для планирования или анализа кодовой базы — очень хорош!

• Контекст — до 1 млн токенов.

Grok-4 code — перспективный новичок. По цене как Sonnet. Thinking-модель.

• Только-только появился, показал себя только чуть лучше остальных только в кодинге 2д/3д игры

• В целом можно использовать как рабочую модель наравне с Sonnet, но на мой взгляд у него меньше системности.

Контекст - 256 тыс токенов

Я не буду говорить про DeepSeek R1/v3.1, GPT-4.1, Codestral и других — они тоже неплохие, но даже до Gemini по качеству не дотягивают. Их можно использовать только в несложных задачах.

Ещё только-только вышла Kimi-2 - вроде бы и опен-сорс, и дешёвый, но пока вокруг него не так много сложенного опыта от коммьюнити.

А какой у вас опыт в этом?

--

Мой тг-канал по ии-стартапам и вайб-коду

Показать полностью
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества