Просьба о помощи
Привет, Пикабу.
Меня заебала одна особенность современных ИИ-систем.
Модель пишет:
— отправил;
— сохранил;
— проверил;
— готово.
Начинаешь проверять — инструмент не вызывался, файл не создан, сообщение не отправлено, результат никто не видел. Модель просто описала действие, а продукт показал это так, будто действие произошло.
Я достаточно долго разбирался с такими разрывами и в итоге собрал небольшой публичный технический гид.
Он предлагает разделять несколько разных вещей:
— модель сказала, что выполнила задачу;
— нужный инструмент был доступен;
— вызов действительно произошёл;
— появилось подтверждение результата;
— состояние сохранилось для следующего запуска.
На GitHub лежат спецификации, схемы, примеры, тесты и валидаторы. Всё можно читать, запускать и ломать.
Теперь я не очень понимаю, куда двигаться дальше, поэтому нужна помощь людей, которые разбираются хотя бы в одном участке.
Можно:
— найти ошибку или противоречие;
— придумать тест, который конструкция не выдержит;
— прогнать сценарий на другой модели;
— попробовать интеграцию с MCP или OpenTelemetry;
— показать уже существующее лучшее решение;
— просто объяснить, где я свернул не туда.
Верить в проект и читать всё целиком не требуется. Достаточно посмотреть один небольшой кусок и сказать по делу.
GitHub: