Попросили семь нейросетей написать на вывеске «РЕМОНТ ОБУВИ». Одна выдала «ОУЧНЫЙ КИВЫЙ»
Буквы русские, начертание уверенное, вывеска висит ровно — только таких слов не существует. Так нейросеть Grok выполнила запрос, в котором прямым текстом стояло: на вывеске написать «РЕМОНТ ОБУВИ».
Grok Imagine. Единственная полностью выдуманная вывеска в тесте. Палец на объективе модель добавила сама — к фразе «снято на телефон».
Это один из семи прогонов теста, где проверялось, умеют ли нейросети писать русский текст на картинке. Оказалось, что вопрос стоит по-другому: не «умеют ли», а «сколько знаков подряд удержат».
Сцена для всех была одна и та же: витрина мастерской по ремонту обуви, три надписи разной длины. Вывеска «РЕМОНТ ОБУВИ» — 12 знаков. Ценник «от 500 руб.» — 11 знаков, но мелким шрифтом. Объявление на двери «Открыто с 10:00 до 20:00» — 24 знака, тоже мелко. Один запрос на модель, без вторых попыток, что вышло — то и в зачёт. Проверка посимвольная: совпадает текст на картинке с заданным или нет.
Участвовали семь нейросетей для генерации изображений: GPT Image 2 (генерация картинок в чате GPT от OpenAI), Nano Banana Pro (та самая nano banana, генерация изображений у Gemini), FLUX.2 Max (старшая нейросеть FLUX), Seedream v4 (ByteDance), Qwen 2 (Alibaba), Grok Imagine (картинки у нейросети Grok от xAI) и Ideogram v3 — последний интересен тем, что его продают именно как специалиста по тексту на картинках. Гонялось всё в одном окне, через агрегатор veruna.io, где эти модели лежат рядом, — правда, половина участников открывается только на старших тарифах.
Вывеску из двух слов правильно написали шесть моделей из семи. Провалилась только та, что выдала «ОУЧНЫЙ КИВЫЙ».
Ценник «от 500 руб.» — пять из семи. Seedream v4 потерял букву: получилось «т 500 руб.». FLUX.2 Max продублировал число, написав в две строки «от 500.» и ниже «500 руб.».
Объявление на двери — три из семи. И вот тут ошибки самые обидные, потому что мелкие.
У Qwen 2 «д» превратилась в «а»: на бумажке написано «ао 20:00». Одна буква из двадцати четырёх — а объявление уже читается как опечатка на стекле.
У Ideogram v3 развалилось время: «до 26-80» вместо «до 20:00». Двоеточие стало дефисом, двадцать превратилось в двадцать шесть, нули — в восьмёрку. При этом крупную вывеску та же модель сделала лучше всех в тесте: ровная синяя табличка, ни одного артефакта.
Полный зачёт получили две модели: GPT Image 2 и Nano Banana Pro. У обеих совпали все три надписи, включая двоеточия во времени и точку в сокращении «руб.». Ни та ни другая ничего особенного про работу с текстом не обещает — то есть заявленная специализация Ideogram в этом тесте преимуществом не стала.
Общая картина складывается не в пользу привычного объяснения «нейросети не знают русского». Ни одна модель не написала латиницей вместо кириллицы и ни одна не перевела надпись на английский — с алфавитом проблем нет. Ломается другое: чем длиннее строка и чем мельче она набрана, тем выше шанс, что буква подменится на похожую, цифры перепутаются, символ пропадёт или кусок фразы продублируется.
Практический вывод для тех, кто делает картинки с надписями. Крупный короткий текст — вывеска, заголовок, одно слово на упаковке — модели тянут нормально. Всё, что в кадре выглядит мелким шрифтом, проверять придётся по буквам, потому что издалека кадр выглядит безупречно, а «ао 20:00» видно, только если специально всматриваться. Длинную фразу лучше просить частями, а если текст критичен — сгенерировать картинку по тексту без надписей и поставить буквы сверху в редакторе, где они останутся ровно теми, которые вы напечатали.
Разборы и новости про нейросети — в отдельном канале: t.me/veruna_ai_news


















