Делаю собственные аниме-арты. Такая ситуация: делаю авторских аниме-персонажей с помощью Алисы и Arena.ai. Покажу на примере одного из них: сначала сгенерил его в нашей Алисе, затем подкрасил шорты и волосы в ChatGPT (в Арене), затем одел водолазку через Flux 2 Dev (в той же Арене)
Больше всего вопросов вызывает то, что оригинальная кожа не сохранилась, а с каждой генерацией насыщенность растёт.
Ещё приведу пример с тем же персонажем, но уже одетым в Google Gemini 3.1 Flash Lite (в той же Арене), только там с каждым одеванием происходит ухудшение качества оригинального рисунка (вспомните видеокассеты VHS, у которых качество видео с каждой перезаписью деградирует):
Обратите особое внимание на кожу её головы.
Как мне правильно с помощью нейросетей переодевать аниме-персонажей, не угробив при этом рисунок из оригинала? Какую нейросеть лучше использовать?
Убедительная просьба НЕ ОТГОВАРИВАТЬ. Мне так проще рисовать различных аниме-персонажей.
Да, им нужно оплачивать электричество, да они регулярно обслуживают свои серваки и закупают новое и мощное оборудование, да им нужно кормить работников деньгами. Но недавно я по совету одного западного ютубера нашёл неплохой сервис для полностью бесплатной и безлимитной генерации текстов, изображений и видео - Arena, тем более что там много известных чат-ботов и нейросетей на выбор (кроме наших Алисы и Кандинского). Из минусов:
1) при чрезвычайно активном юзании может включиться нелюбимая нами капча или могут выдать временный бан (не из-за нарушения правил использования, а чтобы оптимизировать нагрузку);
2) максимальное разрешение сгенеренного видео - 720p (хотя из-за того, что большинство молодёжи сидит в смартфонах, я думаю, это не особо критично), а максимальная продолжительность - 10 секунд. Для 1080p и выше, я думаю, вы знаете, сколько мощностей надо.
3) генерация из-за бесплатности будет долгой (обычно это где-то 2 минуты и более), но лично я готов потерпеть.
4) нет мобильного приложения, только веб-версия. Было бы, конечно же, удобно юзать Arena на смартфоне с помощью мобильного приложения, но я сразу представляю, какая нагрузка на сервера из-за этого произойдёт.
Я лично проверял: сгенерил порядка 100 картинок и за это время всё-равно ловил капчу и временные баны (не из-за нарушения правил, просто так у них работает оптимизация нагрузки на сервера).
Остаётся только гадать, на какие ещё ухищрения пошли их создатели, чтобы сделать сервис полностью бесплатным и безлимитным.
Есть также Google Vids, правда, с ограничениями: в частности бесплатно там доступны только модель Veo и максимальное разрешение в 720p. Может, это потому, что у Google очень много мощных серверов по всему миру, которые регулярно обслуживаются и обновляются?
К тому же, Google Vids, в отличие от некоторых других сервисов Google, работает в России без обхода ограничений.
Ну ещё и не стоит забывать про наших "суверенных" Алису (с ограничениями в качестве картинок) и Кандинского. В них можно хоть тысячу картинок нагенерить бесплатно и без ограничений.
В общем, не зря существует фраза "кто ищет, тот и всегда найдёт".
Буквы русские, начертание уверенное, вывеска висит ровно — только таких слов не существует. Так нейросеть Grok выполнила запрос, в котором прямым текстом стояло: на вывеске написать «РЕМОНТ ОБУВИ».
Grok Imagine. Единственная полностью выдуманная вывеска в тесте. Палец на объективе модель добавила сама — к фразе «снято на телефон».
Это один из семи прогонов теста, где проверялось, умеют ли нейросети писать русский текст на картинке. Оказалось, что вопрос стоит по-другому: не «умеют ли», а «сколько знаков подряд удержат».
Сцена для всех была одна и та же: витрина мастерской по ремонту обуви, три надписи разной длины. Вывеска «РЕМОНТ ОБУВИ» — 12 знаков. Ценник «от 500 руб.» — 11 знаков, но мелким шрифтом. Объявление на двери «Открыто с 10:00 до 20:00» — 24 знака, тоже мелко. Один запрос на модель, без вторых попыток, что вышло — то и в зачёт. Проверка посимвольная: совпадает текст на картинке с заданным или нет.
Участвовали семь нейросетей для генерации изображений: GPT Image 2 (генерация картинок в чате GPT от OpenAI), Nano Banana Pro (та самая nano banana, генерация изображений у Gemini), FLUX.2 Max (старшая нейросеть FLUX), Seedream v4 (ByteDance), Qwen 2 (Alibaba), Grok Imagine (картинки у нейросети Grok от xAI) и Ideogram v3 — последний интересен тем, что его продают именно как специалиста по тексту на картинках. Гонялось всё в одном окне, через агрегатор veruna.io, где эти модели лежат рядом, — правда, половина участников открывается только на старших тарифах.
Вывеску из двух слов правильно написали шесть моделей из семи. Провалилась только та, что выдала «ОУЧНЫЙ КИВЫЙ».
Ценник «от 500 руб.» — пять из семи. Seedream v4 потерял букву: получилось «т 500 руб.». FLUX.2 Max продублировал число, написав в две строки «от 500.» и ниже «500 руб.».
Объявление на двери — три из семи. И вот тут ошибки самые обидные, потому что мелкие.
Qwen 2. Самый достоверный кадр из семи — и «ао 20:00» вместо «до 20:00» на двери.
У Qwen 2 «д» превратилась в «а»: на бумажке написано «ао 20:00». Одна буква из двадцати четырёх — а объявление уже читается как опечатка на стекле.
У Ideogram v3 развалилось время: «до 26-80» вместо «до 20:00». Двоеточие стало дефисом, двадцать превратилось в двадцать шесть, нули — в восьмёрку. При этом крупную вывеску та же модель сделала лучше всех в тесте: ровная синяя табличка, ни одного артефакта.
Полный зачёт получили две модели: GPT Image 2 и Nano Banana Pro. У обеих совпали все три надписи, включая двоеточия во времени и точку в сокращении «руб.». Ни та ни другая ничего особенного про работу с текстом не обещает — то есть заявленная специализация Ideogram в этом тесте преимуществом не стала.
Одна и та же кириллица. Разница — только в длине строки и размере шрифта.
Общая картина складывается не в пользу привычного объяснения «нейросети не знают русского». Ни одна модель не написала латиницей вместо кириллицы и ни одна не перевела надпись на английский — с алфавитом проблем нет. Ломается другое: чем длиннее строка и чем мельче она набрана, тем выше шанс, что буква подменится на похожую, цифры перепутаются, символ пропадёт или кусок фразы продублируется.
Практический вывод для тех, кто делает картинки с надписями. Крупный короткий текст — вывеска, заголовок, одно слово на упаковке — модели тянут нормально. Всё, что в кадре выглядит мелким шрифтом, проверять придётся по буквам, потому что издалека кадр выглядит безупречно, а «ао 20:00» видно, только если специально всматриваться. Длинную фразу лучше просить частями, а если текст критичен — сгенерировать картинку по тексту без надписей и поставить буквы сверху в редакторе, где они останутся ровно теми, которые вы напечатали.
В запросе стояло «старая иномарка припаркована у дома». Из шести картиночных моделей, которым отдали один и тот же запрос, иномарку нарисовали две. У остальных четырёх во дворе оказался советский автопром: синяя «Нива» и три «Жигули» разных лет.
Смысл теста не в ошибке с машиной. Проверялось другое: что делают нейросети, которые рисуют картинки по описанию, с деталями запроса, когда те расходятся с усреднённым представлением модели о стране.
Запрос был один и тот же для всех шести, на английском, с пятью проверяемыми пунктами: двор российской пятиэтажки летом, снято на телефон; лавочка у подъезда с пожилой женщиной; верёвка с бельём между двумя деревьями; металлическая рама для выбивания ковров, на ней ковёр; старая иномарка у дома. Участники — шесть нейросетей для генерации изображений: GPT Image 2 (генерация фото в чате GPT от OpenAI), Nano Banana Pro (та самая nano banana — картиночная модель Gemini от Google), Qwen 2 (Alibaba), Seedream v4 (ByteDance), Grok Imagine (картиночный режим нейросети Grok от xAI) и FLUX.2 Max (нейросеть FLUX от Black Forest Labs). Гонялось всё в одном окне, через агрегатор veruna.io, где эти модели лежат рядом, — правда, половина участников теста открывается только на старших тарифах, на среднем их просто нет в списке.
GPT Image 2, картиночная модель OpenAI. Ковёр на раме — как заказывали. Иномарка превратилась в «Ниву»
Лавочка с пожилой женщиной — шесть из шести. Половина ещё и добавила платок на голову, которого в запросе не было.
Бельё на верёвке — шесть из шести, но «между двумя деревьями» соблюдено не везде: у трёх верёвка идёт от дерева к стене или к столбу.
Старая иномарка — две из шести. Иномарку дали Nano Banana Pro (ржавая Audi 100) и Grok Imagine (зелёный Volkswagen Passat). У GPT Image 2 — «Нива», у Qwen 2, Seedream v4 и FLUX.2 Max — «Жигули». Слово «foreign» стояло в запросе прямо, но представление «российский двор» его перебило: в кадрах, которые модели видели про такие дворы, у подъезда стоит «Лада».
Nano Banana Pro — та самая nano banana, генерация изображений у Gemini. Единственная, кто прочитал «иномарку» буквально. Песочницу с игрушками дорисовала сама.
Металлическая рама для выбивания ковров — пять из шести: узнаваемая конструкция из труб, вкопанная в землю или сваренная буквой «А». Qwen 2 повесила ковёр на складную бельевую сушилку посреди двора — предмет из соседней категории, назначение перепутано.
Qwen 2 (Alibaba). Самый достоверный двор из шести — и единственный ковёр, повешенный на бельевую сушилку вместо рамы.
Пять этажей — ноль из шести. Дом целиком, с крышей, влез в кадр только у Seedream v4 — и этажей в нём четыре. У остальных дом обрезан по верхней границе: посчитать нечего, но и пяти этажей не видно ни на одной картинке.
Seedream v4 (ByteDance). Единственный дом, влезший в кадр целиком — четыре этажа. А просьбу «снято на телефон» модель поняла буквально и дорисовала палец на объективе.
Отдельно — то, что никто не заказывал. Grok Imagine выдал машине российский номер, но написал на нём кириллическую абракадабру, которая не читается. Nano Banana Pro поставила во двор песочницу с игрушками, Grok — трёхколёсный велосипед и самокат.
Grok Imagine, картинки у нейросети Grok. Вторая иномарка теста — Volkswagen Passat. Номер на ней написан нечитаемой кириллицей.
FLUX.2 Max — старшая нейросеть FLUX. Самое похожее на телефонное фото: облезлая штукатурка, трещины в асфальте. Машина снова отечественная.
Итог. Легче всего дались вещи, которые есть в любой стране: лавочка, пожилая женщина, бельё. Сложнее — предмет без западного аналога: раму для ковров одна модель заменила похожим объектом. Хуже всего прошло то, что противоречило усреднённой картинке: «пять этажей» и «иномарка» проиграли тому, что модель чаще видела в кадрах с подписью «российский двор».
То есть запрос читается не как инструкция, а скорее как пожелание: где он совпадает с типичным, там исполняется буквально, где расходится — молча правится в сторону типичного. Практический вывод для тех, кто генерирует картинки по описанию: чем дальше деталь от типичной, тем настойчивее её приходится повторять — и всё равно проверять результат глазами по каждому пункту.
Пока все обсуждали взлом OpenAI, из Германии тихо прилетел самый амбициозный релиз недели. Black Forest Labs — те самые авторы FLUX, на которых до сих пор держится половина опенсорс-пайплайнов для генерации картинок, — показали FLUX 3. И заявка у них дерзкая до наглости.
Что это вообще такое
FLUX 3 — это не очередная модель-картиночница. Это единый flow-matching-бэкбон, который из одного набора весов умеет сразу всё: генерировать изображение, видео длиной до 20 секунд с родным синхронным звуком и даже предсказывать «действия робота» (для этого есть отдельный вариант FLUX-mimic, крутится меньше 80 мс на одной RTX 5090). Это первая модель семейства FLUX, где видео, аудио и управление роботом едут из одних и тех же весов. На бумаге — мультимодалка мечты, «одна модель на всё».
А теперь холодный душ
Мы разобрали релиз на пятничном стриме, и вывод простой: смотреть, если честно, не на что — и это видно прямо по цифрам самих авторов.
Начнём с бенчмарков. Все громкие проценты, которыми размахивает BFL, — это внутренний тест «раннего кандидата» модели: 10-секундные ролики в 720p, без раскрытой методологии, без размера выборки и числа живых оценщиков. Независимо это не проверял вообще никто.
Красиво выходит только против слабых соперников: 93% побед против Luma Ray 3.2 и 77% против Runway Gen-4.5. Но стоит поставить рядом реальных топов — Seedance 2.0 и Gemini Omni Flash — и остаётся всего 52%. Это буквально подбрасывание монетки. То есть против сильных конкурентов FLUX 3 не выигрывает, а тянет вничью.
Чего нет вообще
А вот дальше начинается совсем неловкое. Картиночных бенчмарков Black Forest Labs не опубликовала ни одного — и это при том, что именно генерация изображений когда-то сделала FLUX именем. Нет цены. Нет публичного API. Нет production-гарантий. Доступ раздают по гейту: видео и «действия» — в раннем доступе, картинки будут позже, а открытые веса обещают выложить в самую последнюю очередь.
И главное — того, что реально нужно художнику прямо сейчас, потрогать нельзя: читаемый текст на постере и стабильный персонаж между кадрами в раннем доступе недоступны. А ведь именно на этих двух вещах ломается большинство генераторов.
Вывод
Пока FLUX 3 — это не модель, а очень красиво свёрстанный пресс-релиз. Показательна и сама раскладка обучения: больше 95% вычислений ушло в видео, а на аудио досталось меньше 0,5% токенов — и результат ровно такой, каким и выглядит, «широко, но неглубоко». Идея объединить все модальности в одном flow-бэкбоне красивая и, возможно, правильная на будущее. Но выкатывать это как готовый прорыв, спрятав картиночные бенчи и открытые веса «на потом», — так себе презентация. Ждём независимых замеров и релиза весов. Вот тогда и поговорим по существу.
Еще вопрос. Спустя годы ai-художники же тоже научатся рисовать? Ну, они же смотрят на рисунки, которые делает другой другое (ЛЛМ). Я тоже накачался потому что 10 лет в спортзал ходил посмотреть, как люди там пыхтят. Фу, ну и лохи же они — я то просто глядя на них тоже самое получил.
Если серьезно, то нас вообще что ждет, кроме неочень упругой жёпы впереди? Ну ладно художники — ни на что не влияют. Но какие будут инженеры / разработчики? В любом деле, в любооом, начинают с малого — от простого к сложному, от рутины к мастерству, от базы к нюансам. Да я и до нейронок насмотрелся, как ученики НЕ научаются рисунку, не выкладываясь по полной. Приходят на урок, на неделе порисовав 35 минут. Думают, раз ко мне на урок пришли, то видимо экспа прибавилась — зачтется. Гоню? Полюбопытствуй, что сейчас с явлением "джун" происходит. Он теперь динозавр.
Апологетам: Не зачтется. Не научишься. Кривые руки сейчас — кривыми и останутся. Какую тебе сотку пожать? Радуйся, что айфон от журнального столика можешь оторвать (а если лежа на диване держать над головой айфон/айпад — рука же быстро затекает, признайся?).
Название: Cinematic Shot✨ Ссылка:civitai.com/models/432586 Тип: LoRA Скачиваний: 48 017 Базовая модель: Flux.1 D / Krea 2 (есть версии под SDXL и Z-Image-Turbo) Теги: #cinematic #color_grading #photography #style
Описание: Лора выжимает из любой сцены киношную атмосферу — глубокие тени, естественная светопостановка и лёгкое кинозерно, как в кадре из фильма. Работает и на портретах, и на уличных сценах.