9

Различия моделей генерации изображений1

Всем привет!

В малорезультатных попытках освоить различные возможности ИИ в повседневной жизни (читать поиграться с разными моделями в пределах допустимого графической картой) решил посмотреть и сравнить различные модели генераций изображений.

Использовались ПО Invoke (которое позволяет загрузить некоторое количество стартовых моделей) в связке с локальной картой 5070. Делалось 3 запроса:

1) a woman in a garden

2) A steampunk airship battles a giant mechanical kraken above a Victorian-era London. Dramatic perspective, highly detailed, concept art

3) A futuristic cityscape, neon lights, flying cars, concept art

Что именно проверялось:

1)  Скорость генерации изображения

2) Стиль генерации (если не указан явным образом в промпте)

3) Соответствие сгенерированного изображения запрошенному

В итоге после первого промпта получилась следующая таблица. Для остальных двух запросов не стал вписывать скорость, так как в целом пропорции схожие.

Различия моделей генерации изображений

Сами же изображения будут ниже, но сразу же выделю, что абсолютным победителем по всем 3 параметрам проверки оказался Flux.2. То есть, это та самая модель, которая может выдать наиболее близкое к запросу изображение и при этом качество тоже будет на высоте.

Если же нужен более простой стиль (иногда размытый), то Z-Image явно наш друг.

В остальном, другие модели умеют рисовать, но инструкции не всегда соблюдены. Например, нет кракена для запроса номер 2 или же отсутствуют машины в запросе номер 3.

Z-Image Turbo (Q8)

Architecture (RealVisXL5)

Juggernaut XL v9

Deliberate v5

Dreamshaper 8

ReV Animated

FLUX.2 Klein 9B (GGUF Q8)

Искусственный интеллект

6.4K постов12.1K подписчиков

Правила сообщества

ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.


Разрешено:


- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.

- Делиться статьями, понятными большинству аудитории Пикабу.

- Делиться опытом создания моделей машинного обучения.

- Рассказывать, как работает та или иная фиговина в анализе данных.

- Век жить, век учиться.


Запрещено:


I) Невостребованный контент

  I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.

  I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.

  I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.


II) Нетематический контент

  II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.

  II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".

  II.3) Создавать контент, входящий в противоречие с правилами Пикабу.


III) Непотребный контент

  III.1) Эротика, порнография (даже с NSFW).

  III.2) Жесть.


За нарушение I - предупреждение

За нарушение II - предупреждение и перемещение поста в общую ленту

За нарушение III - бан

5
Автор поста оценил этот комментарий
ответный пост

К предыдущему посту были вопросики касательно того, что

1) не используются энкодеры и скорость генерации слишком большая

2) у каждой модели свой стиль и некоторые не умеют, например в аниме.

Специально для @Bottl, проверил настройки и сгенерировал отдельно изображения в стиле аниме. (Промпт: Anime-style portrait of a magical girl with sparkling eyes and flowing hair, set against a starry night sky)

Также установил SD-3 и проверил разницу между скоростями Flux 2 Klein 4B и 9B.

Настройки каждой из моделей в карусели:

Что же у нас получается:

1) энкодеры используются для тех моделей, для которых они существуют (были скачаны из стандартного репозитория

2) изображения генерируются дольше, так как используется 100 шагов очистки

3) 4B вариант модели Flux2 Klein отрабатывает в разы быстрее своего 9В аналога (120-160s против 4585s). Вызвано оно тем, что энкодер для 9В варианта, внезапно, имеет вес больше, чем возможность моей локальной карты (аж 15ГБ).

4) как не странно, чуть ли не все модели смогли в стиль аниме. Претензии только к Juggernaut, но и у него есть свой шарм.

Далее, непосредственно результаты:

ZiT 1 шаг

ZiT 1 шаг

ZiT 100 шагов

ZiT 100 шагов

FLUX.2 Klein 9B

FLUX.2 Klein 9B

FLUX.2 Klein 4B

ReV Animated

ReV Animated

Dreamshaper 8

Dreamshaper 8

Juggernaut XL v9

Juggernaut XL v9

SD3 medium

SD3 medium

Architecture (RealVisXL5)

Architecture (RealVisXL5)

Deliberate v5

Deliberate v5

Показать полностью 20
комментарии (2)

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества