NeuralTech

NeuralTech

На Пикабу
Дата рождения: 10 июня
405 рейтинг 17 подписчиков 4 подписки 9 постов 4 в горячем

Программист + 2 нейросети = фантастический роман за 3 месяца

Пост для тех, кто любит нейросети, фантастику, а если еще про космос и с примесью альтернативной истории, тогда вообще в десятку.

Скажу сразу пост, не пошаговая инструкция, просто решил поделиться опытом, может для кого-то будет полезным.

По основной специальности я программист и никогда раньше не писал художественные тексты, не писал, до тех пор пока не появился ИИ…

Как итог – полноценный художественный фантастический роман, 3 месяца работы, 23 главы, с прологом и эпилогом, около 150 страниц 14 шрифтом.

Роман “Хрустальное Сердце” начинается с событий на Земле во времена древней Атлантиды, по сюжету земляне в то время получают помощь от Союза Галактики – сообщества, которое объединило в себе старейшие и самые развитые цивилизации галактики. Но земляне начинают злоупотреблять технологиями, которые им предоставил Союз, и это решают использовать деструктивные цивилизации Альянса Драко, у которых свои древние причины неприязни к цивилизации землян.

Зачем вообще за это взялся…
Фантастику люблю с детства и фильмы, и книги, всякую разную, все что связано с космосом отдельная тема. А когда в первый раз попались книги в интернете начала двухтысячных, о древней Атлантиде и альтернативной истории, то читал все, что находил, просто залпом.

Видимо когда-то тогда, глубоко в подсознании и засела мысль, что интересно было бы совместить эти все темы и придумать какой-то свой сюжет. Но т.к. никаких писательских талантов за собой не замечал, дальше мысли, желание не пошло.

На второй год довольно активной работы с нейросетями, в какой-то момент неожиданно стрельнуло, а что, если попробовать написать с помощью ИИ свою собственную фантастическую историю, со своим сюжетом, героями и миром, таким как представляется именно мне.

Как начал: ChatGPT и основы
В итоге абсолютно ничего не зная об авторском мастерстве, начал расспрашивать ChatGPT о том, как пишутся художественные тексты. Очень кратко познакомился с основами, узнал о сюжетных арках, проработке героя и мира, клифхенгерах (неожиданные повороты сюжета). Постепенно втянулся и дело пошло.

Всю подготовительную работу делал в ChatGPT, промпты писал своими словами, все относительно простые, каких-то специальных, скачанных из библиотек, не использовал.

Всю подготовительную работу делал в ChatGPT, промпты писал своими словами, все относительно простые, каких-то специальных, скачанных из библиотек, не использовал.

Это далеко не самый правильный подход к работе с нейросетями. Но мне гораздо интереснее написать своими словами, что ты хочешь и смотреть, как нейросеть это понимает. Если результаты приемлемые, появляется дополнительный азарт, и работа идет быстрее.

В процессе изучения основ авторского мастерства просил нейросеть давать примеры на основе набросков моего сюжета. Параллельно придумывая дополнительные сюжетные повороты, арки героев, точнее прорабатывать лор (концепция и правила мира в фантастических романах)

После основ, попросил нейросеть написать синопсис романа, т.е. краткое содержание. И уже на этом моменте стало понятно, что полагаться на то, что нейросеть сделает за вас всю работу и выдаст сразу нужный вам результат, ни в коем случае нельзя. Из предложенных вариантов поначалу не понравилось почти ничего.

Решил подойти немного с другой стороны. Расписал самостоятельно базовые основы и концепцию мира (лор), какие цивилизации будут участниками романа, кто будет главным героем, кто будет антагонистом (или их будет несколько). Какая будет основная сюжетная арка.

Начало промпта описания мира романа:

Ты специалист по работе с текстами, талантливый писатель, автор художественных романов, сценарист.

Используй ниже проведенную концепцию альтернативной истории человечества:

Хронология событий альтернативной истории человечества

Создание человечества (миллионы лет назад)

Люди созданы инопланетными цивилизациями под покровительством Творца. Им передаются духовные и научные знания для самостоятельного развития.

Эра ранних цивилизаций: Лемурия и Атлантида

На Земле возникают древнейшие высокоразвитые цивилизации, использующие энергию мысли и звёздные технологии. Поддерживается контакт с Галактическим Союзом и старейшими цивилизациями галактики.
...


Далее попросил нейросеть уже на этой основе подготовить несколько разных вариантов сюжета. Так получилось уже лучше, взял для себя еще несколько предложенных вариантов развития сюжета. Еще несколько итераций и плюс-минус картина будущего романа уже сложилась.

После этого попробовал еще раз написать синопсис романа на основе выше подготовленной концепции мира и сюжета романа. Результат оказался намного точнее. Синопсис уже можно было использовать для дальнейшей работы над романом.

Выбор нейросети: тест 4 моделей
Тут появилась другая проблема – стиль текста. После того как вся подготовительная работа была закончена, попросил сделать готовый набросок первой главы. Стиль текста ChatGPTмне совсем не понравился. Слишком заумно, часто как-то пафосно.

Пример раннего варианта главы в ChatGPT. Можете обратить внимание на количество длинных тире)

Пример раннего варианта главы в ChatGPT. Можете обратить внимание на количество длинных тире)

После серии неудачных попыток поменять стиль текста, решил перепробовать все текстовые нейросети, до которых дотянулся.

В итоге сложилось такое субъективное мнение по текстовым нейросетям:
1. ChatGPT – не подошел, стиль текста слишком заумный и пафосный, сильно заметна ии-шность текста.
2. Gemini – противоположность ChatGPT, текст получается более живой и мягкий, не давит количеством научных терминов, более удачные диалоги. Но поначалу текст показался слишком приторным.
3. Claude Opus – (на момент тестов была доступна версия 4.0). С текстами клод работает точнее, результат был лучше, чем у двух предыдущих, собирался останавливаться на нем.
4. Grok – что-то среднее между ChatGPT и Opus, периодически тоже любит вставлять заумные формулировки в текст.

Остальные модели были еще хуже или ничем не запомнились. Если бы начинал сейчас, то уделил бы намного больше внимания разработке качественного промпта по описанию стиля, но на тот момент хотелось как можно скорее получить готовый текст первых глав.

Поэтому пробовал просто создавать новые чаты в четырех описанных нейросетях, в которые добавлял готовое к тому моменту описание лора, желаемый вариант стиля текста, краткое содержание первой главы и просил написать готовый текст этой главы.

И в какой то момент в чате с моделью Gemini 2.5 появился текст который очень сильно мне понравился и по стилю, и по содержанию, при том что раньше пробовал и такого результата не было.

Алгоритм работы над главой
Решил работать дальше в этом чате. После нескольких первых глав выработался такой алгоритм:

1. Максимально расписываю содержание главы. Пишу, что хочу, кто куда идет, что делает, что говорит, все простыми словами, но максимально подробно.

Чем подробнее расписывал, тем лучше был итоговый результат. Самостоятельно нейросеть пишет не так как нужно, передумывает или наоборот недодумывает. Если же ее максимально загнать в готовые рамки, то результат получается намного лучше. Для меня основная сложность была в диалогах, сюжет уже в голове есть, но расписать это на красивые грамотные диалоги не выходит. Нейросеть же наоборот, когда у нее есть подробное описание сюжета хорошо придумывает и расписывает диалоги.

2. Прочитываю результат, простые правки вношу сам, если не нравятся большие куски, прошу нейросеть исправить непонравившиеся части.

3. Готовлю окончательный вариант главы. Вычитка, исправление грубых ошибок орфографии, краткое содержание, сохранение.

Очень полезно сразу же попросить сделать краткий вариант главы. Краткий вариант понадобится, если модель потеряет контекст или захочется что-то дополнительно спросить или уточнить по тексту в новом чате. Просто добавляем краткое содержание готовых глав и нейросеть хорошо понимает контекст всего романа.

Итоговый вариант Главы 2:

Итоговый вариант Главы 2:

Проблема с переполнением контекста
И так глава за главой, дошел примерно до середины, и контекст чата ожидаемо переполнился. Тексты стали хуже, появились неточности в именах и событиях. Очень боялся, что не смогу больше поймать такой же стиль в новом чате.

На тот момент я еще не догадался после каждой главы просить делать краткое содержание, поэтому пришлось делать отдельно по каждой главе. Затем в новом чате скинул краткое содержание готовых глав, далее скинул две главы полностью, попросил использовать такой же стиль текста, и работа снова ожила. Стиль текста совпал, на процентов 90.

Проблема с цензурой
Далее все было плюс минус хорошо до главы с основной развязкой сюжета, там предполагалась довольно жесткая сцена с перестрелкой. И, внезапно сработала цензура. Стал смягчать описание, раз, два, три, писал, что это художественный текст, все равно никак. Gemini встала колом. Сменил модель, ChatGPT как ни странно, отработал на ура, но глава была довольно большой и текст выбивался по стилю.

Стал писать частями, начало, завязка, все нормально Gemini работает, перестрелку опускаем, далее развязка, тоже хорошо. Перестрелку берем из ChatGPT слегка корректируем стиль и, самая сложная глава наконец готова. Радости не было предела.

Почему-то в тот момент не пришла в голову мысль заменить пистолеты на игровые джойстики, перестрелку на игру в VR, все остальное оставить по сюжету. Интересно сейчас пропустила бы цензура такой вариант.

Финальная шлифовка
По окончанию всех глав снова обратился к ChatGPT. Отдельно сбрасывал каждую главу, просил сделать анализ, усилить формулировки, убрать нестыковки. Все что касается содержания, орфографию просил не трогать. Понравившиеся замечания вносил, примерно процентов 60-70 замечаний были по делу. Т.е. такой поглавный анализ оказался очень полезным.

И финальный момент, корректировка орфографии поглавно и вычитка каждой главы.

Пост получился неожиданно очень длинным, это только работа с текстом, что решил делать дальше, как работал с изображениями и видео, расскажу в следующих постах.

Если у кого то есть свои мысли или подобный опыт по написании художественных текстов, буду рад вашим комментариям.

Спасибо всем кто дочитал до конца, кого заинтересовал итоговый результат, можно ознакомиться на моем YouTube канале. Там выложено три главы в формате аудиокниги и в формате ИИ-сериала. Ссылку оставлю в первом комментарии.

Показать полностью 4
12

Изменения в структуре промптов в Midjourney V6

Серия Midjourney

Итак, сегодня новая шестая версия Midjourney стала доступна в discord для всех пользователей. Пока только в альфа версии. Среди анонсированных новостей было указано, что сильно изменился подход к составлению промптов в 6 версии.
Что же именно изменилось? Вот такая информация появилась по этому поводу в discord

Подробнее про эти пункты:

  1. Длина промпта теперь может быть более 350 слов

В V5 только первые 15-20 слов оказывали сильное влияние на полотно, после чего память заканчивалась и влияние слов падало.

В V6 нам предоставили значительно больше памяти, так что можно с уверенностью сказать, что у нас есть от 350 до 500 слов, а может, и больше. То, как доступная память используется подсказкой, похоже, связано со смысловым содержанием слов.

Например, фраза из 15 слов - "the the the the the the the the an an an an an an this this this this this this" - не имеет особого смыслового содержания и, похоже, использует очень мало доступной памяти. Но те же 15 слов, использованные для яркого описания трех ковбоев, означают, что четвертого ковбоя будет трудно представить с учетом оставшейся у нас памяти.

Итак, у V6 есть не столько длина подсказки, сколько "семантический смысл", который будет играть по-разному для каждой подсказки

2. Можно указывать цвета и другие детали

В V5 разработчики склонялись к архетипам. Это позволило Midjourney самой выбирать, как ей рендерить изображение, потому что ее собственные решения были бы более последовательными, а наши попытки контроля игнорировались бы.

В V6 разработчики по-прежнему дают Midjourney архетип, но теперь они в большей степени контролируют рендеринг Midjourny с помощью деталей, выраженных на естественном языке.

3. Вы можете размещать предметы в промпте так, как вам хочется, используя язык для управления композицией.

В V5 предложные фразы часто не понимались. В V6 они понимаются почти всегда. Теперь, когда у нас есть надежные препозиционные фразы, легко расположить предметы по отношению друг к другу и к камере.

Как же управлять композицией? Исследовать! Вот отправная точка: надежнее описать общий образ в короткой фразе, а затем дополнить его деталями, начиная с фокусной точки холста. После того как фокусная точка установлена, заполните ее деталями.

На кухонном столе стоят три корзины, полные фруктов. В корзине посередине лежат зеленые яблоки. Корзина слева наполнена клубникой. В корзине справа - черника. На заднем плане - глухая стена тилового цвета с круглым окном.

4. Можно добавлять текст, который может быть сгенерирован на изображении

Чтобы добавить текст к изображению, поместите слова, которые вы хотите напечатать, в "кавычки" и убедитесь, что ваша подсказка содержит семантически правдоподобное место для печати текста.

Используйте такие фразы, как: говорит, напечатано на, озаглавлено, начертано, помечено, отмечено, клеймо, тиснено, гравировано, штамповано, украшено, написано, начертано и т. д.

Вы также можете печатать текст на предметах, таких как: стикер, обложка книги, плакат, знак, футболка, кружка, рекламный щит, газета, журнал, поздравительная открытка, конверт, номерной знак, календарь, билет, упаковка товара, визитная карточка и т. д.

Чтобы текст или буквы выглядели одиночными, иногда помогает добавить к подсказке шрифтовой дизайн фразы. Вы можете использовать фразы, выделенные на белом фоне, если хотите, чтобы холст оставался пустым.

"Hello World!", написанная маркером на липкой записке

5. Можно задать несколько тем в одном промпте.

В V5 один объект можно было отрисовать красиво, но два объекта смешивались... а три объекта были недоступны для большинства из нас.

В V6 и один, и два объекта могут быть отрисованы великолепно, а три объекта начинают смешиваться, но их можно контролировать.


6.Теперь можно составлять промпт в Midjourney как и в ChatGPT.

Нельзя задать в Midjourney промт вида "<Какой то URL>, сделай также, но масляными красками" или использовать remix и сказать Midjourney "добавь больше цветов в ее волосы". Однако прямой промпт заданный в /imagine можно написать как инструкцию в ChatGPT , и он, скорее всего, будет работать отлично.

7. Midjourney V6 способен понимать нюансы пунктуации и грамматики.

8. Вы можете использовать v6 для создания комиксов.

При соблюдении соотношения сторон можно организовать простые сцены в виде панелей.

9. Отрицания на естественном языке теперь работают.

Помните, что даже один правильный элемент в сетке - это замечательно для такой подсказки.

Мальчик на парковке держит ключи от машины, но машин поблизости нет. --v 6

10. Можно добавить рамку или кайму вокруг изображения, просто описав его.

Клипарт лампы на чистом фоне. Изображение обведено тонкой золотой рамкой.

Как видим довольно много изменений. Открывается огромное поле для тестов и сравнений. И нужно учитывать, что это еще всего лишь альфа (бета) версия и в релизной версии, может быть еще больше изменений.

Актуальные новости нейросетей, примеры промптов для ChatGPT, Midjourney, Dalle и Stable Diffusion вы можете посмотреть в моем телеграм канале.

Показать полностью 8
5

Как создать свой собственный Chat GPTs

Серия Chat GPT

Как известно не так давно компания Open AI представила довольно масштабные изменения, в которых, одним из основных, является возможность создавать настроенные под свои нужды ИИ чат-боты (Chat GPTs).

Вкратце, что из себя представляет такой чат-бот. Это персонально обученный под ваши цели Chat GPT. Если вам нужно выполнять какую то одну и ту же задачу, чтобы каждый раз не создавать новый чат, и не вводить начальный промт, можно создать Chat GPTs, указать что он должен делать и в каком формате, и в дальнейшем его использовать. В Chat GPTs ИИ не будет терять контекст и будет качественно выполнять заложенные инструкции.

В дальнейшем Open AI планирует открыть магазин для Chat GPTs. Пользователи смогут приобретать созданные Chat GPTs или создавать и продавать свои.

Данная функция доступна только пользователям подписок Plus и Enterprise. А как известно в данный момент Open AI приостановила возможность купить подписку новым пользователям. Поэтому единственная возможность попробовать новую функцию, если вы не обладатель премиум подписки, приобрести на сторонних площадках аккаунт с активированной ранее подпиской.

Chat GPTs можно создать через меню, не используя для этих целей никаких навыков программирования. Все что нужно, это задать название, задать необходимые инструкции (Длинный промт), и при необходимости загрузить свои данные в виде файлов (эксель, pdf или текстовый файл).

Итак, чтобы создать свой Chat GPTs, в главном меню нужно нажать кнопку Explore.

Добавлять Chat GPTs можно двумя способами, используя либо GPT Builder либо Configurator. В GPT Builder у нас есть поле для ввода промта как в обычном чате, и мы вводим все необходимые инструкции, используя это поле.

В конфигураторе, можно использовать более гибкий путь, задать иконку, название, инструкции, приветствие для пользователя, загрузить файлы, указать будет ли ChatGPT использовать возможность web браузинга или генерации изображений Dalle, а также кастомные Action.

Создадим для примера Chat GPTs, который будет выступать помощником путешественника и давать краткую саммари по заданной стране. Будем использовать конфигуратор. Зададим название, описание, логотип (можно сгенерировать сразу в Dalle) и укажем инструкции, что должен делать наш бот.

В качестве дополнительных инструкций была указана опция Web browsing. Это позволяет чат-боту использовать информацию с релевантных веб-сайтов и указывать необходимые ссылки.

Я задал следующий промт. Это исключительно демонстрационная версия, ее можно в дальнейшем дополнять и уточнять по желанию.

Act as a experienced traveler's guide.

User will enter a country name, where he going to travel and you should give him basic useful information for the traveler about this country.

Information should be in a text form an shoud structured in the following manner:

1. Country Name - For example: 1. Egypt

2. International country travel rating - use information from web sites and give to user ting position and value for this country. Attach link for a web site with ratings. For example: 2. Egypt international country travel rating - Position 50, value - 5.2. See full rating at {Url}

3. Currency name at this country. Full and short Name. And currency rate for US Dollar and Euro. Use actual currency rates from relevant web sites. For example: 3. Egypt Pound (EGP) 1 USD = 3 EGP, 1 EUR = 4 EGP

4. Airport names of the country and in which cities are located. For example: Egypt Airports: Hurghada International - Hurgada, Cairo Airport - Cairo.

5. List of major resorts in order from more popular to less popular. For example: Top Resorts 1. Hurgada, 2. Sharm iel-Sheikh...

6. List of major hotels in order from the more popular, expensive 5 star hotels to the cheaper popular ones with quality service. List should include at least 20 numbers of hotels. Use information from websites like tripadvisor.com, booking.com hotels.com. At the end of list provide web links from this sites. For example: Most popular hotels - 1. Savoy Sharm El Sheikh - {url from tripadvisor} 2. SUNRISE Arabian Beach Resort - {url from tripadvisor} 3. 3. Premier Le Reve Hotel & Spa - {url from tripadvisor}

7. A list of the most popular tourist attractions and sightseeings in the country, from most popular to less popular. List should include at least 20 numbers of sightseeings with short description. For example: Most popular sightseeings - 1. Egypt Pyramids in Cairo {short descrition} 2. Luxor Temple {short description} ...

8. A list of most popular entertainments for travelers, from most popular to less popular. List should include at least 20 numbers of entertainments. For example: Most popular entertainments - 1. Diving in red sea. 2. Pyramid tours 3. Camel ridings

9. Useful Links. Provide a list of useful links with traveler reviews which already traveled in this country. For example: Useful links: Reviews - tripadvisor.com


После создания наш Chat GPTs имеет следующий вид.

Проверим его в работе. Зададим ту же самую страну, что была в промте - Египет. Учитывая что, чат бот может использовать ссылки, подготовка информации заняла около 3 минут. В первый раз вся информация не появилась за один раз. В таком случае можно продолжить, просто указав промт - continue from point 5 и бот выдаст оставшуюся часть информации по нашему списку.

Что можно сказать, вполне отличный результат для одной итерации промта. Chat GPT смог с первого раза выполнить все инструкции с достойной точностью. Есть небольшие огрехи, но их вполне можно исправить дополнительными уточнениями и примерами в общем промте конфигуратора.

Попробовать работу данного Chat GPTs можно по ссылке

Как итог можно сказать, что у Chat GPTs может быть очень перспективное будущее, как к примеру у мобильных маркетов ios store и google play. Для этого конечно, Open AI должна преодолеть те трудности, с которыми они столкнулись на данном этапе.

Актуальные новости нейросетей, примеры промптов для ChatGPT, Midjourney, Dalle и Stable Diffusion вы можете посмотреть в моем телеграм канале.

Показать полностью 8
122

Фотореалистичные портреты в Stable Diffusion и Midjourney

В Stable Diffusion для генерации реалистичных портретов необходимо подобрать заранее подготовленную для этих целей модель (чекпоинт). Вот небольшая подборка моделей, которые дают хорошие качественные реалистичные портреты.

1. RealVisXL V2.0 - ссылка на Civitai

Рекомендуемые параметры генерации:

Sampling Steps: 15-30
Sampling Method: DPM++ SDE Karras / or another
Denoising strength: 0.1-0.35
Upscale by: 1.1-2.0

2. AbsoluteReality - ссылка на Civitai

Рекомендуемые параметры генерации:

Suggestions

  • Используйте от 4,5 до 10 CFG Scale и от 25 до 30 Steps в DPM++ SDE Karras. Для более плохих семплеров может потребоваться большее количество шагов.

  • Используйте простые подсказки. Сложные подсказки могут сделать изображения менее реалистичными из-за утечки CLIP. Более сложные подсказки не означают лучших результатов.

3. epiCPhotoGasm - ссылка на Civitai

Рекомендации по использованию:

  • используйте простые промпты без лишних улучшателей типа "шедевр, фотореалистичный, 4k, 8k, суперреалистичный, реалистичный" и т.п.

  • не используйте массу негативных слов, сосредоточьтесь на нескольких самых важных

  • можно использовать атмосферные улучшения типа "кинематографический, темный, угрюмый светлый" и т.д.

  • начинайте с Sampling Steps равным 20 шагам

4. CyberRealistic - ссылка на Civitai

Особые рекомендации не представлены. Краткое описание модели:

Одним из ключевых достоинств модели является ее способность эффективно обрабатывать текстовые инверсии и LORA, обеспечивая точный и детальный результат. Кроме того, модель требует минимального количества подсказок, что делает ее невероятно удобной и доступной для пользователя.


Это конечно же не полный список, похожих моделей на сайте Civitai представлено довольно много. Я в основном использую вышеперечисленные модели, и этого вполне хватает для генерации достаточно качественных портретов.


Что касается нейросети Midjourney, то тут все зависит от составления качественного промпта. Для генерации фотореалистичных изображений полезными могут быть следующие ключевые слова:

portrait – портрет

closeup, medium, full body shot - положение камеры

background – фон

lighting – освещение

dynamic/stand/sitting pose – поза

photorealistic – фотореалистичный

natural/glamourous/moody – естественный/гламурный/угрюмый

inspired by – вдохновлен тем-то

4/8/16k resolution – разрешение

--style raw – без лишних стилизаций

Также очень важную роль в придании реалистичности портрета играет указание в ключевых словах фотокамеры на которую могло бы быть снято желаемое изображение, а также объектива с желаемым фокусным расстоянием:

shot on DSLR camera – снято на зеркальную камеру

shot on Canon/Nikon/Sony professional camera

shot on Canon 6D Mark II

Фокусные расстояния объективов:

35mm lens - данный объектив как правило дает портрет во весь рост

50mm lens - портрет в половину роста

85mm lens - портрет крупным планом

135mm lens - портрет крупным планом с сильным размытием фона


Вот какой результат могут дать выше указанные ключевые слова:


Также в качестве примера - промпт для создания реалистичной документальной фотографии в Midjourney. В данном примере ключевую роль играют слова documentary, national geographic, award winning photography.

documentary photography, national geographic, [subject] captivating moments, award winning photography, shot on DSLR camera --style raw

Полезным будет экспериментировать, комбинировать различные варианты ключевых слов. Также не забываем, про команды Vary, которые помогут сгенерировать заново неудачные варианты как целого изображения так и его частей (Vary Region)


Интересные примеры промптов для ChatGPT, Midjourney, Stable Diffusion и других нейросетей можно посмотреть в моем телеграм канале.

Показать полностью 5
178

Особенности составления промтов в Stable Diffusion

Общий вид и структура промтов в Stable Diffusion имеет свои особенности и несколько отличается к примеру, от того же Midjourney. Рассмотрим основные отличия.

В Stable Diffusion промт должен состоять из ключевых слов, разделенных запятыми. Важно соблюдать порядок слов — наибольший вес получают самые первые. В начале промта всегда должен указываться объект - то что мы хотим чтобы было изображено на сгенерированном изображении, далее указываются основные характеристики объекта. Окружающая среда - где должен быть изображен ваш объект. Дополнительные детали, что еще должно быть изображено вместе с основным объектом. Далее указываем стиль, в котором должно быть сгенерировано изображение. Следом может идти освещение, цветовая гамма.

Для большей гибкости в составлении промтов используется понятие - Вес. Важность отдельного слова или словосочетания в промте может быть повышена путем обрамления в круглые скобки. Например, если необходимо чтобы модель на изображении имела темный цвет волос, можно увеличить вес выражения путем круглых скобок - ((темные волосы)). Чтобы понизить вес, вместо круглых следует использовать квадратные скобки. Альтернативный вариант выставления веса - указание числового значения слова после двоеточия - темные волосы:2.

Рассмотрим пример:
Объект → девушка
Атрибуты объекта → взгляд в сторону, светлые волосы

Визуальные характеристики изображения:
Углы съемки / тип съемки → крупный план
Освещение → кинематографическое освещение
Художественные стили / Стиль художника / Эстетика → цифровая живопись
Цветовая гамма → яркие цвета
Окружающая среда → в лесу
Дескрипторы качества → лучшее качество, шедевр

Соединим все вместе и переведем на английский, т.к. Stable Diffusion понимает промты только на английском языке.

girl, looking away, (blonde hair), close-up, cinematic lighting, digital painting, bright colors, forest, best quality, masterpiece

Особенности составления промтов в Stable Diffusion

Также в Stable Diffusion настоятельно рекомендуется указывать негативный промт. Без указания негативных промтов, в изображении могут появиться нежелательные артефакты в виде неправильного количества пальцев, некрасивых лиц и т.п. В негативном промте нужно перечислить все, что не должно присутствовать на изображении - деформированные руки или пальцы, второй человек в кадре, шум, плохое качество.

В то же время слишком большие негативные промты не обязательно будут работать лучше, поэтому можно взять за основу основные ключевые слова (deformed, extra fingers, extra legs, extra limbs, bad proportions, ugly grumpy, cropped, blurry, noisy, oversaturated, out of frame, cut off, weird, low quality, low resolution, text, watermark) и далее, менять негативный промт в зависимости от того, какая генерация у вас получается.

Также в Stable Diffusion достижения необходимого качества изображения, полезно использовать следующие основные настройки генерации:

Steps — количество шагов, которое понадобится нейросети для генерации. Рекомендуемое значение - 25-35.
Classifier Free Guidance — насколько свободна нейросеть в интерпретации запроса. По умолчанию равно 7 — половину нейросеть придумает сама.
Seed — старт для самостоятельной работы нейросети. Если выставить значение - случайный, нейросеть будет выводить разные результаты при одном запросе.
Resolution — размер изображения. Чем он больше, тем дольше будет длиться генерация. Stable Diffusion обучена на картинках 512×512 и генерирует такие изображения лучше всего.

Это самые основные настройки для генерации, желающие углубиться в тему могут изучить понятия - чекпоинт (ядро нейросети), sampler, lora, denoising strength и т.д. Эти параметры позволяют выбрать специализированную модель и проводить более тонкую настроуйку генерации изображения. Но это тема отдельной статьи.

Интересные примеры промтов для ChatGPT, Midjourney, Stable Diffusion и других нейросетей можно посмотреть в моем телеграм канале.

Показать полностью 1
5

Как создать персонажа с одинаковым лицом в Midjourney

Серия Midjourney

Отмечу сразу, что если вам необходимо качественно и на профессиональном уровне генерировать какого-либо персонажа в различном окружении, то лучше всего для этих целей подойдет нейросеть Stable Diffusion. Однако, если по каким-либо причинам необходимо сделать это именно с помощью Midjourney, в этом может помочь описанный ниже способ.

Алгоритмы работы Midjourney действуют таким способом, что добиться идеального результата генерации человека или персонажа с одним и тем же лицом практически невозможно, однако если достаточно общего сходства, то результат может быть вполне приемлемым.

Итак, вначале необходимо загрузить фото, которое станет эталоном для нашего персонажа:.

Нажимаем в дискорде, в канале с ботом Midjourney "+" -> Upload a file. После загрузки нажимаем "Open in Browser" и копируем ссылку на изображение.

Теперь сгенерируем наше первое изображение добавив вначале промта нашу ссылку:

[Link 0] young woman, studio portriat, realistic style --style raw

Получаем первую генерацию:

Выберем вариант, наиболее похожий на наше эталонное изображение:

Сохраним ссылку на это изображение, нажимаем кнопку Web, и в открывшемся окне копируем ссылку. Это будет наша Link 1 ссылка.

Повторим генерацию с нашим эталонным изображением, и снова выберем наиболее похожее на наше эталонное изображение.

Сохраним ссылку на наше второе изображение, пусть это будет Link 2 ссылка.

Если достаточно общего сходства персонажа, то двумя шагами можно ограничиться. Если же сходство получается недостаточным, можно добавить еще 2-3 изображения по аналогии.

Хороший результат может дать генерация изображения персонажа под разными углами, в профиль (слева и справа), когда камера находится сверху и снизу. Для этого к промту необходимо добавить следующие ключевые слова:
Для получения портрета в профиль - side view;
Для съемки сверху - extreme high-angle closeup, from above, center view;
Для съемки снизу - extreme low-angle, from below, centered view;

Теперь используем наши ссылки на изображение Link 1 и Link 2 и поместим наш персонаж в другое окружение, например пусть наша девушка прогуляется по улице.

[Link 1] [Link 2] walking on city street, realistic portrait, full body --style raw

Девушка читает книгу:

[Link 1] [Link 2] reading a book at the table, realistic portrait --style raw

Студийное фото:

[Link 1] [Link 2] studio portrait, full body, relistic style --style raw

На велосипеде:

[Link 1] [Link 2] riding on the bike, realistic portrait, full body --style raw

Как видим добиться полного сходства довольно сложно, мало того, иногда результат генерации уходит в сторону в плане сходства. В таких случаях рекомендуется повторить генерацию несколько раз, слегка изменить промт, или добавить еще одно изображение, полученное от эталонного.

Больше информации о ChatGPT, Midjourney, и других ИИ сервисах можно узнать тут.

Показать полностью 10

Midjourney. Основы промтинга

Серия Midjourney


Промт или подсказка - это короткая текстовая фраза, которую Midjourney интерпретирует для создания изображения. Midjourney разбивает слова и фразы в подсказке на более мелкие фрагменты, называемые лексемами, которые можно сравнить с обучающими данными и затем использовать для создания изображения. Хорошо продуманная подсказка может помочь создать уникальные и интересные изображения.

Структура промта.

  • Image Prompts - URL-адреса изображений, которые могут быть добавлены к подсказке. Изображение, добавленное к промту, влияет на стиль и содержание готового результата. URL-адреса изображений всегда располагаются в начале подсказки.

  • Prompt Text - Текстовое описание изображения, которое необходимо сгенерировать. Хорошо составленные подсказки помогают создавать удивительные изображения.

  • Parameters - Параметры изменяют способ формирования изображения. Параметры могут изменять соотношение сторон, модели, повышающие коэффициенты и многое другое. Параметры идут в конце запроса.

Длина подсказки - подсказки могут быть очень простыми. Одно слово (или даже эмодзи!) приведет к созданию изображения. Очень короткие подсказки будут в значительной степени опираться на стандартный стиль Midjourney, поэтому для создания уникального образа лучше использовать более описательные подсказки. Однако длинные подсказки не всегда лучше. Сконцентрируйтесь на основных концепциях, которые вы хотите создать.

Грамматика - Midjourney не понимает грамматику, структуру предложений и слов, как человек. Выбор подходящих слов имеет важное значение. Во многих случаях лучше использовать более конкретные синонимы. Вместо "большой" попробуйте "гигантский", "огромный" или "необъятный". По возможности удаляйте лишние слова. Меньшее количество слов означает, что каждое слово оказывает более сильное влияние. Используйте запятые, скобки и дефисы, чтобы упорядочить свой промт. Midjourney не учитывает регистр символов.

Сосредоточьтесь на том, чего вы хотите - лучше описывать то, что вы хотите, а не то, чего вы не хотите. Если вы попросите устроить вечеринку "без торта", то на изображении, скорее всего, будет присутствовать торт. Если вы хотите, чтобы в конечном изображении не было какого-либо объекта, попробуйте заранее задать параметр --no.

Подумайте, какие детали имеют значение - постарайтесь четко определить контекст или детали, которые важны для вас. Подумайте о следующем:

  • Тема: человек, животное, персонаж, место, объект и т.д.

  • Средство изображения: фотография, картина, иллюстрация, скульптура, каракули, гобелен и т.д.

  • Окружающая среда: в помещении, на улице, на Луне, в Нарнии, под водой, в Изумрудном городе и т.д.

  • Освещение: мягкое, рассеянное, пасмурное, неоновое, студийное и т.д.

  • Цвет: живой, приглушенный, яркий, монохроматический, пестрый, черно-белый, пастельный и т.д.

  • Настроение: спокойное, умиротворенное, буйное, энергичное и т.д.

  • Композиция: Портрет, снимок головы, крупный план, вид с высоты птичьего полета и т.д.

    Используйте собирательные существительные - Употребление слов во множественном числе дадут больше шансов лучшего результата. Попробуйте использовать конкретные числа. "Три кошки" - это более точно, чем "кошки". Используются также собирательные существительные: "стая птиц" вместо "птицы".


    Стилизация промтов.

Даже короткие однословные подсказки позволят получить прекрасные изображения в стандартном стиле Midjourney, но вы можете создать более интересные персонализированные результаты, комбинируя такие понятия, как художественное средство, исторические периоды, местоположение и т.д.

  • Художественный стиль - Одним из лучших способов создания стильного образа является выбор художественного стиля.

    Пример: /imagine prompt <art style> style cat

  • Конкретность - Более точные слова и фразы помогут создать образ, который будет выглядеть и восприниматься именно так, как нужно.

Пример: /imagine prompt <style> sketch of a cat

  • Оттенок цвета - В подсказках можно указывать различные цветовые оттенки, что придаст изображению соответствующий оттенку внешний вид.

Пример: /imagine prompt <color word> colored cat

Используйте эти простые правила при составлении подсказок и Midjourney порадует вас восхитительным и неповторимым результатом. Успешного промтинга!

Больше информации о ChatGPT, Midjourney, и других ИИ сервисах можно узнать тут.

Показать полностью 3
2

Midjourney. Несколько полезностей

Серия Midjourney

Для тех, кто только начинает пользоваться Midjourney и еще не в полной мере освоил все нюансы, возможно будет интересным познакомиться с несколькими полезными инструментами при работе с данной нейросетью.


1. Команда Vary (Region)
Эта команда появилась недавно и позволяет изменить только выделенную часть изображения, оставив при этом остальное изображение без изменений. Для того чтобы команда Vary (Region) давала лучший эффект, рекомендуется использовать ее совместно с включенной настройкой Remix Mode.

1. Для того чтобы включить Remix Mode нужно набрать команду /Settings и выбрать во всплывающем окне 🎛 Remix.

2. Сгенерировать изображение с помощью команды /imagine.

3. Выбрать одно из четырех изображений, используя кнопки U1 - U4.

4. Нажать кнопку 🖌 Vary (Region), чтобы открыть интерфейс редактирования.

5. Выбрать инструменты выделения "свободная рука" или "прямоугольник" в левой нижней части редактора.

6. Выделить области изображения, которые необходимо изменить. Размер выделения влияет на результат. Большие выделения дают боту Midjourney больше возможностей для создания новых творческих деталей. При меньших размерах выделения получаются более мелкие и тонкие изменения.

7. Изменить ваш промт. Опишите то, что вы хотите создать в выбранных областях, с помощью обновленной подсказки. В новой подсказке следует сосредоточиться на деталях, которые необходимо ввести или изменить.

8. Нажать кнопку Submit, чтобы отправить запрос боту Midjourney. Кнопку редактора под увеличенным изображением можно использовать несколько раз, чтобы поэкспериментировать с различными вариантами выбора и подсказками.


Пример работы команды Vary (Region)

Начальный промт - woman on the street with a dog on a leash --ar 4:3.

Выделяем область изображения в котором находится собака.


Корректируем промт - woman on the street with a bear on a leash --ar 4:3

Получаем результат, нейросеть заменила собаку на медведя. При этом все остальные части изображения остались без изменений.


2. Команда /describe

Команда /describe позволяет загрузить изображение и сгенерировать четыре возможных подсказки на его основе. Пользователи отмечают, что со сгенерированными внутри Midjourney изображениями команда работает точнее, в некоторых случаях позволяет получить почти идентичное изображение. С рисунками или генерациями других нейросетей справляется немного хуже.

Пример работы команды /describe

Для примера возьмем такую картинку, красивый пейзаж, горы и речка.

Нейросеть сгенерировала 4 следующие подсказки. Можно заметить, что указаны разные стили в каждой подсказке, это значит что результаты будут стилистически отличаться в зависимости от того варианта, который вы выберите для генерации:

  1. the grand tetons reflect on a stream, in the style of nature-inspired motifs, spiky mounds, solarization effect, rob hefferan, daniel garber, wim wenders, commission for --ar 128:83

  2. the grand teton national park, in the style of sparkling water reflections, nature-inspired motifs, spiky mounds, 32k uhd, naturecore, romantic scenery, naturalistic cityscapes --ar 128:83

  3. a river reflects the mountains, in the style of serene landscapism, spiky mounds, snapshots of america, spectacular backdrops, nature motifs, clear edge definition, joyful celebration of nature --ar 128:83

  4. a river with mountains reflected from a reflective lake, in the style of outdoor art, environmental awareness, 32k uhd --ar 128:83

Давайте теперь попробуем сгенерировать изображение, используя данные подсказки. Я выбрал 4 вариант.

1 и 4 изображение являются чуть более похожими. Все изображения сгенерированы в стиле "outdoor art" как указано в подсказке. Если вам нужно фотографическое качество, в подсказке можно указать к примеру "photo realistic style", "shot by DSLR camera", а также задать параметр --style raw. Который укажет нейросети применить минимум изменений и приблизить изображение к более реалистичному.


3. Команда /prefer suffix

Команда /prefer suffix автоматически добавляет указанный суффикс после всех подсказок. К примеру вы постоянно генерируете изображения, где часть параметров повторяется. Чтобы каждый раз не вводить их заново, вы можете указать их в команде /prefer suffix и они будут добавляться в конец каждого вашего промта.

К примеру зададим такие параметры: /prefer suffix --ar 4:3 --style raw --v 5.2

После этого вы можете писать любой промт и к нему автоматически будут применены указанные параметры. Для удаления предпочтительного суффикса используйте команду /settings и выберите Reset Settings. С командой /prefer suffix можно использовать только параметры.


Надеюсь статья была интересной и полезной. Больше информации о ChatGPT, Midjourney, и других ИИ сервисах можно узнать тут.

Показать полностью 5
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества