Как создать картинку в нейросети: простой гид для новичков

Как превратить текстовое описание в изображение: простые приёмы для промптов, чтобы получать красивые иллюстрации, графику и фото за считаные секунды.

Как это работает, в одном абзаце

Вы пишете описание, и появляется картинка. Под капотом инструмент начинает со случайного визуального шума и раз за разом подталкивает его к тому, что совпадает с вашими словами. Как выглядят слова, он выучил на огромном количестве изображений с подписями.

Одно следствие объясняет почти всё раздражение новичков: модель сопоставляет ваше описание с закономерностями, а не выполняет инструкции, как это сделал бы человек. Если вы напишете «без собаки», слово «собака» всё равно остаётся в промпте, и собака вполне может появиться. Если вы что-то не указали, модель не переспросит: она заполнит пробел самой усреднённой версией этой вещи из всего, что видела.

В этом и весь навык. Говорите конкретно, чего вы хотите, а то, чего не хотите, пишите там, где для этого отведено место.

Формула из шести частей

Почти в каждом хорошем промпте для картинки есть одни и те же шесть вещей. Пропущенные модель заполнит значениями по умолчанию, а именно они и делают изображение безликим.

ЧастьЧто написатьЕсли пропустить
ОбъектКонкретная вещь и те детали, которые важныСамая обобщённая версия этого слова
ОкружениеГде всё происходит и сколько видно вокругПустой или захламлённый фон
СветВремя суток, направление, характерПлоский, ровный, безжизненный
КадрКрупный план или общий, с какого ракурсаСредний план по центру, каждый раз
СтильФотография, масло, 3D-рендер, иллюстрацияГлянцевый цифровой арт
Настроение и цветОщущение и палитраПеренасыщенно и контрастно

Слабый промпт: уютная гостиная.

Сильный промпт: Небольшая гостиная с зажжённым камином и полосатым котом, спящим в потёртом кресле, свет позднего дня из окна на запад, общий план от дверного проёма, реалистичная фотография, 35 мм, тёплые коричневые тона и мягкий янтарный, спокойно и обжито.

Придумать оба стоит примерно одинаковых усилий. Второй, это картинка. Первый, это категория.

Дальше добавьте то, что новички пропускают полностью: список нежелательного. Негатив: текст, водяной знак, лишние пальцы, захламлённый фон, улыбка как на стоковом фото. Почти всё, из-за чего изображение выглядит сгенерированным, сводится к небольшому набору повторяющихся артефактов, и достаточно их назвать, чтобы они ушли.

Приём, который всё упрощает

Писать такие промпты самому необязательно. Попросите текстовую нейросеть написать их за вас.

Напиши промпт для генерации изображения по идее: [ваша сырая идея]. Картинка нужна для [цель]. Структура: объект, окружение, свет, кадр, стиль, цвет и настроение, затем список нежелательного. Дай три версии, которые отличаются кадром, а не прилагательными.

Языковые модели пишут промпты для картинок заметно лучше большинства людей: формат известный, а примеров они видели огромное количество. Поэтому генерировать изображения прямо в чате действительно полезнее, чем в отдельном окошке для картинок: инструмент, который пишет промпт, стоит вплотную к тому, который рисует.

Почему картинка вышла не такой

Короткий диагностический список, который закрывает почти все проблемы новичков.

Скучно и безлико. Вы не задали свет и кадр. Эта пара делает больше, чем любая другая.

Всё нужное на месте, но расставлено не так. Задайте кадр явно: общий план снизу, крупный план, объект в левой трети. Модель понятия не имеет, где вы хотите видеть предметы, пока вы не скажете.

В кадре то, что вы просили не показывать. Упоминание в основном промпте делает его появление более вероятным, а не менее. Перенесите в список нежелательного.

Руки, лица или мелкие повторяющиеся детали получились кривыми. До сих пор самое слабое место везде. Попробуйте более плотный кроп, другой ракурс или вариант, где руки не видны. Иногда достаточно просто перегенерировать.

Текст превратился в абракадабру. Так и ожидалось. Смотрите следующий раздел.

Похоже на стоковую фотографию. Добавьте репортажный кадр, опишите действие вместо позы и отправьте улыбка в камеру как на стоке в список нежелательного.

Не та форма для места, куда вы её ставите. Сразу просите то соотношение сторон, которое вам действительно нужно. Обрезая квадрат в баннер, вы выбрасываете ту самую композицию, которую заказывали.

Итерации без хождения по кругу

Новички перегенерируют один и тот же промпт в надежде на удачный бросок. Доля случайности неизбежна, но большинство впустую потраченных попыток идёт от того, что меняют несколько вещей сразу.

  • Меняйте по одной вещи за попытку. Свет, или кадр, или стиль. Не всё сразу, иначе вы не поймёте, что помогло.
  • Сначала композиция, потом детали. Выставить кадр и свет в первую очередь намного эффективнее, чем доводить до идеала объект, который стоит не в той части кадра.
  • Описывайте то, что получилось удачно. Когда картинка почти попала, скажите об этом словами в следующем промпте, а не рассчитывайте, что инструмент помнит сам.
  • Сохраняйте промпты, которые сработали. Шесть или восемь надёжных заготовок стоят больше любой отдельной картинки, и именно они делают серию изображений похожей на одно целое.

Что нейросети пока не умеют

Текст. Слова внутри изображений остаются ненадёжными везде. Короткое слово иногда выходит, заголовок или логотип обычно нет. Генерируйте картинку чистой, а текст добавляйте в любом графическом редакторе: заодно получите нужный шрифт.

Точные расстановки. «Ровно три предмета, красный слева», это указание, которое выполняется ненадёжно. Если расстановка важна, сгенерируйте элементы по отдельности и соберите композицию сами.

Один и тот же персонаж дважды. Получить одинакового человека или товар в целой серии сложно. Подробные повторяющиеся описания помогают, но идентичный результат никто не гарантирует.

Точная правка реальной фотографии. Фон, свет и стиль модель меняет хорошо. Надёжно сдвинуть предмет на пять сантиметров влево она не может.

И про использование результата: проверьте правила до того, как что-то сгенерированное уйдёт в коммерческий проект. Особенно осторожно с изображениями, похожими на реального человека, узнаваемое место или узнаваемый стиль живущего художника. Условия у разных инструментов различаются, а ответственность лежит на том, кто публикует изображение.

Чек-лист
  • Включайте все шесть частей: объект, окружение, свет, кадр, стиль, настроение
  • То, чего вы не хотите видеть, пишите в списке нежелательного, а не в основном описании
  • Просите текстовую нейросеть собрать промпт для картинки из вашей сырой идеи
  • Сразу генерируйте в том соотношении сторон, которое вам действительно нужно
  • Меняйте по одной переменной за попытку, чтобы понимать, что именно помогло
  • Текст добавляйте в графическом редакторе, а не в модели для изображений
  • Сохраняйте сработавшие промпты, чтобы изображения выглядели в одном стиле

Частые вопросы

Нужны ли художественные навыки, чтобы генерировать картинки нейросетью?

Нет, но нужны навыки описания, и как раз их новички недооценивают. Разница между разочаровывающей картинкой и хорошей почти целиком в том, насколько конкретно вы описали свет, кадр и стиль. Если подробно описывать сцену вам не даётся, попросите текстовую нейросеть развернуть сырую идею в структурированный промпт: это работает отлично.

Можно ли попросить ИИ придумать идеи для картинок?

Да, и пользы тут больше, чем принято думать. Попросите чат-бота дать пять описательных концепций, а потом превратить понравившуюся в полный структурированный промпт со списком нежелательного. Языковые модели пишут промпты для картинок лучше большинства новичков, поэтому генерация изображений прямо в чате выигрывает у отдельного окошка для картинок.

Почему текст на картинке выглядит как бессмыслица?

Потому что отрисовка текста, это по-настоящему слабое место всех моделей для изображений, и никакой промпт это надёжно не чинит. Короткие отдельные слова иногда выходят, заголовки, логотипы и подписи обычно нет. Генерируйте картинку без текста и добавляйте типографику в любом графическом редакторе: там же можно взять правильный шрифт и поставить его как надо.

Какая нейросеть лучше всех рисует?

Это зависит от сюжета сильнее, чем принято думать. Flux сильнее всего в фотореализме и во всём, что должно выглядеть снятым на камеру. Stable Diffusion даёт больше стилистического контроля и разнообразия для иллюстрации. Быстрее всего решить так: прогнать один и тот же промпт через две модели и сравнить результаты бок о бок, ведь победитель на портретах часто не побеждает на интерьерах.

Нужна ли отдельная подписка для генерации изображений?

Не обязательно. Генерация изображений входит в Whizi начиная с тарифа Pro, вместе с текстовыми моделями, и этого хватает для обычной творческой и контентной работы без второго счёта. Отдельный сервис для картинок всё ещё имеет смысл тем, кто занимается этим профессионально каждый день и хочет очень тонкий контроль над стилем.