Что такое нейросеть, которая рисуетГенерация изображений нейросетью — большое руководство

Что такое нейросеть, которая рисует

Когда говорят «нейросеть нарисовала картинку», легко представить, будто внутри сидит маленький художник. На деле всё устроено и проще, и удивительнее. Разобравшись, как именно слова превращаются в изображение, вы перестанете воспринимать результат как магию или лотерею — и начнёте им управлять.

Машина не рисует — она угадывает

Нейросеть не водит кистью по холсту слева направо. Она работает наоборот: начинает со случайного шума — мелкой ряби, как на старом телевизоре, — и шаг за шагом убирает из него лишнее, пока в хаосе не проступит картинка, подходящая под ваше описание.

Рыжий кот в скафандре космонавта на фоне Марса, проявившийся из шума
Случайный шум — то, с чего начинает нейросеть
ШумКартинка
Перетащите ползунок: слева — случайный шум, с которого нейросеть начинает, справа — кот-космонавт, который из него «проявился» за несколько шагов.

Чтобы так уметь, модель заранее посмотрела на сотни миллионов пар «картинка + подпись». Она не запомнила сами картинки — она уловила связи: как обычно выглядит «закат», чем «акварель» отличается от «фотографии», что у кота четыре лапы, а не пять. Когда вы пишете промт, модель просто собирает изображение, максимально согласованное со всем, что она усвоила про эти слова.

Отсюда два важных следствия, которые объясняют почти все «странности» генерации:

  • Нет двух одинаковых результатов. Старт — всегда новый случайный шум, поэтому одно и то же описание каждый раз даёт чуть другую картинку. Это не сбой, а сама природа метода.
  • Модель сильна там, где видела много примеров. Котов, пейзажей и портретов в обучении было предостаточно — они выходят отлично. А вот текст на вывеске или ровно пять пальцев модель «видела» противоречиво, поэтому здесь чаще ошибается.

Почему пальцы и буквы — слабое место

Знаменитая проблема «шесть пальцев» — прямое следствие того, что модель мыслит не объектами, а вероятностями пикселей. Она знает, что у руки «примерно столько-то пальцев», но не считает их, как человек. Новые модели справляются всё лучше именно потому, что их учат на более качественных и размеченных данных, — но понимать причину полезно: это подсказывает, чего от инструмента пока не стоит требовать, и где результат нужно проверять.

Опрос

Как часто вы можете отличить картинку нейросети от настоящего фото?

Проголосуйте, чтобы увидеть результаты

Текст, который превращается в картинку

Между вашим предложением и шумом есть переводчик: модель сначала превращает слова в числа — внутреннее представление смысла, — и уже им «направляет» проявление картинки. Поэтому так важна формулировка: для машины «красная машина» и «алое авто на закате» — это два разных набора чисел и два разных пути. Именно здесь начинается мастерство, и именно поэтому отдельная глава про промты — самая важная в руководстве.

Это не заменяет художника — это новый инструмент

Полезно перестать спорить, «настоящее ли это искусство», и увидеть в генерации то, чем она является: инструмент, который убирает технический барьер между замыслом и изображением. Раньше между «я придумал» и «я вижу это перед собой» лежали годы навыка рисования или бюджет на дизайнера. Теперь — одно точное предложение. Навык никуда не делся, он просто сместился: с владения кистью на умение ясно формулировать.

Проверьте сами

Лучший способ почувствовать, как нейросеть проявляет картинку из шума, — попросить её об этом. Опишите что угодно одним предложением и посмотрите, что получится.

Загрузка…

Частые вопросы

Как нейросеть рисует картинки?
Она не водит кистью, а работает наоборот: начинает со случайного шума и шаг за шагом убирает лишнее, пока в хаосе не проступит картинка под ваше описание. Модель заранее посмотрела сотни миллионов пар «картинка + подпись» и уловила связи между словами и изображениями.
Почему один и тот же запрос даёт разные картинки?
Старт — всегда новый случайный шум, поэтому одно и то же описание каждый раз даёт чуть другую картинку. Это не сбой, а сама природа метода.
Почему у людей на картинках бывает шесть пальцев и кривой текст?
Модель мыслит не объектами, а вероятностями пикселей: она знает, что у руки «примерно столько-то пальцев», но не считает их. Текст и пальцы она «видела» противоречиво, поэтому здесь чаще ошибается — новые модели справляются лучше за счёт более качественных данных.
Заменяет ли нейросеть художника?
Это новый инструмент, который убирает технический барьер между замыслом и изображением. Навык не исчез, а сместился — с владения кистью на умение ясно формулировать; именно поэтому так важна глава про промты.

Хотите проверить всё сказанное на практике? В чате Twelver можно сгенерировать первую картинку прямо в переписке — бесплатно после регистрации.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт