Что такое нейросеть, которая рисует
Когда говорят «нейросеть нарисовала картинку», легко представить, будто внутри сидит маленький художник. На деле всё устроено и проще, и удивительнее. Разобравшись, как именно слова превращаются в изображение, вы перестанете воспринимать результат как магию или лотерею — и начнёте им управлять.
Машина не рисует — она угадывает
Нейросеть не водит кистью по холсту слева направо. Она работает наоборот: начинает со случайного шума — мелкой ряби, как на старом телевизоре, — и шаг за шагом убирает из него лишнее, пока в хаосе не проступит картинка, подходящая под ваше описание.


Чтобы так уметь, модель заранее посмотрела на сотни миллионов пар «картинка + подпись». Она не запомнила сами картинки — она уловила связи: как обычно выглядит «закат», чем «акварель» отличается от «фотографии», что у кота четыре лапы, а не пять. Когда вы пишете промт, модель просто собирает изображение, максимально согласованное со всем, что она усвоила про эти слова.
Отсюда два важных следствия, которые объясняют почти все «странности» генерации:
- Нет двух одинаковых результатов. Старт — всегда новый случайный шум, поэтому одно и то же описание каждый раз даёт чуть другую картинку. Это не сбой, а сама природа метода.
- Модель сильна там, где видела много примеров. Котов, пейзажей и портретов в обучении было предостаточно — они выходят отлично. А вот текст на вывеске или ровно пять пальцев модель «видела» противоречиво, поэтому здесь чаще ошибается.
Почему пальцы и буквы — слабое место
Знаменитая проблема «шесть пальцев» — прямое следствие того, что модель мыслит не объектами, а вероятностями пикселей. Она знает, что у руки «примерно столько-то пальцев», но не считает их, как человек. Новые модели справляются всё лучше именно потому, что их учат на более качественных и размеченных данных, — но понимать причину полезно: это подсказывает, чего от инструмента пока не стоит требовать, и где результат нужно проверять.
Опрос
Как часто вы можете отличить картинку нейросети от настоящего фото?
Проголосуйте, чтобы увидеть результаты
Текст, который превращается в картинку
Между вашим предложением и шумом есть переводчик: модель сначала превращает слова в числа — внутреннее представление смысла, — и уже им «направляет» проявление картинки. Поэтому так важна формулировка: для машины «красная машина» и «алое авто на закате» — это два разных набора чисел и два разных пути. Именно здесь начинается мастерство, и именно поэтому отдельная глава про промты — самая важная в руководстве.
Это не заменяет художника — это новый инструмент
Полезно перестать спорить, «настоящее ли это искусство», и увидеть в генерации то, чем она является: инструмент, который убирает технический барьер между замыслом и изображением. Раньше между «я придумал» и «я вижу это перед собой» лежали годы навыка рисования или бюджет на дизайнера. Теперь — одно точное предложение. Навык никуда не делся, он просто сместился: с владения кистью на умение ясно формулировать.
Проверьте сами
Лучший способ почувствовать, как нейросеть проявляет картинку из шума, — попросить её об этом. Опишите что угодно одним предложением и посмотрите, что получится.
Частые вопросы
Как нейросеть рисует картинки?
Почему один и тот же запрос даёт разные картинки?
Почему у людей на картинках бывает шесть пальцев и кривой текст?
Заменяет ли нейросеть художника?
Хотите проверить всё сказанное на практике? В чате Twelver можно сгенерировать первую картинку прямо в переписке — бесплатно после регистрации.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver