Ideogram 4.0: нейросеть, которая пишет читаемый текст на картинкеНейросети по названиям: какая модель что умеет и где её включить

Ideogram 4.0: нейросеть, которая пишет читаемый текст прямо на картинке

Ideogram — модель генерации изображений, которую держат здесь ради одной конкретной вещи. Это единственная подключённая модель, у которой буквы на картинке получаются буквами: вывеска, постер, логотип, обложка с заголовком. Остальные рисуют нечто похожее на текст, и вблизи это всегда видно.

Ниже — сама модель, а не скриншоты. Опишите картинку с надписью: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.

Загрузка…

Что вы сейчас пробуете

Это не демо-режим: запрос уходит в ту же модель, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и картинка переедет туда вместе с вами.

Текст на картинке — то, ради чего её и включают

Надпись пишется прямо в запросе, лучше всего в кавычках: «постер с надписью „Осенняя распродажа“». Модель разместит её в композиции и отрисует так, что её можно прочитать, а не угадать.

Практически это закрывает целый класс задач, где раньше нужен был дизайнер или ручная вёрстка:

  • Постеры и афиши с заголовком
  • Вывески, таблички, указатели
  • Логотипы и текстовые эмблемы
  • Обложки, баннеры, шапки
  • Мемы и открытки с подписью

Длинный текст лучше не запекать в картинку

Одна-две короткие строки — сильная сторона модели. Абзац мелким шрифтом — уже нет: чем больше символов, тем выше шанс опечатки, а исправить букву в готовой картинке нельзя, только перегенерировать.

Надёжный приём для сложной вёрстки: получить у Ideogram фон и элементы, а сам текст поставить настоящим текстом поверх — так его можно править, и он гарантированно без ошибок.

Прозрачный фон — одним запросом

Второе, чего нет у соседей: Ideogram отдаёт картинку с настоящим прозрачным фоном, если просто попросить об этом словами — «стикер, прозрачный фон, без фона». Никакого отдельного режима включать не нужно, на выходе PNG с альфа-каналом.

Это единственный источник настоящих вырезанных объектов в системе, и на нём держится сборка коллажей и постеров слоями: каждый элемент получают отдельной картинкой с прозрачностью, а потом складывают. Так композицию можно двигать и править, в отличие от запечённой одним куском.

Вырезать чужую картинку стоит копейки

Отдельная операция «убрать фон» принимает любое изображение — из другой модели или ваше собственное — и стоит примерно втрое дешевле самой дешёвой генерации. Если объект уже нарисован и нужно только отделить его от фона, перегенерировать его с прозрачностью — заметно дороже, чем вырезать.

Четыре операции и их цена

Здесь, в отличие от остальных моделей книги, платят не за пиксели и не за секунды, а за тип операции, и разброс большой. Порядок цен полезно держать в голове.

ОперацияЧто делаетОтносительная цена
Убрать фонВырезает объект из готовой картинки на прозрачный фонСамая дешёвая — примерно треть от TURBO-генерации
ГенерацияКартинка по описанию, три скорости на выборTURBO — базовая, DEFAULT — вдвое дороже, QUALITY — втрое
РемиксПерерисовать вашу картинку по новому описанию, сохранив структуруТак же, как генерация
Правка словамиИзменить или объединить до десяти изображений по инструкции; ею же расширяют кадрСамая дорогая — больше трёх DEFAULT-генераций
TURBO хватает для подавляющего большинства задач с текстом: разборчивость букв от скорости почти не зависит, в отличие от детализации фона.

Правка словами — не рабочий цикл

Соблазн понятный: получил картинку, попросил «поменяй цвет вывески» — и так десять раз. Но правка здесь стоит дороже трёх обычных генераций, и цикл из десяти правок обходится как тридцать новых картинок.

Дешевле почти всегда одно из двух: перегенерировать на TURBO с уточнённым описанием либо взять ремикс, который сохраняет композицию исходника. Правку приберегите для случая, когда нужно именно объединить несколько ваших изображений.

Расширение кадра и редкие пропорции

Та же правка умеет достраивать края: подаёте картинку, просите другой формат — и модель дорисовывает недостающее, а не растягивает. Список доступных пропорций здесь заметно длиннее, чем при обычной генерации: появляются 4:5 и 5:4, а также вытянутые 2:1, 1:2, 3:1 и 1:3 для баннеров и шапок.

4:5 — формат карточки маркетплейса, и это единственный способ получить его у нас: у генератора Grok такой пропорции нет вовсе, а Seedream и Nano Banana её не предлагают.

15Пропорций при расширении кадраПротив девяти при обычной генерации — включая 4:5, 2:1 и 3:1
До 10Картинок за одну правкуОбъединить несколько своих изображений одной инструкцией
2048×2048Максимум по сторонеНиже, чем 4K у Seedream: Ideogram берут не за разрешение

Чем Ideogram отличается от соседей

ЗадачаКакая модель
Читаемая надпись, вывеска, логотип, постерIdeogram
Прозрачный фон и вырезание объектаIdeogram
Максимальное разрешение и серия картинокSeedream
Сохранить лицо или товар между правкамиNano Banana

Чего Ideogram не сделает

  • Не даст 4K. Потолок — 2048 по большей стороне. Если нужен крупный формат, картинку делают в Seedream, а надпись ставят поверх настоящим текстом.
  • Не гарантирует безошибочный длинный текст. Две короткие строки — да, абзац — нет.
  • Не сохранит лицо между правками. Это Nano Banana.
  • Не отдаст несколько картинок за вызов. Batch-режима нет, варианты приходится запрашивать по одному.

Частые вопросы

Что такое Ideogram и для чего он нужен?
Ideogram — модель генерации изображений, сильная сторона которой — читаемый текст внутри картинки: вывески, постеры, логотипы, обложки с заголовком. В Twelver подключена версия 4.0, отдельная регистрация не нужна, оплата в рублях с общего баланса.
Как заставить нейросеть правильно написать текст на картинке?
Указать надпись в запросе, лучше в кавычках: «постер с надписью „Осенняя распродажа“». Ideogram отрисует её читаемо. Ограничение одно: одна-две короткие строки получаются надёжно, а длинный текст мелким шрифтом лучше ставить поверх картинки настоящим текстом.
Можно ли получить картинку с прозрачным фоном?
Да, и без отдельного режима: достаточно попросить словами — «стикер, прозрачный фон, без фона», — и на выходе будет PNG с альфа-каналом. Это единственная подключённая модель, которая так умеет.
Как вырезать объект из готовой фотографии?
Отдельной операцией «убрать фон»: она принимает любое изображение, в том числе сделанное другой моделью или загруженное вами, и стоит примерно втрое дешевле самой дешёвой генерации. Перегенерировать объект с прозрачностью почти всегда дороже.
Почему правка картинки такая дорогая?
Потому что здесь платят за тип операции, а не за пиксели, и правка словами — самая дорогая из четырёх: она стоит больше трёх обычных генераций. Для большинства задач дешевле перегенерировать на скорости TURBO с уточнённым описанием или взять ремикс, сохраняющий композицию.
Можно ли сделать картинку в формате 4:5 для карточки товара?
Да, через расширение кадра: подаёте картинку и просите формат 4:5, модель дорисует края. При обычной генерации этой пропорции нет — как и у остальных наших моделей изображений, так что этот путь единственный.
Какое максимальное разрешение у Ideogram?
2048 пикселей по большей стороне — меньше, чем у Seedream с её 4K. Ideogram берут не за разрешение, а за текст и прозрачность; если нужен крупный формат с надписью, картинку делают в Seedream, а текст ставят поверх.
Нужно ли выбирать Ideogram в чате вручную?
Нет, списка моделей в интерфейсе нет — модель подбирается под задачу автоматически, и просьба сделать постер с надписью уйдёт именно сюда. Назвать её явно можно при обращении по API, а попробовать — в окне выше на этой странице.

Примеры и цены — на странице Ideogram и в генерации изображений. Другие модели — в оглавлении книги; про картинки вообще — в книге про генерацию изображений.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт