смуззИИ
Модели

Нейросеть, которая пишет русский текст на картинке

Обновлено 9 сентября 2026 · 5 мин чтения

Раскрытый блокнот дизайнера на деревянном столе, рядом три печатные карточки с русскими надписями «АФИША», «ЭТИКЕТКА», «ВЫВЕСКА»

Есть задача, на которой картиночные нейросети спотыкались годами: написать в кадре по-русски. Не «что-то похожее на буквы», а ровно то слово, которое просили. Кто пробовал сделать вывеску, ценник или обложку с заголовком, знает этот жанр: на картинке появляется «КОФС ДНЯ», «Круассап» и знак, отдалённо напоминающий рубль. Дальше начинается фотошоп, и вся экономия времени уходит туда.

8 сентября OpenAI выпустила GPT Image 2.5. Мы завели её в каталог на следующий день, прогнали по ступеням и режимам — и вот что выяснилось про русский текст.

Почему кириллица давалась моделям тяжелее латиницы

Причина скучная и техническая. Модель не «печатает» буквы шрифтом — она рисует изображение целиком, включая надписи, по тем закономерностям, которые видела в обучении. А видела она преимущественно английский: вывески, обложки, упаковку, интерфейсы. Кириллицы в этой массе на порядок меньше, и половина букв к тому же коварна — «И» легко превращается в «N», «Я» в «R», а мягкий знак модель принимает за «b».

Отсюда классический результат: латиница выходит чисто, а русский — узором, который издалека похож на текст. Для поста в канал сойдёт. Для этикетки, афиши или карточки товара — нет.

Что изменилось

GPT Image 2.5 держит кириллицу. Мы проверили на трёх типовых задачах — витрина, постер, упаковка — и текст в кадре получился читаемым в каждой.

Вот витрина пекарни. Грифельная доска, заголовок, три позиции с ценами, знак рубля, плюс бумажные ценники в корзинах и рамка с фразой на дальнем плане:

Витрина пекарни: грифельная доска с надписью «СВЕЖАЯ ВЫПЕЧКА» и списком цен по-русски

Здесь важна не одна крупная надпись, а то, что мелкий текст на втором плане тоже осмысленный. Раньше именно он и рассыпался: крупный заголовок модель ещё вытягивала, а ценник в углу превращался в кашу.

Дальше — афиша. Четыре уровня вёрстки: название, дата со временем, площадка и строка внизу. Каждый на своём месте и своим кеглем:

Концертная афиша на кирпичной стене с русским текстом «ВЕЧЕР ЭЛЕКТРОНИКИ», датой и адресом

И упаковка — самый придирчивый случай, потому что этикетку разглядывают вблизи:

Бутылка смузи с этикеткой: «смуззИИ», «манго-маракуйя», «450 мл»

Название с заглавными «ИИ» на конце модель воспроизвела как просили. Мы, честно говоря, ставили на то, что она их «исправит».

Сразу оговорка, без которой обзор был бы рекламой: это генерация, а не типографика. Короткие ёмкие строки выходят чисто, а если заказать в кадр целый абзац мелким кеглем — где-то съедет тире или запятая. Планируйте надпись как надпись: несколько слов, которые человек прочитает с одного взгляда.

Два режима: «Быстрый» и «Дотошный»

У модели два движка, и в смуззИИ они переключаются в панели прямо под промтом.

Быстрый — тот, что стоит по умолчанию. Отвечает скорее, годится на поток: набросать варианты, перебрать композиции, сделать десяток кадров подряд и выбрать один.

Дотошный создан под правки. Когда один и тот же кадр доводится за несколько заходов — «теперь поменяй цвет», «теперь убери лишнее», «теперь другой фон», — он лучше держит предыдущие изменения и не переигрывает картинку заново.

Цена у режимов одинаковая на каждой ступени. Это не тарифы, а характеры: выбираешь под задачу, а не под кошелёк.

Правка по фото и 16 референсов

Загружаешь снимок, пишешь, что поменять — меняется названное. Просишь перекрасить бельё в изумрудный: перекрашивается бельё, а свет, ракурс, мебель и вид за окном остаются теми же. Это то самое «точечное редактирование», ради которого и берут второй режим.

Референсов модель принимает до шестнадцати за раз — вчетверо больше, чем предыдущее поколение. Пригодится, когда нужно удержать один и тот же предмет или лицо в серии кадров.

Сколько это стоит

Три ступени качества: 1K, 2K и 4K. Кадр стоит от 10 токенов, один токен — примерно рубль. 1K берут под быстрые пробы, 4K — под финал, который пойдёт в печать или на большой экран.

Ни VPN, ни зарубежной карты, ни подписки не нужно: пополняешь баланс рублями и генерируешь, когда удобно. Токены не сгорают.

Кому пригодится

Тем, у кого текст в кадре — часть работы, а не украшение.

Малому бизнесу: ценники, меню, вывески, посты с ценой прямо на картинке. Дизайнерам: черновики макетов, где заказчику надо показать не «текст-рыбу», а реальную надпись. Селлерам на маркетплейсах: карточки товара, где на упаковке читается название и объём. Организаторам: афиши, где дата и площадка должны быть видны, а не угадываться.

Тем, кому надпись в кадре не нужна, эта модель не даст преимущества — в каталоге есть соседи с другим характером картинки. А если нужна — попробуйте на своей задаче: напишите, что должно быть на вывеске, и прочитайте это в кадре.

Подробные характеристики, примеры и сравнение со соседями — на странице GPT Image 2.5.

Хватит читать — делай

Всё из этой статьи повторяется в смуззИИ за пару минут. Без VPN, оплата в рублях.