Есть задача, на которой картиночные нейросети спотыкались годами: написать в кадре по-русски. Не «что-то похожее на буквы», а ровно то слово, которое просили. Кто пробовал сделать вывеску, ценник или обложку с заголовком, знает этот жанр: на картинке появляется «КОФС ДНЯ», «Круассап» и знак, отдалённо напоминающий рубль. Дальше начинается фотошоп, и вся экономия времени уходит туда.
8 сентября OpenAI выпустила GPT Image 2.5. Мы завели её в каталог на следующий день, прогнали по ступеням и режимам — и вот что выяснилось про русский текст.
Почему кириллица давалась моделям тяжелее латиницы
Причина скучная и техническая. Модель не «печатает» буквы шрифтом — она рисует изображение целиком, включая надписи, по тем закономерностям, которые видела в обучении. А видела она преимущественно английский: вывески, обложки, упаковку, интерфейсы. Кириллицы в этой массе на порядок меньше, и половина букв к тому же коварна — «И» легко превращается в «N», «Я» в «R», а мягкий знак модель принимает за «b».
Отсюда классический результат: латиница выходит чисто, а русский — узором, который издалека похож на текст. Для поста в канал сойдёт. Для этикетки, афиши или карточки товара — нет.
Что изменилось
GPT Image 2.5 держит кириллицу. Мы проверили на трёх типовых задачах — витрина, постер, упаковка — и текст в кадре получился читаемым в каждой.
Вот витрина пекарни. Грифельная доска, заголовок, три позиции с ценами, знак рубля, плюс бумажные ценники в корзинах и рамка с фразой на дальнем плане:

Здесь важна не одна крупная надпись, а то, что мелкий текст на втором плане тоже осмысленный. Раньше именно он и рассыпался: крупный заголовок модель ещё вытягивала, а ценник в углу превращался в кашу.
Дальше — афиша. Четыре уровня вёрстки: название, дата со временем, площадка и строка внизу. Каждый на своём месте и своим кеглем:

И упаковка — самый придирчивый случай, потому что этикетку разглядывают вблизи:

Название с заглавными «ИИ» на конце модель воспроизвела как просили. Мы, честно говоря, ставили на то, что она их «исправит».
Сразу оговорка, без которой обзор был бы рекламой: это генерация, а не типографика. Короткие ёмкие строки выходят чисто, а если заказать в кадр целый абзац мелким кеглем — где-то съедет тире или запятая. Планируйте надпись как надпись: несколько слов, которые человек прочитает с одного взгляда.
Два режима: «Быстрый» и «Дотошный»
У модели два движка, и в смуззИИ они переключаются в панели прямо под промтом.
Быстрый — тот, что стоит по умолчанию. Отвечает скорее, годится на поток: набросать варианты, перебрать композиции, сделать десяток кадров подряд и выбрать один.
Дотошный создан под правки. Когда один и тот же кадр доводится за несколько заходов — «теперь поменяй цвет», «теперь убери лишнее», «теперь другой фон», — он лучше держит предыдущие изменения и не переигрывает картинку заново.
Цена у режимов одинаковая на каждой ступени. Это не тарифы, а характеры: выбираешь под задачу, а не под кошелёк.
Правка по фото и 16 референсов
Загружаешь снимок, пишешь, что поменять — меняется названное. Просишь перекрасить бельё в изумрудный: перекрашивается бельё, а свет, ракурс, мебель и вид за окном остаются теми же. Это то самое «точечное редактирование», ради которого и берут второй режим.
Референсов модель принимает до шестнадцати за раз — вчетверо больше, чем предыдущее поколение. Пригодится, когда нужно удержать один и тот же предмет или лицо в серии кадров.
Сколько это стоит
Три ступени качества: 1K, 2K и 4K. Кадр стоит от 10 токенов, один токен — примерно рубль. 1K берут под быстрые пробы, 4K — под финал, который пойдёт в печать или на большой экран.
Ни VPN, ни зарубежной карты, ни подписки не нужно: пополняешь баланс рублями и генерируешь, когда удобно. Токены не сгорают.
Кому пригодится
Тем, у кого текст в кадре — часть работы, а не украшение.
Малому бизнесу: ценники, меню, вывески, посты с ценой прямо на картинке. Дизайнерам: черновики макетов, где заказчику надо показать не «текст-рыбу», а реальную надпись. Селлерам на маркетплейсах: карточки товара, где на упаковке читается название и объём. Организаторам: афиши, где дата и площадка должны быть видны, а не угадываться.
Тем, кому надпись в кадре не нужна, эта модель не даст преимущества — в каталоге есть соседи с другим характером картинки. А если нужна — попробуйте на своей задаче: напишите, что должно быть на вывеске, и прочитайте это в кадре.
Подробные характеристики, примеры и сравнение со соседями — на странице GPT Image 2.5.
