AI И НЕЙРОСЕТИ

ZDNet: один прием заметно улучшает картинки в ChatGPT и Gemini

ZDNet сравнил ChatGPT и Gemini и показал: один прием с промптом помогает заметно улучшить генерацию изображений даже у новичков.

✍️ Редакция iTech News | 07.06.2026 | ⏱ 4 мин | Источник: ZDNet
🎯

Один лишний запрос к чат-боту может заметно поднять качество картинки, которую вы получаете от ИИ с первой попытки. ZDNet показал на примере ChatGPT и Gemini, что промпт для изображений работает лучше, если сначала попросить сам сервис написать подробную инструкцию для собственного генератора. Для русскоязычной IT-аудитории это не теория про «магический prompt engineering», а вполне прикладной способ тратить меньше времени на перебор формулировок.

Как пишет ZDNet, редакция проверила простой сценарий: вместо короткого запроса вроде «нарисуй подсолнух из листового металла в стиле карандашного рисунка» пользователю предлагают сначала дать модели базовую идею, а затем попросить ее развернуть эту идею в полноценный промпт для изображений. В тесте использовали один и тот же сюжет: металлический подсолнух, выполненный как карандашный рисунок. После этого Gemini и ChatGPT сгенерировали более длинные, детализированные описания уже под свои встроенные инструменты создания изображений.

Разница оказалась не в «умности» идеи, а в плотности деталей. Gemini, по данным издания, добавил в описание фактуру металла, следы сварки, объем за счет штриховки и фон с размытыми растениями. ChatGPT пошел еще дальше: включил в промпт швы, заклепки, изгибы тонких металлических пластин, индустриальные текстуры в сердцевине цветка, штриховку графитом и минималистичный фон, чтобы внимание не уходило от объекта. На выходе оба результата выглядели лучше, чем если бы пользователь ограничился исходной короткой фразой. И это важный момент: улучшение пришло не от смены модели, а от более точной постановки задачи.

Для рынка это хороший маркер того, куда вообще движется потребительский ИИ. Интерфейсы генеративных сервисов все сильнее маскируют сложность, но сама сложность никуда не делась. Пользователю по-прежнему нужно объяснить системе, что именно он хочет получить: материал, стиль, свет, композицию, степень детализации, фон, фактуру, визуальный акцент. Просто теперь часть этой работы можно отдать самой модели. По сути, чат-бот начинает выступать не только как исполнитель, но и как внутренний «переводчик» между человеческим запросом и языком, на котором лучше понимает генератор картинок.

У этого подхода есть и вторая практическая выгода. Автор исходной идеи, обозреватель ZDNet Лэнс Уитни, отмечает, что когда чат-бот сам пишет запрос для собственного генератора, в нем реже встречаются формулировки, которые инструмент может заблокировать или интерпретировать слишком широко. Для корпоративного использования это особенно удобно. Маркетологу, продакту или HR не обязательно разбираться в тонкостях визуального описания, чтобы быстро собрать черновик иллюстрации для презентации, вакансии, лендинга или внутреннего документа. Сервис сам подскажет, как упаковать замысел в более рабочую форму.

Разумеется, это не отменяет ограничений. ZDNet отдельно напоминает, что результат все равно зависит от конкретного инструмента и его текущей версии: модели регулярно обновляют, меняют поведение и правила модерации. То, что сработало 6 июня 2026 года в тесте одного издания, не гарантирует идентичный результат через месяц. Кроме того, длинный промпт не всегда означает лучший итог. Если описание получилось перегруженным, тот же Уитни советует попросить более короткий вариант. Это здравая рекомендация: слишком подробный запрос иногда начинает не уточнять задачу, а размывать приоритеты, особенно когда в одном абзаце смешаны стиль, материалы, настроение, композиция и фон.

Для разработчиков и команд, которые внедряют генеративные инструменты в процессы, история интересна не только на уровне пользовательского лайфхака. Здесь видна более широкая схема: успешнее работают не те сценарии, где человек «угадывает правильную магическую фразу», а те, где система помогает сама себя настроить. Такой паттерн легко переносится и на другие задачи. Если нужно сгенерировать SQL-запрос, текст вакансии, user story или эскиз интерфейса, модель часто справляется лучше, когда сначала формализует намерение пользователя, а уже потом выполняет основную команду. Иными словами, хороший промпт для изображений все чаще появляется не в голове автора, а в промежуточном слое между человеком и моделью.

Бизнесу из этого стоит сделать довольно трезвый вывод. Генерация картинок больше не выглядит экзотикой для дизайнеров-энтузиастов: она становится обычной офисной функцией, где качество зависит от того, насколько грамотно выстроен шаблон общения с инструментом. Внутри компаний это может привести к появлению простых стандартов: сначала описываем объект и стиль в одной строке, затем просим сервис собрать расширенный запрос, потом при необходимости укорачиваем или уточняем его под задачу. Такой процесс дешевле серии хаотичных попыток и лучше масштабируется на команды, в которых ИИ пользуются не специалисты по визуалу, а сотрудники «по случаю».

Самый интересный вопрос теперь не в том, какая модель рисует красивее в отдельном тесте, а в том, насколько быстро генеративные сервисы научатся скрывать от пользователя саму механику промптинга. Пока хороший результат все еще требует промежуточного шага, но логика рынка подталкивает платформы к следующему этапу: чтобы ChatGPT, Gemini и их конкуренты автоматически превращали сырую идею в рабочий запрос без отдельной команды со стороны человека.

Поделиться: Telegram X LinkedIn