OpenAI представляет ChatGPT Images 2.0 с поддержкой рассуждений и интеграцией Codex
Опубликовано , автор Shalom Levytam
Компания OpenAI представила ChatGPT Images 2.0 — крупное обновление своей технологии генерации изображений, которое предоставляет пользователям на всех ее платформах возможности четкого рерисовки текста, гибкого изменения соотношения сторон и новые функции рассуждения. Обновление доступно начиная с сегодняшнего дня в ChatGPT, через API и в специальном приложении Codex для Mac. Компания позиционирует обновленную модель как более универсальную визуальную систему, способную справляться с более сложными задачами, а не просто как базовый генератор изображений.

Одним из наиболее значительных улучшений в этом релизе стала способность модели точно воспроизводить плотный текст. В OpenAI заявляют, что Images 2.0 создана для работы с мелкими деталями, которые традиционно вызывали трудности у моделей генерации изображений. Сюда относится рендеринг небольшой типографики, точной иконографики и сложных элементов пользовательского интерфейса. Такой уровень точности делает систему более практичной для создания макетов программного обеспечения, технических диаграмм и учебной графики. Обновление также выходит за рамки английского языка. В OpenAI отмечают достижения в рендеринге нелатинских текстов, что позволяет модели создавать визуально сбалансированные дизайны на таких языках, как японский, корейский, китайский, хинди и бенгали, не нарушая языковую структуру.


Для поддержки более широкого спектра форматов модель теперь поддерживает более гибкие соотношения сторон. Пользователи могут создавать изображения от широких панорам 3:1 до высоких вертикальных макетов 1:3. Размеры можно указывать прямо в промпте или настраивать с помощью предустановленных опций, что упрощает вывод материалов для слайдов, баннеров или мобильной графики. OpenAI также улучшила стилистическую точность и реализм. Images 2.0 с большей точностью передает характерные особенности различных визуальных стилей, включая тонкие несовершенства, присущие фотографии, а также освещение и текстуру, характерные для кадров из фильмов, манги и пиксель-арта.

Компания впервые внедряет свои модели рассуждений в процесс генерации изображений. Когда пользователи выбирают модель thinking или pro в ChatGPT, Images 2.0 может искать контекст в реальном времени в интернете, превращать загруженные материалы в понятные визуальные пояснения и дважды проверять свои собственные результаты на точность. Модель также обладает актуальной базой знаний по декабрь 2025 года, что обеспечивает ей более современное понимание реальных объектов и явлений.

При использовании моделей с функциями рассуждения система может генерировать до восьми различных изображений по одному промпту. Пользователи могут запрашивать набор визуальных материалов с согласованными персонажами и объектами, которые дополняют друг друга. Для разработчиков на Mac, использующих функции фонового управления компьютером в Codex, модель изображений теперь интегрирована прямо в рабочий процесс. Разработчик может создавать несколько вариантов пользовательского интерфейса, концептов и прототипов, сравнивать результаты и воплощать лучшие идеи в работающие продукты или веб-интерфейсы, не покидая приложение.
Разработчики могут получить доступ к модели через API под идентификатором gpt-image-2. Это упрощает создание рабочих процессов для локализованной рекламы, творческих инструментов и веб-дизайна с разрешением вывода до 2K. В OpenAI отмечают, что некоторые ограничения все еще сохраняются. Модель может испытывать трудности с задачами, требующими точного понимания физического мира, такими как складывание оригами или определенные головоломки. Чрезвычайно плотные или повторяющиеся текстуры также могут вызывать сложности, а детализированные схемы по-прежнему могут требовать ручной проверки.
Images 2.0 начинает внедряться сегодня для всех пользователей ChatGPT и Codex. Доступ к расширенным результатам с функциями рассуждения ограничен для подписчиков ChatGPT Plus, Pro и Business. Цены на API варьируются в зависимости от выбранного качества и разрешения изображения.