22 сентября 2026

Искусственный интеллект Приложения

OpenAI запускает GPT-Realtime-2 для создания более интеллектуальных голосовых приложений

Опубликовано , автор Shalom Levytam

OpenAI выпускает в свой API три новые аудиомодели, предоставляя разработчикам новые инструменты для создания голосовых приложений, способных обдумывать запросы, переводить разговоры в реальном времени и генерировать стенограммы «на лету» с меньшей задержкой.

OpenAI Launches GPT-Realtime-2 to Power Smarter Voice Apps

Главным элементом этого релиза стал GPT-Realtime-2 — первая голосовая модель OpenAI, созданная на базе возможностей рассуждения уровня GPT-5. Модель предназначена для живых диалогов, позволяя приложениям обрабатывать прерывания, исправления и меняющийся контекст в реальном времени. По заявлению OpenAI, разработчики также могут включать короткие речевые вступления вроде «дайте я это проверю», пока модель выполняет действия в фоновом режиме с помощью параллельных вызовов инструментов.

GPT-Realtime-2 увеличивает окно контекста с 32 тыс. до 128 тыс. токенов, обеспечивая более длительные и согласованные беседы. Разработчики также могут настраивать уровень рассуждения — от минимального до максимального (xhigh) — в зависимости от того, что им требуется: более быстрые ответы или глубокий анализ для решения более сложных задач.

OpenAI также представляет GPT-Realtime-Translate — модель перевода в реальном времени, которая преобразует речь с более чем 70 входных языков на 13 выходных, не отставая от говорящего. В компании отмечают, что модель спроектирована так, чтобы сохранять смысл и контекст даже во время динамичных разговоров или когда пользователи меняют тему беседы.

Для задач транскрипции GPT-Realtime-Whisper обеспечивает потоковое преобразование речи в текст для живых субтитров, заметок встреч и рабочих процессов, управляемых голосом. По словам OpenAI, эта модель с низкой задержкой предназначена для приложений, которым требуется непрерывное распознавание речи прямо во время разговора.

Это анонс представляет особую важность для разработчиков под экосистему Apple, поскольку голосовые интерфейсы продолжают расширяться на iPhone, CarPlay и Mac. Разработчики уже задействуют новые возможности для запуска разговорных ИИ-приложений напрямую на панели управления CarPlay, в то время как Apple готовит систему расширений для поддержки сторонних ассистентов в iOS 27.

Чтобы помочь разработчикам интегрировать новые модели, OpenAI связала этот релиз со своим приложением Codex для Mac, которое, как заявляет компания, способно помочь в интеграции нового Realtime API в приложения. Недавно в Codex появилась возможность управлять рабочим столом Mac в фоновом режиме, органично вписываясь в более широкие рабочие процессы разработки с поддержкой ИИ наряду с такими инструментами, как Xcode 26.3.

Все три модели уже доступны. Стоимость GPT-Realtime-2 составляет 32 доллара за миллион входных аудиотокенов и 64 доллара за миллион выходных токенов. GPT-Realtime-Translate оценивается в 0,034 доллара за минуту, а стоимость GPT-Realtime-Whisper составляет 0,017 доллара за минуту.

Искусственный интеллект. Читайте также на iClarified.ru.