OpenAI выпустила новые голосовые модели для API
OpenAI представила три аудиомодели в Realtime API: GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper. Они рассчитаны на голосовые приложения, которые могут понимать речь, рассуждать, переводить, расшифровывать и выполнять действия в реальном времени.
GPT-Realtime-2 стала первой голосовой моделью OpenAI с рассуждением уровня GPT-5. Она лучше ведет длинный диалог, вызывает инструменты, реагирует на уточнения и поддерживает контекст до 128K токенов.
GPT-Realtime-Translate переводит речь в реальном времени: модель поддерживает более 70 входных языков и 13 языков вывода. Ее можно использовать в поддержке, продажах, образовании, медиа и международных сервисах.
GPT-Realtime-Whisper предназначена для потоковой расшифровки речи с низкой задержкой. Она подходит для субтитров, заметок встреч, голосовых агентов и рабочих процессов в поддержке, медицине, продажах и рекрутинге.
Все три модели уже доступны в Realtime API.