OpenAI представила Realtime API. Это новый режим WebSocket. Он убирает задержки в голосовом ИИ.
Раньше система напоминала машину Руба Голдберга. Аудио шло в три разных модели. Каждый шаг добавлял сотни миллисекунд.
Теперь всё работает в одной трубе. WebSocket создаёт постоянное соединение. Модель слушает и говорит одновременно.
Разработчики подключаются к wss://api.openai.com/v1/realtime. Там работает GPT-4o. Он обрабатывает аудио напрямую.
API использует три сущности. Сессия хранит настройки. Элемент — это реплика в диалоге. Ответ — команда для генерации.
Система работает с сырым аудио. Поддерживает два формата. PCM16 для качества и G.711 для телефонии.
Главное обновление — семантический VAD. Он отличает паузу от конца фразы. ИИ больше не перебивает.
Работа строится на событиях. Сервер шлёт их потоком. Клиент получает аудио и текст в реальном времени.
Пользователь может прервать ответ. Система обрежет память модели. Диалог станет естественнее.
Задержки ушли в прошлое. Голосовой ИИ стал похож на человека. Это меняет правила игры.