OpenAI представила API для голосового ИИ без задержек - AI Founder

OpenAI представила API для голосового ИИ без задержек

OpenAI представила API для голосового ИИ без задержек

Задержка убивает магию голосового ИИ. OpenAI нашла решение — Realtime API. Это похоже на живой разговор.

OpenAI представила Realtime API. Это новый режим WebSocket. Он убирает задержки в голосовом ИИ.

Раньше система напоминала машину Руба Голдберга. Аудио шло в три разных модели. Каждый шаг добавлял сотни миллисекунд.

Теперь всё работает в одной трубе. WebSocket создаёт постоянное соединение. Модель слушает и говорит одновременно.

Разработчики подключаются к wss://api.openai.com/v1/realtime. Там работает GPT-4o. Он обрабатывает аудио напрямую.

API использует три сущности. Сессия хранит настройки. Элемент — это реплика в диалоге. Ответ — команда для генерации.

Система работает с сырым аудио. Поддерживает два формата. PCM16 для качества и G.711 для телефонии.

Главное обновление — семантический VAD. Он отличает паузу от конца фразы. ИИ больше не перебивает.

Работа строится на событиях. Сервер шлёт их потоком. Клиент получает аудио и текст в реальном времени.

Пользователь может прервать ответ. Система обрежет память модели. Диалог станет естественнее.

Задержки ушли в прошлое. Голосовой ИИ стал похож на человека. Это меняет правила игры.

Мария Соколова
Автор: Мария Соколова

Журналист и аналитик с фокусом на AI-инструменты для стартапов. Пишу о том, как основатели компаний внедряют ИИ для автоматизации и роста выручки.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x