xAI представила два самостоятельных аудио-API: Grok Speech to Text и Grok Text to Speech. Первый отвечает за распознавание речи, второй — за синтез голоса, и оба построены на той же базе, что и Grok Voice, Tesla и поддержка Starlink.
STT умеет работать как с большими аудиофайлами, так и в реальном времени через WebSocket. Среди функций — word-level timestamps, diarization, multichannel и автоматическое приведение речи к нормальному текстовому виду с числами, датами и валютами.
TTS делает ставку на естественные и выразительные голоса. В нем есть speech tags вроде смеха, шепота, пауз и акцентов, чтобы точнее управлять подачей.
По цене xAI позиционирует продукт агрессивно: STT стоит от $0.10 в час для batch и $0.20 для streaming, а TTS — $4.20 за 1 млн символов.