xAI запустила аудио-API для речи и озвучки - AI Founder

xAI запустила аудио-API для речи и озвучки

xAI представила два самостоятельных аудио-API: Grok Speech to Text и Grok Text to Speech. Первый отвечает за распознавание речи, второй — за синтез голоса, и оба построены на той же базе, что и Grok Voice, Tesla и поддержка Starlink.

STT умеет работать как с большими аудиофайлами, так и в реальном времени через WebSocket. Среди функций — word-level timestamps, diarization, multichannel и автоматическое приведение речи к нормальному текстовому виду с числами, датами и валютами.

TTS делает ставку на естественные и выразительные голоса. В нем есть speech tags вроде смеха, шепота, пауз и акцентов, чтобы точнее управлять подачей.

По цене xAI позиционирует продукт агрессивно: STT стоит от $0.10 в час для batch и $0.20 для streaming, а TTS — $4.20 за 1 млн символов.

Максим Черняк
Автор: Максим Черняк

Эксперт AI Founder. Слежу за последними новостями в мире искусственного интеллекта.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x