Fish Audio выпустила модель S2-Pro. Это новая система синтеза речи. Она работает очень быстро и точно.
Модель копирует голос за десять секунд. Достаточно короткой аудиозаписи. Никакой долгой настройки не нужно.
Эмоциями можно управлять на лету. В текст вставляются простые метки. Например, [шёпот] или [смех].
Архитектура модели состоит из двух частей. Первая часть улавливает смысл и интонацию. Вторая — детали тембра и звука.
Задержка генерации — около ста миллисекунд. Это быстрее моргания. Речь звучит естественно и живо.
Технология открыта для разработчиков. Её можно встроить в любое приложение. Будущее голосовых интерфейсов меняется сейчас.