Google выпустила Gemini 3.1 Flash TTS — новую модель для преобразования текста в речь, управляемую промптами. Модель доступна через стандартный Gemini API и позволяет детально настраивать голос, акцент и эмоциональную окраску с помощью текстовых инструкций, что открывает новые возможности для создания аудиоконтента.
Детали новой модели
Модель идентифицируется как gemini-3.1-flash-tts-preview в API и может выводить только аудиофайлы. Ключевая особенность — возможность управления голосом через детальные промпты, что выводит генерацию речи на новый уровень.
Пример промпта от Google демонстрирует необычный подход. Для генерации короткого аудио разработчики предлагают создавать целые сцены с описанием персонажа, его настроения и окружения.
Как работает промптинг
Промпт включает «аудиопрофиль» диджея Jaz R., сцену в лондонской студии и режиссерские заметки. В них задается стиль («вокальная улыбка»), динамика, темп и акцент (в примере — эстуарный, характерный для Брикстона, Лондон).
Модель точно воспроизводит указанные параметры. Изменение промпта на «Jaz из Ньюкасла» или «Эксетера, Девон» мгновенно меняет акцент в сгенерированной речи, что подтверждает гибкость системы.
Значение для индустрии
Революционность подхода в переходе от выбора предустановленных голосов к их созданию через текст. Это дает беспрецедентный контроль над интонацией, эмоциями и региональными особенностями речи.
Технология найдет применение в производстве аудиоконтента, озвучке, создании персонажей для игр и интерактивных медиа. Она также упростит локализацию, позволяя быстро генерировать речь с нужным акцентом.
Перспективы и контекст
Выпуск Gemini 3.1 Flash TTS — часть стратегии Google по развитию мультимодальных моделей. Компания продолжает расширять возможности Gemini, делая их более специализированными и доступными через API.
Новая модель устанавливает высокую планку для конкурентов в области генерации речи. Ее успех будет зависеть от качества звука, скорости обработки и стоимости использования в масштабе.