Google представила Gemini 3.1 Flash TTS — модель для генерации речи по промптам - AI Founder

Google представила Gemini 3.1 Flash TTS — модель для генерации речи по промптам

Google представила Gemini 3.1 Flash TTS — модель для генерации речи по промптам

Google представила Gemini 3.1 Flash TTS — новую модель для преобразования текста в речь, управляемую промптами. Модель доступна через стандартный Gemini API и позволяет детально настраивать голос, акцент и эмоциональную окраску с помощью текстовых инструкций, что открывает новые возможности для создания аудиоконтента.

Google выпустила Gemini 3.1 Flash TTS — новую модель для преобразования текста в речь, управляемую промптами. Модель доступна через стандартный Gemini API и позволяет детально настраивать голос, акцент и эмоциональную окраску с помощью текстовых инструкций, что открывает новые возможности для создания аудиоконтента.

Детали новой модели

Модель идентифицируется как gemini-3.1-flash-tts-preview в API и может выводить только аудиофайлы. Ключевая особенность — возможность управления голосом через детальные промпты, что выводит генерацию речи на новый уровень.

Пример промпта от Google демонстрирует необычный подход. Для генерации короткого аудио разработчики предлагают создавать целые сцены с описанием персонажа, его настроения и окружения.

Как работает промптинг

Промпт включает «аудиопрофиль» диджея Jaz R., сцену в лондонской студии и режиссерские заметки. В них задается стиль («вокальная улыбка»), динамика, темп и акцент (в примере — эстуарный, характерный для Брикстона, Лондон).

Модель точно воспроизводит указанные параметры. Изменение промпта на «Jaz из Ньюкасла» или «Эксетера, Девон» мгновенно меняет акцент в сгенерированной речи, что подтверждает гибкость системы.

Значение для индустрии

Революционность подхода в переходе от выбора предустановленных голосов к их созданию через текст. Это дает беспрецедентный контроль над интонацией, эмоциями и региональными особенностями речи.

Технология найдет применение в производстве аудиоконтента, озвучке, создании персонажей для игр и интерактивных медиа. Она также упростит локализацию, позволяя быстро генерировать речь с нужным акцентом.

Перспективы и контекст

Выпуск Gemini 3.1 Flash TTS — часть стратегии Google по развитию мультимодальных моделей. Компания продолжает расширять возможности Gemini, делая их более специализированными и доступными через API.

Новая модель устанавливает высокую планку для конкурентов в области генерации речи. Ее успех будет зависеть от качества звука, скорости обработки и стоимости использования в масштабе.

Дмитрий Волков
Автор: Дмитрий Волков

Продакт-менеджер. Пишу о том, как ИИ меняет подходы к развитию продуктов и масштабированию стартапов.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x