Google представила Gemini 3.5 Live Translate — аудиомодель для почти синхронного перевода речи в речь. Она автоматически распознает более 70 языков и генерирует естественную озвучку, сохраняя интонацию, темп и высоту голоса говорящего.
В отличие от turn-by-turn-систем, модель не ждет окончания фразы, а переводит потоковую речь непрерывно, оставаясь на несколько секунд позади спикера. Это должно сделать разговоры без общего языка более плавными и без длинных пауз.
Gemini 3.5 Live Translate уже выходит в public preview для разработчиков через Gemini Live API и Google AI Studio, в private preview для компаний в Google Meet и в приложении Google Translate на Android и iOS.
В Google Meet модель добавит поддержку 70+ языков и более 2000 языковых комбинаций в одной встрече. Все сгенерированное аудио помечается водяным знаком SynthID.