Mistral представила Voxtral Transcribe 2. Это две модели для распознавания речи. Одна для записей, другая — для потока.
Они понимают тринадцать языков. Среди них русский, английский, китайский. Есть и испанский с немецким.
Распознавание речи стало основой для ИИ. Его используют в переводчиках и голосовых помощниках. Mistral решила занять эту нишу.
Пакетная модель определяет говорящих. Она стоит три десятых цента за минуту. Точность — четыре процента ошибок.
Потоковая модель работает с задержкой. Её можно настроить от восьмидесяти миллисекунд. До двух с половиной секунд.
Задержка в полсекунды даёт высокую точность. Она сравнима с офлайн-системами. Это удобно для субтитров.
Модель для потока весит четыре миллиарда параметров. Она работает на одной видеокарте. Памяти нужно шестнадцать гигабайт.
Код модели выложили в открытый доступ. Лицензия — Apache 2.0. Запускать советуют через vLLM.
Пакетная модель быстрее аналогов в три раза. При этом она дешевле в пять раз. Точность остаётся на уровне.