Google выпустила Gemini Embedding 2. Модель понимает текст, фото и видео - AI Founder

Google выпустила Gemini Embedding 2. Модель понимает текст, фото и видео

Google выпустила Gemini Embedding 2. Модель понимает текст, фото и видео

Google представила новое поколение модели Gemini Embedding. Теперь она понимает не только текст, но и изображения, видео, аудио и документы.

Google представила Gemini Embedding 2. Это вторая версия модели для создания векторных представлений. Она обрабатывает пять типов данных одновременно.

Модель понимает текст, изображения, видео, аудио и PDF. Все они переводятся в единое векторное пространство. Раньше для этого требовались разные модели.

За один запрос можно отправить до 8192 токенов текста. Или шесть изображений. Или 120 секунд видео. Или 80 секунд аудио без расшифровки.

Это решает проблему хранения данных. Раньше для каждого типа медиа нужен был отдельный конвейер обработки. Теперь всё в одном месте.

Модель использует метод Matryoshka Representation Learning. Ключевая информация упаковывается в первые измерения вектора. Это экономит память и ускоряет поиск.

Разработчики могут выбрать размер вектора. 3072 измерения для максимальной точности. 1536 для баланса. 768 для быстрого поиска с низкой задержкой.

Сначала система ищет по коротким векторам. Потом перепроверяет результаты по полным. Это ускоряет работу без потери качества.

Модель показала хорошие результаты в тестах. Особенно в поиске информации и работе со специализированными данными. Она меньше теряет точность на узких задачах.

Окно в 8192 токена позволяет работать с большими текстами. Это важно для систем поиска и генерации ответов. Контекст становится полнее.

Елена Петрова
Автор: Елена Петрова

Продуктовый дизайнер с фокусом на AI-инструментах. Тестирует и сравнивает нейросети для креативных профессий.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x