Microsoft представила модель Phi-4-Reasoning-Vision. В ней 15 миллиардов параметров. Она работает с текстом и изображениями.
Модель построили на базе языкового ядра Phi-4. К нему добавили визуальный кодировщик SigLIP-2. Архитектура получилась сбалансированной.
Разработчики выбрали путь компактных моделей. Современные аналоги слишком большие. Они требуют много ресурсов и времени.
Phi-4-Reasoning-Vision обучали на 200 миллиардах токенов. Это меньше, чем у конкурентов. У некоторых моделей объём данных превышает триллион.
Ключевой особенностью стала высокая детализация. Модель видит мелкие элементы на изображениях. Это важно для анализа документов и интерфейсов.
Разработчики научили модель переключаться между режимами. Она может рассуждать или действовать напрямую. Режим выбирается в зависимости от задачи.
Рассуждения активируются для сложных вопросов. Например, для математики или науки. Для простых задач модель отвечает сразу.
Главные сильные стороны — научное и математическое мышление. Модель понимает формулы, диаграммы, графики. Она также разбирается в пользовательских интерфейсах.
Модель уже доступна для исследователей. Её можно использовать и тестировать. Подробности опубликованы в техническом отчёте.