Inception представила Mercury 2.5 — диффузионную LLM на 1100 токенов в секунду
умнее Mercury 2, но сохранила упор на скорость и низкую стоимость. Компания заявляет прирост качества на 40% и производительность до 1107 токенов в секунду на распространённых NVIDIA GPU. У модели контекст на 260 тысяч токенов, настраиваемый reasoning, параллельные tool calls и вывод JSON по схеме. Базовая цена — $0,20 за миллион входных и $0,75 за … Читать далее