Компания Liquid AI представила модель LFM2-24B-A2B. В ней 24 миллиарда параметров. Но работает она на обычном ноутбуке.
Секрет в гибридной архитектуре. Её назвали «Внимание к Основанию». Соотношение слоёв — один к трём.
Тридцать слоёв используют свёртки. Всего десять слоёв — механизм внимания. Это снижает нагрузку на память.
Модель применяет «Смесь экспертов». На каждый токен активируется 2,3 миллиарда параметров. Остальные «спят».
Такой подход — прорыв для развёртывания. Модель помещается в 32 гигабайта оперативной памяти. Ей не нужны серверные видеокарты.
Она обходит более крупных конкурентов в тестах на логику. Скорость генерации тоже выше. Контекстное окно — 32 тысячи токенов.
Модель обучали на 17 триллионах токенов. Лицензия позволяет свободное использование. Поддержка уже есть в llama.cpp и vLLM.
Эра огромных моделей подходит к концу. Будущее — за умной архитектурой. Которая работает там, где это нужно.