Инженеры NXP поделились опытом. Они учат роботов работать на встроенных системах. Задача — положить чайный пакетик в кружку.
Большие языковые модели стали мультимодальными. Теперь они видят и управляют действиями. Это называют VLA-моделями.
Запустить такую модель на роботе сложно. Нужно много вычислительной мощности. Памяти мало, энергия ограничена.
Рука робота ждёт команды. Это вызывает дрожание и задержки. Решение — асинхронные вычисления.
Главное — не сжать модель, а перестроить систему. Нужно новое расписание и архитектура. Это инженерная задача.
Качество данных важнее их количества. Записывайте аккуратно. Это первое правило.
Камеры должны быть жёстко закреплены. Свет — контролируемым. Контраст между рукой и предметом — максимальным.
Не обманывайте модель. Оператор не должен смотреть на сцену напрямую. Робот учится только по камерам.
Камера на захвате — лучший выбор. Она даёт близкий вид для точных действий. Это повышает успешность задачи.
В эксперименте использовали три камеры. Сверху, на захвате и слева. Так нашли баланс между точностью и скоростью.