Андрей Карпати опубликовал проект autoresearch. Это инструмент для автономных экспериментов. ИИ-агенты сами меняют код и проверяют гипотезы.
Вся программа — 630 строк на Python. Она работает на одной видеокарте NVIDIA. Это упрощённая версия ядра nanochat.
Человек пишет инструкции в Markdown-файле. ИИ читает их и меняет код обучения. Затем запускается пятиминутный эксперимент.
Система оценивает результат. Ключевая метрика — bits-per-byte. Чем она ниже, тем лучше модель.
ИИ фиксирует изменения только при улучшении. В тестах Карпати метрика упала с 1.0 до 0.97. Это произошло без участия человека.
Гендиректор Shopify Тоби Лютке опробовал инструмент. Его ИИ улучшил маленькую модель на 19%. Она обогнала большую, настроенную вручную.
Карпати интегрировал находки ИИ в nanochat. Это доказывает практическую пользу. Автономные агенты находят неочевидные оптимизации.
Теперь задача разработчика — не настройка параметров. Нужно писать чёткие инструкции для агента. Он сам исследует пространство решений.
Короткий код — это принципиально. Он целиком помещается в контекст LLM. Агент понимает весь скрипт и не ошибается.