Код от ИИ часто ломается. Автоматические тесты не панацея. Они пропускают очевидные ошибки.
Сервер может упасть при запуске. Интерфейс — не отобразиться. Тесты пройдут, а программа — нет.
Саймон Уиллсон предлагает простое правило. Перед релизом нужно увидеть работу функции своими глазами. Агенты могут это сделать.
Для Python есть команда python -c. Агент выполняет код прямо в интерпретаторе. Это проверяет работу на лету.
Для веб-приложений подходит curl. Агент запускает сервер и тестирует API. Команда «исследовать» даёт широкую проверку.
Особенно важен ручной тест для интерфейсов. Раньше это было сложно. Сейчас есть инструменты вроде Playwright.
Playwright от Microsoft автоматизирует браузеры. Агенты отлично с ним работают. Достаточно сказать: «Протестируй это через Playwright».
Есть и специальные CLI, например agent-browser от Vercel. Они созданы для агентов. Уиллсон делает похожий проект Rodney.
Если ручной тест находит баг, нужно его исправить. Лучше через метод red/green TDD. Так ошибка попадёт в постоянные тесты.