Исследователи Google DeepMind создали агента AlphaEvolve. Он сам пишет код для алгоритмов обучения. Это не настройка параметров, а изобретение новой логики.
Система использует семантическую эволюцию. Большая языковая модель Gemini 2.5 Pro меняет исходный код. Она вводит новые операции и управляющие конструкции.
Процесс похож на естественный отбор. Алгоритм-родитель выбирают по качеству. ИИ его мутирует и улучшает. Потомство тестируют на простых играх.
Первый успех — алгоритм VAD-CFR. Он адаптируется к волатильности игры. Алгоритм отслеживает «тряску» в процессе обучения. Он забывает нестабильную историю быстрее.
VAD-CFR также усиливает положительные сожаления. Это позволяет сразу использовать выгодные отклонения. А усреднение стратегий начинается только с 500-й итерации.
Алгоритм превзошёл стандартные методы. Он выиграл в 10 из 11 игр. Среди них — покер Ледука и кости лжеца. Исключением стал только покер Куна на четверых.
Второй прорыв — алгоритм SHOR-PSRO. Он работает на уровне мета-игры. Алгоритм определяет, как стратегии играют друг против друга.
Его ядро — гибридный механизм смешивания. Он объединяет стабильный и жадный методы. Коэффициент смешивания плавно уменьшается со временем.
Это смещает фокус с исследования на устойчивое равновесие. Алгоритм становится осторожнее по мере обучения. Он находит более надёжные решения.