ИИ Ataraxos превзошел сильнейшего игрока в Stratego с минимальными затратами на обучение¶
8.0/10
Исследователи из Университета Карнеги — Меллона, MIT, Нью-Йоркского университета и Стэнфорда разработали алгоритм искусственного интеллекта Ataraxos для настольной игры с неполной информацией Stratego. В серии матчей система обыграла сильнейшего игрока в истории дисциплины Пима Нимейера со счетом 15:1 при четырех ничьих. Новый алгоритм превзошел систему DeepNash, продемонстрировав существенно более высокую силу игры при сокращении объема обучающих партий примерно в 34 раза. Кроме того, обучение Ataraxos потребовало относительно скромных ресурсов — всего 16 графических процессоров и бюджет в несколько тысяч долларов.
Контекст¶
В отличие от шахмат или го, «Стратего» представляет собой настольную игру с неполной информацией, где расстановка и ранги фигур соперника скрыты, а размер дерева игровых состояний многократно превосходит масштабы го. В 2022 году лаборатория DeepMind представила систему DeepNash, впервые достигшую уровня сильнейших экспертов-людей с помощью мультиагентного обучения с подкреплением. Однако предшествующий подход требовал миллиардов тренировочных партий и вычислительных мощностей стоимостью в миллионы долларов.
Значение для индустрии¶
Успех Ataraxos доказывает возможность эффективного моделирования стратегических решений в условиях высокой неопределенности без привлечения гигантских вычислительных кластеров.
Обсуждение в сообществе¶
Комментаторы отметили, что ключевым прорывом стала радикальная выборная эффективность обучения в среде, где скрытые данные исключают классический поиск по дереву ходов. В сообществе также обратили внимание на контраст между формальной дешевизной вычислительных ресурсов (16 GPU) и высочайшим уровнем исследовательской группы, стоящей за разработкой.