Учёные Массачусетского технологического института (MIT), Университета Карнеги-Меллона, Нью-Йоркского университета и Стэнфорда представили систему искусственного интеллекта (ИИ), которая с убедительным преимуществом обыграла сильнейших игроков мира в Стратего. Как сообщает MIT News, система под названием Ataraxos завершила серию игр с чемпионом мира со счётом 15 побед, 1 поражение и 4 ничьи, а против сильнейших игроков чемпионата мира — со счётом 39-2. Исследование опубликовано в журнале Nature. До этого ни одной системе ИИ не удавалось достичь подобного результата. Стратего — настольная военная игра для двух игроков, в которой личность фигур соперника остаётся скрытой на протяжении всей партии.

Рекордный результат

Для практического испытания исследователи вывели Ataraxos на чемпионат мира. Система завершила серию против сильнейшего игрока в истории Стратего со счётом 15-1-4 — это самый большой отрыв, когда-либо достигавшийся против соперника такого уровня. Серия состояла из 20 партий, в которых система одержала 15 побед, потерпела 1 поражение и сыграла 4 ничьи. Общий счёт против других ведущих участников чемпионата составил 39-2 — система выиграла 39 из 41 партии. По данным MIT News, ни одна система ИИ до этого не обыгрывала сильнейших людей-игроков в Стратего с таким убедительным преимуществом.

Над исследованием совместно работали учёные четырёх университетов — MIT, Карнеги-Меллона, Нью-Йоркского университета и Стэнфорда. Тот факт, что система обыграла не только чемпиона, но и группу сильнейших участников чемпионата, показывает, что победа не случайна. Таким образом, Ataraxos стала первой в истории системой ИИ, обыгравшей чемпиона мира с убедительным преимуществом.

Как работает система

Ataraxos обучали методом обучения с подкреплением (reinforcement learning) — с помощью самоигры (self-play): система многократно играла сама с собой, вырабатывая базовую стратегию, дающую преимущество в Стратего. Исследователи разработали алгоритмы, сделавшие обучение заметно эффективнее, — в итоге система достигла чемпионского уровня при сравнительно небольшом обучающем бюджете. Как отмечает Ars Technica, система обыграла сильнейшего игрока в истории при сравнительно небольшом бюджете обучения.

Во время игры Ataraxos использует базовую стратегию как отправную точку, но перед каждым ходом дорабатывает свой выбор на месте. Для этого применяется метод, называемый планированием во время принятия решения (decision-time planning): генеративный ИИ оценивает через вероятности, какие фигуры скрыты у соперника, затем анализирует будущие ходы и выбирает лучший. По словам исследователей, именно этот метод позволил системе превзойти человека.

Эффективность обучения системы напрямую сравнивалась с предыдущей системой DeepMind DeepNash: Ataraxos достигла строго более высокого уровня игры — при этом оказалось достаточно менее одной сотой обучающих примеров и менее одной тридцатой самопробных партий. Иными словами, система не только оказалась сильнее предыдущего рекордсмена, но и потребовала на обучение заметно меньше ресурсов. Об этом ведущий автор исследования Габриэле Фарина сказал так:

«Система достигла строго более высокого уровня игры, чем DeepNash от DeepMind, — на это потребовалось менее одной сотой обучающих примеров и менее одной тридцатой самопробных партий», — сказал Габриэле Фарина.

В опубликованном в журнале Nature исследовании подробно изложены эти результаты эффективности, условия испытаний на чемпионате и сравнительный анализ с DeepNash.

Успех и в других играх

Чтобы показать, что метод работает не только для Стратего, а вообще, исследовательская группа адаптировала Ataraxos ещё для трёх игр с неполной информацией: скоростного Barrage Stratego, многопользовательской кооперативной карточной игры Hanabi и Dou dizhu, где двое игроков играют против третьего. В каждой из них система показала сверхчеловеческий результат. Как пишет MIT News, эти результаты подтверждают универсальность метода в различных условиях. Подробности результатов и обучения системы изложены в научном исследовании, опубликованном в журнале Nature.

Почему это достижение важно

Стратего — игра с неполной информацией: личность фигур соперника остаётся скрытой, пока они не столкнутся. Игроки расставляют фигуры на своей половине доски и пытаются захватить флаг соперника. Игры с неполной информацией долгие годы оставались для ИИ непреодолимым испытанием — Стратего именно такая игра. Поэтому она считается важным эталоном (benchmark) для проверки стратегического мышления систем ИИ. Как подчёркивает Ars Technica, игра со скрытой информацией долгое время ставила системы ИИ в тупик, а Ataraxos справилась с ней при сравнительно небольшом бюджете обучения. Этот результат также освещён в материале Ars Technica от 1 октября.