ИИ победил рекордсмена по игре в Stratego благодаря архитектуре из двух нейросетей
Новая модель ИИ одержала победу над лучшим игроком в Stratego в истории с минимальными вычислительными затратами благодаря второй нейросети, предназначенной для предсказания скрытых фигур.
The Global Wire Newsroom ·
Link preview · horizonglobalnews.com
ИИ победил рекордсмена по игре в Stratego благодаря архитектуре из двух нейросетей
Новая модель ИИ одержала победу над лучшим игроком в Stratego в истории с минимальными вычислительными затратами благодаря второй нейросети, предназначенной для предсказания скрытых фигур.
Эта статья переведена автоматически нашим редакционным ИИ с английского оригинала. Читать на английском

Искусственный интеллект добился знаковой победы в области принятия сложных решений, одолев сильнейшего игрока в истории Stratego при относительно низких вычислительных затратах. Согласно репортажу Jacek Krywko, этот успех стал возможен благодаря внедрению отдельной вторичной нейросети, предназначенной исключительно для определения скрытых фигур соперника. Разделив стратегическое планирование и дедукцию скрытой информации, система разрешила одну из самых сложных проблем теории игр — принятие решений в условиях глубокой неопределенности и блефа без необходимости в огромных вычислительных ресурсах. Это достижение знаменует собой важный этап в исследованиях ИИ, направленный на целевую архитектурную эффективность в условиях неполной информации.
## Key facts - Модель искусственного интеллекта одержала победу над самым высокорейтинговым игроком в Stratego в истории, согласно репортажу Jacek Krywko. - Система использует вторичную нейросеть, полностью посвященную прогнозированию типов и рангов скрытых фигур противника. - Сложность дерева игры Stratego составляет порядка 10^535, что значительно превосходит пространство состояний шахмат (10^123) и Go (10^360). - ИИ достиг уровня чемпиона мира при ограниченном вычислительном бюджете, что контрастирует с прошлыми ресурсоемкими достижениями в области ИИ. - В отличие от традиционных настольных игр с полной информацией, Stratego требует от агентов принятия решений в условиях частичной видимости, блефа и неполных данных.
## What happened Разработка игрового искусственного интеллекта исторически опиралась на два основных столпа: исчерпывающие деревья поиска для игр с полной информацией, таких как шахматы, и теоретико-игровые аппроксимации равновесия для игр с неполной информацией, таких как покер. Stratego объединяет в себе наибольшие сложности обеих областей. Игра включает в себя поле 10 на 10 клеток, по 40 фигур у каждого игрока, тайную начальную расстановку и постоянный «туман войны».
Согласно репортажу Jacek Krywko, ключевой технический прорыв новой ИИ-системы для игры в Stratego заключается в использовании архитектуры из двух нейросетей. В стандартном обучении с подкреплением одна нейросеть часто отвечает за оценку позиций на доске, выполнение тактических маневров и одновременный расчет вероятностей в отношении скрытых фигур противника. Такой единый подход заставляет модель обрабатывать огромные распределения вероятностей, что требует колоссальных вычислительных ресурсов для эффективного обучения.
Новая система разделяет эти обязанности. Основная сеть отвечает за тактическое планирование и выбор ходов. Работающая параллельно с ней вторичная нейросеть функционирует исключительно как модуль логического вывода — специализированный оценщик «состояния убеждений» (belief state). По ходу игры каждый ход противника дает косвенные подсказки о скрытом типе фигуры. Например, юнит, быстро перемещающийся по нескольким открытым клеткам, выдает в себе Разведчика (Scout), тогда как неподвижная фигура в заднем ряду может оказаться Бомбой (Bomb) или Флагом (Flag). Анализируя траектории движения и исходы сражений, вторичная сеть непрерывно обновляет матрицу вероятностей для каждой скрытой фигуры на доске.
Полученное состояние убеждений затем передается непосредственно в основную сеть принятия решений. Делегируя дедукцию скрытых фигур специализированному подмодулю, ИИ кардинально снижает математическую сложность, необходимую при выборе хода, что позволяет достичь высокого уровня игры при скромном бюджете.
## Why it matters Победа в Stratego представляет собой фундаментальный сдвиг в том, как искусственный интеллект справляется с неопределенностью реального мира. Хотя такие исторические вехи, как победа Deep Blue от IBM над Garry Kasparov в 1997 году или победа AlphaGo от DeepMind над Lee Sedol в 2016 году, продемонстрировали возможности машин в средах с полной информацией, задачи реального мира редко предоставляют полную видимость. На финансовых рынках, в военной стратегии, кибербезопасности и при ведении переговоров лицам, принимающим решения, приходится действовать на основе неполных данных, учитывая при этом возможный блеф и обман со стороны оппонента.
Stratego широко признана специалистами по компьютерным наукам как один из сложнейших полигонов для проверки принятия решений в условиях неопределенности. Имея по 40 фигур с каждой стороны и сложность дерева игры, оцениваемую в 10^535 (по сравнению с 10^123 для шахмат и 10^360 для Go), игра предлагает астрономическое количество конфигураций состояний. Более того, поскольку ранги фигур скрыты до момента столкновения, игра требует управления рисками, сбора информации и умения блефовать.
Демонстрация того, что производительность мирового уровня может быть достигнута с помощью модульной и экономичной архитектуры, имеет важнейшее практическое значение. Обучение высокоуровневого ИИ часто стоит миллионы долларов инвестиций в вычислительную инфраструктуру. Показывая, что специализированная вторичная сеть способна эффективно разрешать скрытые переменные, это исследование создает основу для легких моделей ИИ. Промышленные сферы — такие как автономная навигация дронов в условиях отсутствия сигналов датчиков, алгоритмическая торговля при асимметричной информации и обнаружение сетевых угроз — могут использовать вывод на основе двух нейросетей для быстрого принятия решений без привлечения мощного облачного оборудования.
## The background История ИИ в играх давно служит ключевым ориентиром для оценки вычислительного прогресса. В мае 1997 года Deep Blue от IBM одержала победу над чемпионом мира по шахматам Garry Kasparov в матче из шести партий, используя специализированное оборудование, оценивавшее 200 миллионов позиций на доске в секунду. В марте 2016 года AlphaGo от DeepMind победила 18-кратного чемпиона мира Lee Sedol со счетом 4:1 в Go, используя глубокие нейросети в сочетании с поиском по дереву Монте-Карло.
Как шахматы, так и Go являются играми с полной информацией, где игроки в любой момент видят точное положение каждой фигуры. Впоследствии внимание сместилось в сторону игр с неполной информацией. В июле 2019 года Carnegie Mellon University и Facebook AI представили Pluribus — ИИ, который победил элитных профессиональных игроков в безлимитный техасский холдем (No-Limit Texas Hold'em) на шестерых игроков, используя метод минимизации контрфактического сожаления Монте-Карло.
Stratego оставалась куда более сложной задачей из-за сочетания пространственной стратегии на доске и скрытой информации. Изобретенная в ее современном виде Jacques Johan Mogendorff в 1946 году и позже коммерциализированная компаниями Milton Bradley и Hasbro, Stratego сводит двух игроков на доске 10 на 10 клеток с двумя непроходимыми озерами размером 2 на 2. Каждый игрок управляет 40 фигурами: один Флаг (Flag), шесть Бомб (Bombs), один Шпион (Spy) и иерархия военных рангов от Генерала (General) и Маршала (Marshal) до Саперов (Miners) и Разведчиков (Scouts).
В декабре 2022 года DeepMind опубликовала статью в журнале Science, представив DeepNash — ИИ-систему, достигшую экспертного человеческого уровня в Stratego без использования явных деревьев поиска. DeepNash использовала теоретико-игровой алгоритм Regularized Nash Dynamics (R-NaD) для обучения стабильной стратегии равновесия Нэша посредством самообучения (self-play). Хотя DeepNash доказала, что ИИ может достигать экспертного уровня в Stratego, победа над сильнейшими игроками-людьми при ограниченном вычислительном бюджете оставалась открытой задачей вплоть до этого последнего достижения с двухсетевой архитектурой.
## Reaction Сообщения о прорыве вызвали широкий интерес в сообществе исследователей искусственного интеллекта и среди любителей настольных игр. Исследователи в области компьютерных наук отметили эффективность двухсетевой архитектуры, подчеркнув, что разделение логического вывода и стратегического исполнения воспроизводит когнитивные структуры человека, где отдельные области мозга обрабатывают сенсорное восприятие, тогда как другие отвечают за исполнительное планирование.
В сообществе игроков в Stratego участники и организаторы турниров оценивают последствия появления ИИ, способного стабильно побеждать ведущих гроссмейстеров-людей. Мастера-люди полагаются на психологический анализ, отслеживание привычек перемещения противника и подачу ложных сигналов для заманивания вражеских фигур на Бомбы или Шпионов. Открытие того, что вторичная нейросеть может точно определять типы фигур на основе поведенческих паттернов движения, свидетельствует о том, что модели машинного обучения теперь могут распознавать схемы человеческого блефа эффективнее, чем считалось ранее.
Разработчики промышленного ИИ и оборонные аналитики также оценивают, как этот экономичный подход к логическому выводу может быть адаптирован для логистики в реальном времени, автономных систем и стратегического моделирования боевых действий в условиях неполных или задерживающихся данных датчиков.
## What we don't know yet Несмотря на заявленный прорыв, некоторые специфические детали относительно архитектуры системы и метрик ее производительности остаются неподтвержденными в репортаже Jacek Krywko.
Во-первых, имя сильнейшего игрока-человека, потерпевшего поражение в тестовых матчах, не разглашается, равно как и общее количество сыгранных партий или точное соотношение побед и поражений, полученное в ходе серии тестов. Стандартное тестирование ИИ обычно требует проведения сотен контрольных матчей против нескольких соперников топ-уровня для подтверждения статистической значимости.
Во-вторых, точный вычислительный бюджет и характеристики оборудования, использованного для обучения и запуска системы, не раскрыты полностью. Хотя затраты описываются как низкие, точные данные о часах работы GPU, расходах на обучение или энергопотреблении по сравнению с предыдущими системами, такими как DeepNash от DeepMind, в имеющихся материалах отсутствуют.
Наконец, остается неизвестным, опирается ли двухсетевая система исключительно на обучение с подкреплением путем игры с самой собой (self-play) или же она включала базы данных партий людей на этапе предварительного обучения.
## What to watch Несколько ключевых моментов и этапов позволят прояснить значение этой системы в ближайшие месяцы:
- Рецензируемая публикация: ожидается официальный выпуск рецензируемой научной статьи с подробным описанием полной архитектуры сети, алгоритмического кода и параметров обучения в научном журнале или на конференции. - Прямое сравнение ИИ-систем: критически важной оценкой станут прямые матчи между этой двухсетевой моделью и существующими передовыми движками Stratego, включая DeepNash от DeepMind. - Доступность кода: опенсорс-сообщество будет следить за тем, опубликуют ли исследователи веса модели или репозитории с кодом для проведения независимой проверки. - Показательные турниры: будущие матчи против более широкого круга гроссмейстеров по официальным международным правилам подтвердят, сохраняется ли эффективность системы при различных стилях игры. - Адаптация к другим сферам: внедрение двухсетевой архитектуры в неигровых областях, таких как финансовое моделирование или многоагентная робототехника, проверит ее полезность в условиях реального операционного шума.
Этот материал основан на оригинальном репортаже Jacek Krywko.
Источник: Jacek Krywko



