IA vence campeão histórico de Stratego usando arquitetura de rede neural dupla
Um novo modelo de IA derrotou o melhor jogador humano de Stratego da história com um orçamento reduzido, utilizando uma segunda rede neural dedicada a prever peças ocultas.
The Global Wire Newsroom ·
Link preview · horizonglobalnews.com
IA vence campeão histórico de Stratego usando arquitetura de rede neural dupla
Um novo modelo de IA derrotou o melhor jogador humano de Stratego da história com um orçamento reduzido, utilizando uma segunda rede neural dedicada a prever peças ocultas.
Este artigo foi traduzido automaticamente pela IA da nossa redação a partir do original em inglês. Ler em inglês

A inteligência artificial alcançou uma vitória histórica na tomada de decisões complexas ao derrotar o jogador humano melhor classificado na história do Stratego, operando com um orçamento computacional relativamente baixo. De acordo com uma reportagem de Jacek Krywko, a conquista foi possível com a introdução de uma rede neural secundária dedicada, projetada especificamente para inferir a identidade das peças ocultas do adversário. Ao separar o planejamento estratégico da dedução de informações ocultas, o sistema resolveu um dos desafios mais persistentes da teoria dos jogos: navegar por incertezas profundas e enganos sem exigir recursos computacionais massivos. A realização marca uma transição fundamental na pesquisa de IA em direção à eficiência arquitetônica direcionada em cenários de informação imperfeita.
## Principais fatos - Um modelo de inteligência artificial derrotou o jogador humano com a maior pontuação na história do Stratego, de acordo com uma reportagem de Jacek Krywko. - O sistema usa uma rede neural secundária dedicada inteiramente a prever as identidades e patentes de peças não vistas do adversário. - O Stratego possui uma complexidade na árvore de jogos de aproximadamente 10^535, superando amplamente o espaço de estados do xadrez (10^123) e do Go (10^360). - A IA atingiu capacidades de nível de campeão mundial sob um orçamento computacional limitado, contrastando com referências anteriores de IA de altos recursos. - Ao contrário dos jogos de tabuleiro tradicionais de informação perfeita, o Stratego exige que os agentes tomem decisões sob visibilidade parcial, blefes e dados incompletos.
## O que aconteceu O desenvolvimento de inteligência artificial para jogos baseou-se historicamente em dois pilares principais: árvores de busca exaustivas para jogos de informação perfeita, como o xadrez, e aproximações de equilíbrio baseadas na teoria dos jogos para jogos de informação imperfeita, como o poker. O Stratego combina as maiores dificuldades de ambos os domínios. Ele possui um grande tabuleiro de 10 por 10, 40 peças por jogador, posições iniciais secretas e uma névoa de guerra contínua.
De acordo com uma reportagem de Jacek Krywko, o avanço técnico crucial por trás da nova IA de Stratego reside na implementação de um sistema de rede neural dupla. No aprendizado por reforço padrão, uma única rede neural é frequentemente encarregada de avaliar posições no tabuleiro, executar manobras táticas e, simultaneamente, estimar probabilidades sobre as unidades ocultas do adversário. Essa abordagem unificada força o modelo a processar distribuições de probabilidade massivas, exigindo recursos de computação extremos para aprender de forma eficaz.
O novo sistema divide essas responsabilidades. A rede principal cuida do planejamento tático e das escolhas de movimento. Operando ao lado dela, uma rede neural secundária funciona exclusivamente como um motor de inferência — um estimador dedicado do "estado de crença". À medida que o jogo avança, cada movimento feito por um adversário fornece pistas sutis sobre a identidade oculta de uma peça. Por exemplo, uma unidade que se move rapidamente por várias casas abertas revela ser um Scout, enquanto uma unidade estacionária na fileira de trás pode ser uma Bomb ou a Flag. Ao analisar as trajetórias dos movimentos e os resultados dos combates, a rede secundária atualiza continuamente uma matriz de probabilidade para cada peça oculta no tabuleiro.
Esse estado de crença inferido é então passado diretamente para a rede de decisão principal. Ao delegar a dedução de peças ocultas a um submódulo especializado, a IA reduz drasticamente a complexidade matemática necessária durante a seleção de movimentos, permitindo um desempenho de alto nível com um orçamento reduzido.
## Por que isso importa A vitória no Stratego representa uma mudança fundamental na forma como a inteligência artificial lida com a incerteza no mundo real. Embora marcos históricos como a vitória do Deep Blue da IBM sobre Garry Kasparov em 1997 ou a derrota de Lee Sedol pelo AlphaGo da DeepMind em 2016 tenham demonstrado as capacidades das máquinas em ambientes de informação perfeita, os desafios do mundo real raramente oferecem visibilidade total. Em mercados financeiros, estratégia militar, cibersegurança e negociações contratuais, os tomadores de decisão devem agir com base em dados incompletos enquanto antecipam os blefes e enganos do adversário.
O Stratego é amplamente reconhecido por cientistas da computação como um dos campos de teste definitivos para a tomada de decisões sob incerteza. Com 40 peças de cada lado e uma complexidade da árvore de jogos estimada em 10^535 — em comparação com 10^123 para o xadrez e 10^360 para o Go —, o jogo apresenta um número astronômico de configurações de estado. Além disso, como as patentes das peças ficam ocultas até que o combate ocorra, o jogo exige gestão de risco, coleta de informações e blefe.
Demonstrar que um desempenho de nível mundial pode ser alcançado por meio de uma arquitetura modular e econômica traz grandes implicações práticas. O treinamento de IA de ponta geralmente custa milhões de dólares em infraestrutura de computação. Ao mostrar que uma rede secundária especializada pode resolver variáveis ocultas de forma eficiente, essa pesquisa fornece um modelo para modelos leves de IA. Aplicações industriais — como navegação autônoma de drones em ambientes sem sinal de sensores, negociação algorítmica sob informação assimétrica e detecção de ameaças de rede — podem aproveitar a inferência de rede dupla para tomar decisões rápidas sem a necessidade de infraestrutura de nuvem corporativa.
## Histórico A história da IA em jogos tem servido há muito tempo como uma referência fundamental para o progresso computacional. Em maio de 1997, o Deep Blue da IBM derrotou o campeão mundial de xadrez Garry Kasparov em um confronto de seis partidas, utilizando hardware personalizado que avaliava 200 milhões de posições no tabuleiro por segundo. Em março de 2016, o AlphaGo da DeepMind derrotou o 18 vezes campeão mundial Lee Sedol por 4 a 1 no Go, utilizando redes neurais profundas combinadas com a busca em árvore Monte Carlo.
Tanto o xadrez quanto o Go são jogos de informação perfeita, nos quais os jogadores observam a posição exata de cada peça a todo momento. A atenção mudou posteriormente para os jogos de informação imperfeita. Em julho de 2019, a Carnegie Mellon University e o Facebook AI apresentaram o Pluribus, uma IA que derrotou jogadores profissionais de elite no poker No-Limit Texas Hold'em para seis jogadores, utilizando a minimização de arrependimento contrafactual de Monte Carlo.
O Stratego continuou sendo um desafio muito mais difícil devido à sua combinação de estratégia espacial no tabuleiro e informação oculta. Inventado em sua forma moderna por Jacques Johan Mogendorff em 1946 e posteriormente comercializado pela Milton Bradley e pela Hasbro, o Stratego coloca dois jogadores um contra o outro em um tabuleiro de 10 por 10 com dois lagos intransponíveis de 2 por 2. Cada jogador controla 40 peças: uma Flag, seis Bombs, um Spy e uma hierarquia de patentes militares que vai de General e Marshal até Miners e Scouts.
Em dezembro de 2022, a DeepMind publicou um artigo na Science apresentando o DeepNash, um sistema de IA que alcançou desempenho de nível de especialista humano no Stratego sem árvores de busca explícitas. O DeepNash usou um algoritmo de teoria dos jogos chamado Regularized Nash Dynamics (R-NaD) para aprender uma política estável de equilíbrio de Nash por meio do autoaprendizado (self-play). Embora o DeepNash tenha provado que a IA poderia atingir níveis de especialista no Stratego, derrotar os jogadores humanos com maior pontuação com um orçamento computacional limitado continuava sendo um desafio em aberto até este recente avanço com rede dupla.
## Reações O avanço relatado despertou amplo interesse nos círculos de pesquisa em inteligência artificial e jogos de tabuleiro competitivos. Pesquisadores de ciência da computação destacaram a eficiência da arquitetura de rede dupla, ressaltando que separar a inferência da execução estratégica reflete as estruturas cognitivas humanas, em que regiões neurais distintas processam a percepção sensorial enquanto outras gerenciam o planejamento executivo.
Dentro da comunidade competitiva de Stratego, jogadores e organizadores de torneios estão avaliando as implicações de uma IA capaz de derrotar consistentemente os principais grandes mestres humanos. Os mestres humanos dependem fortemente de perfis psicológicos, do rastreamento de hábitos de movimento dos adversários e do envio de sinais falsos para atrair peças inimigas para Bombs ou Spies. A revelação de que uma rede neural secundária pode deduzir com precisão a identidade das peças com base em padrões comportamentais de movimento sugere que modelos de aprendizado de máquina agora podem identificar padrões de blefe humano de forma mais eficaz do que se supunha anteriormente.
Desenvolvedores de IA industrial e analistas de defesa também estão avaliando como essa estrutura de inferência de baixo custo pode ser adaptada para logística em tempo real, sistemas autônomos e simulações estratégicas de guerra (wargaming) onde os dados de sensores são incompletos ou atrasados.
## O que ainda não sabemos Apesar do avanço relatado, vários detalhes específicos sobre a arquitetura do sistema e as métricas de desempenho permanecem não confirmados na reportagem de Jacek Krywko.
Em primeiro lugar, a identidade específica do jogador humano melhor classificado derrotado nas partidas de teste não foi divulgada explicitamente, assim como não foram informados o número total de jogos disputados ou a taxa exata de vitórias e derrotas alcançada durante a série de testes. As avaliações padrão de IA normalmente exigem centenas de partidas controladas contra múltiplos adversários de alto nível para provar a significância estatística.
Em segundo lugar, o orçamento computacional exato e as especificações de hardware usadas para treinar e executar o sistema não foram totalmente detalhados. Embora descrito como de baixo custo, dados precisos detalhando horas de GPU, despesas de treinamento ou consumo de energia em relação a sistemas anteriores, como o DeepNash da DeepMind, foram omitidos na cobertura disponível.
Por fim, continua desconhecido se o sistema de rede dupla depende puramente do aprendizado por reforço por autoaprendizado (self-play) ou se incorporou bancos de dados de partidas humanas durante o pré-treinamento.
## O que acompanhar Vários pontos decisivos e marcos importantes esclarecerão o impacto do sistema nos próximos meses:
- Publicação revisada por pares: Fique atento ao lançamento oficial de um artigo de pesquisa revisado por pares detalhando a arquitetura completa da rede, o código algorítmico e os parâmetros de treinamento em uma revista científica ou conferência. - Testes comparativos diretos entre IAs: Uma avaliação crítica envolverá partidas diretas entre este modelo de rede dupla e os motores de Stratego mais avançados existentes, incluindo o DeepNash da DeepMind. - Disponibilidade do código: A comunidade de código aberto monitorará se os pesquisadores liberarão os pesos do modelo ou os repositórios de código, permitindo a validação independente. - Torneios de exibição: Partidas futuras contra um elenco mais amplo de grandes mestres sob regras internacionais oficiais confirmarão se o desempenho do sistema se mantém diante de diferentes estilos de jogo. - Adaptação a novos domínios: A implementação da arquitetura de rede dupla em domínios fora dos jogos, como modelagem financeira ou robótica multiagente, testará sua utilidade sob o ruído operacional do mundo real.
Esta reportagem é baseada na cobertura jornalística original de Jacek Krywko.
Fonte: Jacek Krywko



