Quando o blefe custa mais que o cálculo

Stratego sempre foi o pesadelo silencioso de quem constrói agentes para jogos. Não porque o tabuleiro seja maior ou as regras mais difíceis, mas porque quase nada está visível. São 40 peças de cada lado posicionadas de costas, com mais de 10 elevado a 33 arranjos possíveis só na abertura. Você não joga apenas a posição atual, joga contra o histórico de sondagens, ameaças falsas e pequenas informações vazadas a cada ataque. Para um operador, esse é o pior tipo de ambiente: cada ação revela intenção e muda o valor das próximas decisões.

Foi exatamente aí que a nova IA chamada Ataraxos resolveu cutucar. Pesquisadores de Carnegie Mellon, NYU, Stanford e MIT publicaram na Nature um sistema que não só bate gente boa, ele atropelou Pim Niemeijer, o nome mais decorated da história do Stratego, com quatro títulos mundiais, 15 títulos holandeses e mais de 600 semanas como número um do ranking. Em série oficial de 20 partidas, foram 15 vitórias, uma derrota e quatro empates. Isso não é margem apertada, é domínio.

O fato

O que aconteceu é direto e sem maquiagem. A equipe treinou o Ataraxos apenas com self-play, sem nenhum dado humano, durante uma semana em 16 GPUs Nvidia H100, mais quatro dias em quatro GPUs para uma rede auxiliar chamada de belief network. Custo estimado a preços de 2025: menos de 8 mil dólares. O artigo coloca isso em perspectiva brutal: cerca de 1/500 do custo computacional, 1/30 dos jogos de self-play e 1/100 dos exemplos de treino em relação ao DeepNash, o sistema anterior do DeepMind para o mesmo jogo.

O contraste com o DeepNash dói para quem acompanha infraestrutura. O sistema do DeepMind teria usado 1.024 nós de TPU por dois a três meses, algo entre 3 milhões e 4,5 milhões de dólares na conta atual. E mesmo assim, no mundial de 2023, o DeepNash fez 19 pontos em 28 jogos mas perdeu para a maioria dos tops, incluindo o próprio Niemeijer. Não houve confronto direto entre Ataraxos e DeepNash porque, segundo os autores, o código do DeepNash já não roda mais. A equipe chegou a oferecer a infraestrutura para o duelo, mas não foi possível reconstruir o ambiente.

Como funciona na visão de operador

Em jogo de informação imperfeita, o valor de um lance depende do passado e do que o oponente acredita sobre você, não só do futuro da posição. Métodos herdados da IA de poker tentaram resolver isso com busca e modelagem de crenças, mas o custo explode com a quantidade de informação escondida. No Texas Holdem você tem 1.326 mãos iniciais possíveis. No Stratego, o espaço de setups já começa na casa dos 10 elevado a 33. Força bruta de busca não escala, e amostragem ingênua entra em loop ou vira caos.

A aposta do Ataraxos foi em regularização forte com decaimento programado. Pense como um imposto contra previsibilidade. No início do treino, o sistema é forçado a espalhar muito seus setups e lances, mesmo que pareçam ruins, e dá passos grandes de aprendizado. Isso impede que ele trave cedo em uma estratégia explorável, que é o erro clássico em Stratego onde jogador previsível vira presa. Com o tempo, os autores afrouxam essa pressão e reduzem o tamanho dos updates. O agente passa a jogar de forma mais deliberada, refinando com correções pequenas. É um schedule simples na ideia, mas difícil de acertar na prática porque informalmente segura o treino para não ficar girando em círculos.

O segundo truque foi engenharia pura. A equipe escreveu um simulador próprio totalmente em GPU, o que provavelmente eliminou o gargalo clássico de CPU para rollout e permitiu gerar milhões de partidas com latência baixa e custo controlado. A belief network entra como módulo separado, treinado à parte, para estimar a distribuição provável das peças ocultas a partir do histórico observável. Em inferência, isso deve funcionar como um prior leve que guia a política sem exigir árvore de busca gigante a cada turno. É plausível que a arquitetura final seja uma política destilada e rápida, barata para servir, com a parte pesada ficando toda no treino. Sem confirmação oficial de latência ou tamanho do modelo, mas pelo perfil de treino acadêmico, estamos falando de algo que cabe em operação normal, não em cluster de laboratório gigante.

O que isso muda na prática

Quem ganha aqui não é só a comunidade de jogos. Quem trabalha com agentes em ambientes parcialmente observáveis, como negociação, atendimento, segurança, robótica com oclusão ou até trading com order flow incompleto, acaba de ganhar uma referência de custo. Se um time universitário com recurso limitado consegue superar um esforço multimilionário com 500 vezes menos computação, o recado é claro: eficiência amostral e simulador bem feito valem mais que escalar TPU às cegas. Para startups, isso abre espaço para treinar políticas robustas com orçamento de nuvem realista, na casa de poucos milhares de dólares por experimento.

  • Mapeie sua informação escondida: liste o que seu agente não vê e como cada ação vaza intenção, depois teste variação forçada no treino antes de aumentar modelo.
  • Invista no simulador primeiro: um ambiente rápido em GPU pode cortar mais custo que trocar de modelo, principalmente se seu gargalo for geração de episódios.
  • Monitore explorabilidade: crie um adversário que pune padrões repetidos e meça taxa de exploit antes de falar em super-humano.

Na prática, a ação imediata para builders é revisar o schedule de entropia e regularização. Muita equipe mantém entropia fixa ou decai de forma preguiçosa, e depois culpa o modelo pela convergência prematura. O caso Ataraxos sugere tratar aleatoriedade como recurso estratégico, alta no começo para cobrir o espaço de blefes, baixa e precisa no fim para extrair Elo. Se você opera LLM com tool use ou multiagente com estado oculto, vale replicar a lógica: force diversidade de trajetórias no início do fine-tuning com RL, depois congele o estilo e otimize execução.

Tensão real: isso escala ou só funcionou no Stratego

A dúvida honesta é se o truque transfere. Stratego tem regras fechadas, simulador perfeito e recompensa clara de vitória, derrota ou empate. No mundo real, o simulador é imperfeito, a recompensa é ruidosa e o oponente não segue as regras do tabuleiro. Regularização forte ajuda a não travar, mas também pode mascarar falta de modelo de mundo. E tem o ponto incômodo do custo: 8 mil dólares é o custo do run final que deu certo, não a soma de todos os experimentos falhados, ajustes de schedule e noites de debug com cluster universitário. Ainda assim, mesmo multiplicando por 10 vezes para contar o processo todo, continua ordens de magnitude abaixo do DeepNash.

Outro ponto que me deixa pensativo é a fragilidade da avaliação. Vencer um humano genial em 20 jogos é impressionante, mas 20 jogos em jogo com variância alta de setup ainda deixa cauda estatística. O placar de 15 a 1 com 4 empates é convincente, mas quero ver robustez contra pool diverso de estilos, contra setups adversariais e contra versões do próprio agente. Se a política aprendeu a explorar manias específicas do meta atual, o Elo infla. Os autores falam em super-humano, e pelos números parece justo, mas super-humano em um snapshot do meta não é o mesmo que solved.

Conclusão

Ataraxos derrubou um dos últimos bastiões humanos nos board games clássicos com menos computação, mais eficiência e engenharia focada em variação. A lição para quem constrói é simples e desconfortável: talvez seu problema não seja falta de GPU, e sim falta de aleatoriedade bem calibrada. Será que seu agente atual sobreviveria a um adversário que pune exatamente o seu padrão favorito?