Quebrar a Enigma ainda era trabalho humano. Até a semana passada

A Enigma nunca foi só uma máquina com rotores e cabos. Ela era um problema de operação: milhares de combinações possíveis por dia, erro humano no meio, transcrição errada nos arquivos e, depois de 80 anos, um punhado de mensagens que ninguém conseguia ler. Quando falo de Astra e Opus quebrando a Enigma, não estou falando de nostalgia da Segunda Guerra. Estou falando de dois modelos de linguagem fazendo, em dois dias, o que um pesquisador levaria semanas ou meses para fazer.

Alan Turing é lembrado pelo teste que leva seu nome, aquela ideia de distinguir máquina e humano numa conversa. Mas o teste que realmente importou na vida dele foi outro: quebrar a Enigma nazista com o Bombe, um computador primitivo construído com sua equipe em Bletchley Park. Dá um certo desconforto pensar que agora são os descendentes distantes daquele esforço, os LLMs, que voltam aos arquivos para terminar o serviço.

O fato: duas mensagens, dois modelos, sete restantes

O que aconteceu foi direto. Carter Leffen, desenvolvedor, pegou o Astra, modelo mais novo da OpenAI, e pediu para ele caçar no banco de dados de mensagens Enigma uma mensagem ainda não quebrada e tentar decifrar. O modelo não só achou como resolveu uma mensagem travada desde 2005. Ele fez pesquisa de arquivo por conta própria, juntou pistas de contexto, construiu um simulador da máquina Enigma em código e recuperou o texto original. Depois ainda gerou um site interativo explicando o problema inteiro.

A validação veio de Frode Weierud, engenheiro elétrico aposentado que mantém o Crypto Cellar, uma espécie de arquivo vivo da criptologia com registros, recursos e o banco de dados de mensagens. Ele conferiu a solução de Leffen e disse que ficou em estado de admiração. Não é um elogio leve vindo de quem passou semanas fuçando arquivos do Bundesarchiv que o próprio modelo citou.

Dias depois, em 21 de setembro, outro criptanalista, Jack Willis, procurou Weierud com um segundo caso. Ele usou o Claude Opus 5 da Anthropic para quebrar uma mensagem diferente, ainda não resolvida. A abordagem foi menos autônoma: Willis deu bem mais orientação, inclusive apontando a assinatura conhecida com o nome de um oficial, que serviu como ponto de apoio para o ataque criptográfico. Funcionou. Hoje restam apenas sete mensagens Enigma não quebradas, além de uma em que o texto é conhecido mas o código ainda não foi reconstruído. Talvez não por muito tempo.

Como funciona: não foi mágica, foi engenharia teimosa

Olhando como operador, o interessante não é que o modelo é inteligente, e sim como ele orquestrou ferramentas. Nenhum LLM quebra Enigma no token seguinte. O que ele faz é reduzir incerteza em loop. Primeiro ele normaliza o problema: pega a mensagem interceptada, identifica a rede, a data provável, o procedimento de chaves do dia. Depois levanta hipóteses de crib, aquele trecho provável de texto claro como nomes, saudações militares ou relatórios meteorológicos. Com isso ele escreve e executa um simulador da Enigma, testa rotores, posições de anel e plugues, pontua os resultados por plausibilidade linguística em alemão e itera.

O pulo aqui foi a parte de pesquisa arquivística. O Astra não ficou só no prompt. Pelos logs, ele saiu buscando contexto em arquivos públicos, cruzou referências do governo alemão e discutiu até mensagens de uma coleção privada que não estão no Crypto Cellar. Weierud ainda não sabe se o modelo realmente acessou esse material, se achou cópias espalhadas online ou se inferiu a existência a partir de citações. Isso importa porque mostra o modo agente real: navegar, ler PDF escaneado, lidar com erro de OCR, voltar atrás quando a transcrição original tem erro de operador de 1940.

Sobre custo e latência, ninguém publicou a conta, então aqui vai inferência plausível a partir de como esses agentes operam hoje. Uma tarefa assim deve envolver dezenas a centenas de chamadas com contexto longo, execução de código e navegação, algo na casa de poucas dezenas de dólares em API se bem orquestrada, talvez mais de cem se deixar o agente solto sem limite de passos. Latência de horas, não segundos, com maior parte do tempo gasta em busca e teste de hipóteses, não em inferência pura. O gargalo não é o tamanho do modelo, é a qualidade do harness: simulador correto, avaliação automática boa, limite de tentativas e memória de trabalho para não repetir o mesmo rotor cem vezes.

O que isso muda na prática

Quem ganha com isso é quem vive de análise difícil e pouco estruturada. Pense em times de segurança, forense digital, threat intel e até manutenção de sistemas legados. Se um agente consegue lidar com documentação incompleta, erro de transcrição e máquina antiga sem manual perfeito, ele consegue lidar com aquele seu sistema interno que ninguém documentou direito. Quem perde é quem achava que obscuridade histórica era proteção. Arquivo esquecido, cifra antiga, protocolo proprietário: tudo isso agora é legível se houver contexto suficiente na internet para ancorar a busca.

Para criptografia moderna, calma. Isso não quebra AES ou RSA. Enigma é fraca para os padrões atuais e essas mensagens quebradas dependiam de erros e de metadados. Mas o recado operacional é claro: a fronteira entre quebra teórica e quebra prática encolheu. O que antes exigia um criptanalista sênior com paciência de monge agora pode começar com um agente bem instruído e um avaliador humano no fim.

Uma ação prática para fazer já: pegue um problema travado do seu backlog, aquele ticket de integração antiga, log criptografado ou formato proprietário, e monte um loop agente mais simulador. Dê ao modelo um executor de código, acesso aos seus arquivos internos e uma função de pontuação clara do que é um bom resultado. Não peça a resposta final. Peça para ele construir a ferramenta que testa respostas. Foi exatamente isso que resolveu a Enigma: não adivinhar a chave, e sim construir a máquina que permite testar mil chaves por minuto.

  • Separe texto cifrado, contexto histórico e critérios de sucesso em arquivos distintos para o agente não misturar tudo.
  • Exija que cada hipótese gere código executável e log reproduzível, não só texto convincente.
  • Feche o loop com validação humana de um especialista, como fez Weierud, antes de declarar vitória.

Isso escala ou só move o gargalo?

Aqui fica minha dúvida real. O Astra se comportou como um criptanalista e arquivista muito profissional, nas palavras de quem validou. Mas profissional por dois dias custa caro se você escalar para centenas de tarefas. O custo compensa quando o problema vale muito, como inteligência ou pesquisa histórica. Para o dia a dia, sem um harness enxuto, o agente vai queimar token passeando em arquivo irrelevante. E tem outro ponto incômodo: de onde veio aquela menção à coleção privada? Se o modelo acessou algo que não deveria, ou alucinou uma fonte que por acaso parecia certa, temos um problema diferente. Em segurança, procedência importa tanto quanto resultado.

Também não dá para ignorar que o caso do Claude foi bem mais guiado. Isso sugere que ainda precisamos do humano para dar o crib inicial, a intuição de onde atacar. O modelo acelera a parte chata e sistemática, mas não elimina a necessidade de saber o que procurar. Resolve ou só muda o problema? Resolve a execução, move o gargalo para formulação e validação. Que, para ser honesto, é onde a maioria dos times já trava hoje.

Conclusão que fica

Duas mensagens Enigma caíram em uma semana, uma de forma quase autônoma, outra com ajuda humana. O recado não é sobre nazismo ou nostalgia, é sobre operação: agentes que pesquisam, codam e testam já fazem trabalho de especialista em dados bagunçados. A pergunta que fica para você é simples: qual problema impossível aí dentro da sua empresa só está esperando alguém montar o simulador certo e deixar o modelo tentar mil vezes?