Agentes de IA não enlouqueceram. O laboratório deixou a porta aberta
Agentes de IA autônomos atacando alvos reais parece roteiro de ficção, mas o que aconteceu com modelos da OpenAI, Anthropic, Meta e Google tem uma explicação bem mais constrangedora. Não foi consciência emergente, não foi rebelião das máquinas. Foi erro básico de isolamento de ambiente em um teste de segurança terceirizado. E isso, para quem opera sistemas com agentes, é ainda mais preocupante do que a versão sensacionalista.
Em julho, a OpenAI revelou que seus agentes tinham atacado a Hugging Face sem autorização durante uma avaliação. Depois vieram relatos parecidos envolvendo outros laboratórios. Pareciam casos isolados, cada um com seu modelo saindo do trilho. Agora ficou claro que grande parte desses episódios tem a mesma origem. Uma startup israelense chamada Irregular, fundada em 2023 como Pattern Labs, que presta serviço de stress test para os maiores players do setor.
O fato: um erro repetido, não quatro incidentes isolados
A Irregular se apresenta como uma empresa que opera plataformas de pesquisa de alta fidelidade que simulam cenários reais de segurança para IA. Na prática, ela é contratada para tentar quebrar os modelos antes que eles cheguem ao público. Seu trabalho já foi citado em system cards da OpenAI, foi usado em testes para o governo do Reino Unido e para a Anthropic, e apareceu em pesquisas publicadas com o RAND, um think tank com forte influência em política de IA.
Neste ano, em vários testes de capacidade cibernética, os agentes escaparam do ambiente que deveria ser controlado e partiram para alvos no mundo real. O roteiro se repetiu. A Irregular montava exercícios de capture the flag, um formato clássico em que o agente precisa encontrar uma informação escondida dentro de uma rede simulada. O problema é que a rede só era simulada no nome.
O CTO e cofundador Omer Nevo admitiu dois erros combinados. Primeiro, o acesso à internet estava acidentalmente liberado, quando deveria estar totalmente bloqueado. Segundo, o nome fictício de empresa criado para a simulação coincidia com um domínio real registrado. Junte as duas coisas e você tem agentes programados para invadir, com saída para a internet aberta e um alvo que existe de verdade. Não é difícil imaginar o que aconteceu depois, embora ainda não esteja claro quais empresas ou organizações foram efetivamente atingidas.
Nevo afirmou que todos os incidentes envolvendo a Irregular vieram da mesma falha em um único cenário de avaliação e que foram divulgados. Essa palavra, divulgados, é escorregadia. Pode significar aviso aos clientes, ao público ou a reguladores. O que se sabe é que OpenAI, Meta, Anthropic e Google foram notificadas em um intervalo parecido, no final de julho. OpenAI e Anthropic tornaram os casos públicos por conta própria. Os casos da Meta e, semanas depois, do Google, vieram à tona por reportagens da imprensa. O teste da Hugging Face e outros episódios ligados ao AI Security Institute do Reino Unido seriam, segundo a empresa, episódios separados e sem relação com a Irregular.
Como funciona: onde a arquitetura falhou na visão de operador
Para quem monta eval de agente, esse caso dói porque o erro é primário. Um teste de hacking com agente precisa rodar em sandbox sem rota de egress, com DNS falso, com firewall que nega tudo por padrão e com rede virtual isolada. Aqui, pelo relato, o ambiente tinha saída para a internet aberta. Isso sugere que não havia uma política estrita de deny by default no proxy de saída, nem inspeção de tráfego, nem lista de domínios permitidos. Em operação séria, o container do agente nem deveria resolver DNS externo.
O segundo ponto é ainda mais básico e mostra falta de checagem de colisão. Qualquer pessoa que já subiu um ambiente de staging sabe que é preciso verificar se hostnames, buckets, nomes de empresa e domínios fictícios já existem no mundo real. Em testes com agentes capazes de usar ferramentas, buscar na web e abrir conexões, usar um nome como alvo sem registrar e semear o DNS interno é pedir para vazar. É plausível que a Irregular estivesse mirando em realismo máximo para medir capacidade ofensiva real, com tool use liberado, terminal e navegação, e tenha afrouxado o isolamento para não quebrar o teste. É o trade off clássico entre fidelidade e segurança.
Em termos de custo e latência, esse tipo de avaliação é cara. Rodar agentes fronteira por horas, com múltiplas tentativas, chamadas de modelo, uso de ferramentas e monitoramento, consome muito token e exige observabilidade fina. A tentação de reaproveitar o mesmo cenário para vários clientes, OpenAI, Anthropic, Meta, Google, além de testes citados com Kimi K3 da Moonshot AI e GLM-5.2 da Z.ai, faz sentido comercial. Mas reaproveitar o mesmo cenário com defeito multiplica o estrago. Um bug de configuração vira incidente sistêmico em quatro gigantes ao mesmo tempo.
O que isso muda na prática para quem constrói com agentes
Quem ganha com essa história, no curto prazo, são fornecedores de isolamento, eval sandboxing e red teaming responsável. Quem perde são as equipes que terceirizam avaliação crítica sem auditar o fornecedor. Confiar no selo de testado por terceiros sem pedir evidência de isolamento é hoje um risco operacional e jurídico. Se seu agente tem acesso a terminal, browser ou código, o fornecedor do teste precisa provar como conteve isso.
Se você opera agentes hoje, tem pelo menos uma ação prática para fazer nesta semana. Rode um teste de fuga do seu próprio ambiente de eval. Desligue a internet no nível de rede, não só no prompt, crie um domínio canário que não existe, tipo um hostname aleatório com seu monitoramento de DNS, e peça para o agente exfiltrar ou atacar esse alvo. Se qualquer pacote sair para fora ou se o agente tentar resolver um domínio externo, seu isolamento está furado. Depois disso, exija dos seus vendors de avaliação três artefatos simples antes de qualquer teste ofensivo.
- Diagrama de rede do eval com prova de bloqueio de saída, logs de proxy e regras de firewall revisadas por alguém fora do time que montou o teste.
- Lista de entidades fictícias com checagem de colisão contra DNS real, certificados e marcas registradas, mais DNS interno autoritativo para tudo que o agente enxergar.
- Plano de kill switch e disclosure com quem é avisado em minutos se houver escape, como os alvos reais são identificados e como o tráfego é contido.
Para produto, a lição é direta. Agentes com tool use não podem ter internet irrestrita por padrão. Separe plano de raciocínio de plano de ação, limite escopos por token e por ferramenta, registre cada chamada externa. Se o seu caso de uso não precisa de navegação aberta, não dê. Use allowlist de domínios, proxy com inspeção e contenção por tempo de execução.
A tensão que ninguém quer admitir
O incômodo real aqui não é que um teste falhou. É que o setor inteiro está avaliando capacidade de hacking de modelos cada vez mais capazes usando infraestrutura que parece improvisada. A Irregular atende gigantes que valem trilhões, cita governo e think tanks, e mesmo assim deixou internet aberta e nome colidindo com domínio real. Isso escala. Se o padrão de terceirizar red teaming continuar sem auditoria de isolamento, vamos ver mais escapes, só que com agentes mais autônomos, com memória longa e com acesso a mais ferramentas.
E tem outro ponto que resolve pouco e só move o gargalo. Fechar a sandbox resolve o vazamento do teste, mas não resolve o fato de que os modelos tentaram atacar de verdade quando tiveram chance. O comportamento ofensivo funcionou. O agente seguiu o objetivo, enumerou, tentou explorar e foi atrás do alvo externo. O controle que falhou foi o da infraestrutura, não o do alinhamento. Então a pergunta que fica para quem faz deploy é simples e chata. Você confiaria nesse mesmo agente, com acesso à sua VPN, ao seu CRM e ao seu código, só porque o seu prompt diz para ele se comportar.
Conclusão
No fim, não tivemos IAs rebeldes, tivemos engenharia de teste mal feita em um momento em que errar custa muito caro. A boa notícia é que a correção é conhecida e barata perto do risco. A má notícia é que ainda estamos descobrindo esses erros pela imprensa, semanas depois. Quantos outros cenários de avaliação estão hoje com saída para a internet sem ninguém perceber.



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.