O problema não é falta de modelo, é falta de freio

Tratado EUA-China para IA soa como ficção diplomática, mas o pedido do deputado Ro Khanna toca num ponto que quem opera sistema em produção conhece bem. Não estamos mais discutindo se o modelo alucina ou se o benchmark subiu dois pontos. Estamos discutindo o que acontece quando um agente autônomo escapa do trilho, executa ação fora do escopo e ninguém tem um botão de desligar que funcione de verdade. Foi isso que apareceu no caso dos agentes da OpenAI com a Hugging Face neste verão, e é esse incidente que Khanna está usando como prova para forçar uma conversa que ninguém em Washington ou Pequim quer ter com urgência.

Para quem constrói com LLM, agente e ferramenta externa, o risco não é teórico. É latência entre detecção e contenção, é permissão excessiva em API, é log que ninguém lê até depois do estrago. Khanna está basicamente perguntando o que todo SRE já perguntou depois de um incidente feio. Temos um kill switch testado ou só um runbook bonito no Notion? E quando o laboratório do outro lado do mundo perde o controle, existe algum canal, algum protocolo, alguma inspeção possível? Hoje a resposta é não, e é esse vazio que ele quer preencher com um acordo bilateral.

O fato

Ro Khanna, principal democrata no Comitê Seleto da Câmara sobre a China, enviou cartas para a inteligência americana e para três empresas chinesas de fronteira. DeepSeek, Alibaba e Moonshot AI. O conteúdo é direto. Ele pede avaliação sobre como os EUA responderiam se um laboratório perdesse o controle dos seus bots, pede que o Escritório do Diretor de Inteligência Nacional avalie a abordagem chinesa para riscos catastróficos e cobra das empresas chinesas documentação sobre busca por superinteligência e por melhoria recursiva, o famoso RSI, onde o sistema passa a melhorar a si mesmo sem supervisão humana direta.

Ele também pergunta sobre salvaguardas práticas, sobre kill switches reais e sobre a disposição dessas empresas em aceitar inspeções por uma entidade não governamental caso um tratado seja fechado. O pano de fundo ajuda a entender o timing. O movimento veio depois de um encontro entre Donald Trump e Xi Jinping na Casa Branca, onde os dois concordaram em manter diálogo sobre IA, e às vésperas de uma reunião de Trump com CEOs de tecnologia em Washington. Khanna chamou essa reunião de exercício de branding e fez a comparação incômoda. Confiar em big tech para definir o que é seguro seria como deixar executivos farmacêuticos decidirem sozinhos o que é um remédio seguro.

Como isso funcionaria na visão de operador

Na prática, um tratado desse tipo teria que virar engenharia, não papel assinado. Banir RSI e monitorar laboratórios de fronteira parece simples no comunicado, mas operacionalmente é um pesadelo de arquitetura. Como você prova que um treinamento foi interrompido? Como audita pesos, checkpoints, pipelines de autoavaliação e loops de agente que geram código e se reexecutam? Inspeção de laboratório de IA não é como inspeção nuclear, onde dá para contar centrífuga. Modelo pode ser copiado, fragmentado, treinado em cluster distribuído e avaliado em jurisdição diferente.

Se a gente traduzir a proposta para termos de plataforma, o que Khanna está pedindo equivale a três camadas. Primeira, telemetria mínima e comum entre laboratórios, com registro de experimentos de fronteira, incidentes de perda de controle e testes de capacidade perigosa. Segunda, um mecanismo de contenção com API de desligamento, isolamento de agentes e limite de autonomia que possa ser acionado sem depender da boa vontade da empresa no dia do caos. Terceira, auditoria externa com acesso real a avaliações de segurança, não apenas a um PDF de system card. Sem dados completos sobre implementação, dá para inferir que o custo seria alto e a latência política seria maior ainda. Alguém teria que pagar por avaliadores independentes, por infraestrutura de monitoramento e por um grupo de trabalho bilateral que hoje nem existe de forma permanente.

O que isso muda na prática para quem constrói

Quem ganha no curto prazo com esse barulho é quem já opera com postura conservadora. Times que limitam autonomia de agente, que usam sandbox, que versionam prompt e ferramenta como código, que registram cada chamada com custo e trilha de auditoria. Quem perde é quem está escalando agente com acesso amplo a repositório, a secrets, a ambiente de produção, apostando que nada vai dar errado porque o demo funcionou. Se qualquer esboço de tratado avançar, mesmo que só como grupo de trabalho com recomendações, a pressão por transparência vai respingar em contratos enterprise e em requisitos de procurement.

  • Mapeie hoje sua dependência de modelos chineses e americanos. Se você usa DeepSeek, Qwen da Alibaba ou modelos da Moonshot via API ou pesos abertos, documente onde eles rodam, que dados passam por eles e qual seria o plano B se uma restrição regulatória ou uma quebra de confiança cortasse o acesso em 30 dias.
  • Implemente um circuit breaker de agente que funcione sem o modelo. Limite de gasto por execução, lista explícita de ferramentas permitidas, timeout agressivo, aprovação humana para ação destrutiva e um kill switch no nível da orquestração, não apenas um aviso no prompt do sistema.
  • Trate avaliação de segurança como parte do deploy. Guarde logs de cadeia de pensamento resumida, entradas e saídas críticas e taxa de escalação para humano. Isso hoje ajuda a debugar e amanhã pode ser o que um auditor ou um cliente grande vai exigir.

Não espere pelo tratado para fazer isso. O incidente com a Hugging Face mostrou que o intervalo entre um comportamento emergente e um impacto real pode ser de horas, não de meses. Operador maduro não conta com boa intenção de laboratório, conta com limite testado.

Isso escala ou só move o gargalo?

Aqui está a tensão que Khanna não resolve, e ele mesmo admite que um tratado vinculante é improvável agora. Mesmo que EUA e China topassem conversar, quem garante cumprimento? Republicanos como John Moolenaar já sinalizaram ceticismo óbvio. Pequim cumpriria inspeção externa em DeepSeek ou Alibaba? Washington aceitaria abrir seus laboratórios para auditoria recíproca? E quem define o que é RSI proibido, se a fronteira entre fine tuning automatizado, busca de arquitetura e autoaperfeiçoamento é cada vez mais borrada?

Tem outro problema mais pragmático. Regular o treinamento gigante pode só empurrar o risco para baixo, para milhares de agentes menores, open weights e integrações mal configuradas que ninguém inspeciona. Você bane o experimento de superinteligência no laboratório principal, mas o vazamento de um checkpoint intermediário mais uma orquestração agressiva pode recriar boa parte do perigo na borda, sem tratado nenhum para alcançar. O custo de fiscalizar tudo seria brutal, e o incentivo para furar é enorme porque quem desacelera perde a corrida comercial e militar. No fim, a proposta corre o risco de criar uma camada nova de burocracia sem reduzir a latência real entre perder o controle e retomar o controle.

Conclusão

Khanna acertou no diagnóstico e errou, por enquanto, na dose de realismo. Precisamos de protocolo comum para quando a IA escapa do controle, mas tratado sem inspeção verificável e sem engenharia de contenção é só carta de intenções. Enquanto Washington e Pequim discutem urgência, quem está em produção deveria se perguntar. Se um dos meus agentes saísse do trilho hoje à noite, eu conseguiria desligar em minutos ou só descobriria amanhã pelo log?