Testar IA virou um buraco negro de dinheiro público
A NSA está gastando bilhões de dólares neste ano só para avaliar e testar modelos avançados de IA. Não é investimento em treinamento, não é compra de startup, é conta de avaliação. Red team, análise de vulnerabilidade, tentativa de extrair comportamento perigoso, jailbreak, vazamento de dados, uso para ciberataque. É o tipo de trabalho chato, caro e contínuo que ninguém mostra em demo, mas que define se um modelo pode ser liberado sem virar risco de segurança nacional.
Para quem constrói produto com LLM, o recado é direto. O custo de provar que o modelo é seguro está explodindo. E quando o governo americano, com orçamento de quase um trilhão de dólares para defesa, começa a achar a conta pesada, você pode imaginar o que isso significa para o resto do mercado.
O fato
A informação veio de estimativas classificadas repassadas a parlamentares americanos. Segundo duas fontes com acesso a esses números, a NSA confirmou que o gasto com testes de modelos de fronteira já passa da casa dos bilhões em dinheiro do contribuinte neste ano. O valor exato não foi revelado e o Pentágono se recusou a comentar arquitetura técnica ou alocação de recursos, alegando motivos de segurança.
O que assustou os parlamentares foi a comparação. Propostas anteriores para criar supervisão federal de IA falavam em 20 milhões de dólares por ano para um centro de riscos, ou 36 milhões em cinco anos para um sistema de reporte. Os números reais da operação da NSA atropelaram essas projeções. A leitura em Washington agora é outra: um sistema regulatório completo pode custar dezenas de bilhões por ano, e a conta só tende a crescer conforme os modelos ficam maiores e mais capazes.
O contexto ajuda a entender a pressa. Depois de uma sequência de incidentes de hacking e segurança, o Centro de Segurança de IA da NSA passou a testar modelos de fronteira para mapear vulnerabilidades de segurança nacional. O governo Trump, que até aqui resistiu a ampliar a supervisão federal sobre IA, viu o tema ganhar urgência justamente pelo custo operacional e pelo risco técnico.
Como funciona na visão de operador
Testar um modelo de fronteira não é rodar um benchmark público e gerar um PDF. É montar um harness de avaliação que roda por semanas em milhares de GPUs. Você precisa replicar o modelo em ambiente isolado, instrumentar logs, rodar baterias de prompts adversariais, testar agentes com acesso a ferramentas, simular exfiltração, avaliar capacidade de auxiliar em intrusão, engenharia reversa, criação de malware e manipulação de infraestrutura crítica. Cada rodada consome inferência pesada, com contexto longo e raciocínio encadeado, que é exatamente o tipo de carga mais cara e com maior latência.
O maior custo, segundo uma das fontes, é computação. E faz sentido. Comprar e alugar compute virou o gargalo global da IA. Não há chip suficiente para a demanda, o preço do aluguel de clusters disparou e até os labs estão fechando acordos de centenas de bilhões para garantir capacidade. Quando a NSA precisa reservar milhares de aceleradores só para quebrar modelo alheio, ela compete pelo mesmo hardware que Google, OpenAI e Anthropic disputam. O governo paga mais caro, espera mais na fila e ainda precisa manter tudo em ambiente classificado, o que elimina a opção de usar nuvem pública barata.
O segundo custo é gente. E aqui a assimetria é brutal. Engenheiros top de IA estão recebendo pacotes que passam de centenas de milhões de dólares no setor privado. A NSA tem, de longe, o time técnico mais profundo do governo americano, mas não tem como acompanhar salário, bônus e compute livre que um lab oferece. Resultado provável: times menores, com menos iteração, precisando priorizar quais modelos testar, quais vetores atacar e quanto tempo queimar em cada hipótese. Em avaliação de IA, menos iteração significa menos cobertura. E menos cobertura em segurança significa ponto cego.
Por que auditar custa quase como treinar
Pense em arquitetura. Um teste sério exige acesso quase nível API interna, com controle de temperatura, amostragem, logs de chain of thought quando disponível, além de réplicas do sistema com e sem filtros de segurança. Você precisa rodar o mesmo ataque centenas de vezes para medir taxa de sucesso, variar persona, idioma, fragmentação de prompt e encadeamento de ferramentas. Some a isso avaliação de agentes autônomos, que multiplicam chamadas e estouram janela de contexto. No fim, o custo de inferência para validação pode se aproximar do custo de um fine tuning parrudo. Só que sem gerar receita.
O que isso muda na prática
Quem ganha no curto prazo são os provedores de infraestrutura e os poucos especialistas em evals. Quem perde é o contribuinte americano e, por tabela, qualquer empresa que achava que compliance de IA seria um checklist barato. Se o governo concluir que não dá para bancar sozinho, a pressão vai para os labs pagarem pela própria fiscalização, seja via taxa, via fundo setorial ou via exigência de relatórios padronizados antes do deploy.
- Labs de fronteira: terão que entregar artefatos de avaliação reproduzíveis, não só model card genérico, para reduzir retrabalho do governo.
- Startups que usam API: podem herdar custos indiretos via preço maior, limites de uso e filtros mais agressivos que aumentam latência.
- Times de segurança: vão precisar internalizar parte dos testes, porque a fila oficial não vai dar conta de cada release semanal.
A ação prática para quem está construindo agora é simples e barata perto do cenário da NSA. Monte seu próprio mini harness de segurança antes de trocar de modelo. Congele um conjunto de 50 a 100 prompts adversariais do seu domínio, incluindo injeção indireta, extração de sistema, vazamento de PII e uso indevido específico do seu produto. Rode esse pacote toda vez que mudar versão, temperatura ou prompt de sistema. Meça taxa de falha, latência e custo por avaliação. Isso não substitui uma auditoria federal, mas evita que você descubra a vulnerabilidade pelo cliente ou, pior, pelo incidente.
O gargalo real não é a lei, é a física
Aqui está a tensão que ninguém quer encarar. Regular IA por decreto é barato no papel. Executar a regulação custa compute, energia e talento, três recursos escassos. Propostas de autofiscalização, como labs avaliando uns aos outros ou criando um órgão próprio de padrões, reduzem custo para o governo, mas criam conflito de interesse óbvio. É como pedir para concorrentes auditarem o motor um do outro com o código fechado.
A alternativa da taxa sobre empresas de IA parece lógica para garantir independência, e até OpenAI e Anthropic sinalizaram abertura para mais supervisão federal com algum pagamento. Mas isso só move o problema. Quem define o escopo do teste, quem tem acesso ao peso do modelo, quem valida o validador. E se cada nova geração exige dez vezes mais compute para testar, a taxa de hoje vira defasagem amanhã. No fim, não estamos discutindo apenas quem paga. Estamos discutindo se é tecnicamente viável auditar tudo que está sendo lançado na velocidade atual sem travar a inovação ou deixar buraco aberto.
Conclusão
A NSA torrando bilhões para testar IA mostra que segurança de modelos deixou de ser debate abstrato e virou linha de custo operacional. A pergunta que fica para quem opera é incômoda: se nem o governo com orçamento militar aguenta auditar a fronteira sozinho, quanto tempo até esse custo bater na sua fatura de API.



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.