O problema não é mais o chatbot que alucina

Agentes de IA fora de controle deixaram de ser hipótese de laboratório e viraram linha em planilha de seguradora. A pergunta que circula agora entre underwriters em Londres e Nova York é simples e incômoda: se o seu agente tem acesso a APIs, credenciais, repositórios e permissão para executar, quem paga quando ele decide fazer algo que ninguém mandou. Não estamos falando de uma resposta errada no chat. Estamos falando de ação autônoma com efeito no mundo real, exclusão de dados, vazamento, deploy quebrado, compra indevida, acesso indevido a sistema de terceiro.

O sinal de alerta mais concreto veio com o incidente envolvendo a plataforma Hugging Face e agentes associados ao ecossistema da OpenAI. Ainda há mais ruído do que detalhe técnico público sobre a cadeia exata de eventos, mas o recado para o mercado foi claro. Um agente com tool use amplo pode escalar um erro bobo para um incidente de segurança em minutos, sem um humano no loop para puxar o freio. Para quem opera sistemas, isso não surpreende. Para quem precifica risco, isso muda tudo.

O fato: seguradoras já precificam o caos

Apuração recente da imprensa financeira mostra que grandes seguradoras e corretoras estão se preparando para sinistros de milhões de dólares ligados a agentes autônomos. A corretora Aon revisou mais de 300 processos judiciais relacionados a IA e mapeou exposições escondidas em apólices de cybersecurity, propriedade intelectual e falha tecnológica. Não é um clausulado novo e bonitinho de IA. É o clausulado antigo sendo testado por um tipo novo de falha.

O ponto mais sensível é que a responsabilidade pessoal de executivos entrou no radar. Nomes como Sam Altman, da OpenAI, e Dario Amodei, da Anthropic, são citados como exemplo do princípio que o pessoal de underwriting repete: a conta para no CEO. Tim Rayner, responsável por subscrição e sinistros na Verisk, resume a lógica do mercado. A empresa precisa provar supervisão adequada e IA não muda esse dever. Na prática, isso puxa para a mesa o seguro D&O, aquele que cobre diretores e executivos em caso de processos. Se houver cobertura válida, custos de defesa e acordos ligados a ações contra executivos podem cair ali.

Do outro lado, as seguradoras admitem que estão operando no escuro. Aki Hussain, CEO da Hiscox, diz que ainda é cedo para saber como os tribunais americanos vão tratar responsabilidade de agentes de IA. O advogado Aaron Le Marquer, do escritório Stewarts, avalia que futuras ações devem seguir o roteiro de litígios ambientais e do tabaco, com teses amplas, muitos autores e tentativa de estabelecer precedente. E tem o caso da Anthropic, que fechou um acordo de 1,5 bilhão de dólares em processo de direitos autorais em julho, enquanto menciona em documentos de IPO até riscos existenciais ligados à tecnologia. O contraste é gritante e o mercado de seguros leu na hora.

Como funciona na visão de quem opera

Para entender por que seguradora está nervosa, esqueça o modelo como oráculo e pense no agente como um junior com superpoderes e sem medo. A arquitetura típica hoje é um loop de raciocínio mais chamada de ferramentas. O modelo recebe um objetivo, quebra em passos, chama uma API, lê o retorno, decide o próximo passo e repete. Cada iteração adiciona latência, custo de tokens e, principalmente, superfície de erro. Se o planejamento inicial estiver levemente errado, o erro composta a cada tool call.

O custo aqui não é só o da inferência. Um agente preso em loop pode queimar milhares de chamadas em minutos, estourar rate limit, gerar logs gigantes e ainda executar ações com side effect. Pior: permissão excessiva é o padrão, não a exceção. Para fazer o demo funcionar, o time dá ao agente uma chave com escopo amplo, acesso de escrita ao banco, token de deploy, sessão autenticada no navegador. Funciona na demo, escala no incidente. Sem guardrails de permissão, validação e confirmação humana para ações irreversíveis, a autonomia vira roleta russa operacional.

Minha inferência técnica, e deixo claro que é inferência, é que a maioria dos incidentes que vamos ver nos próximos 12 meses não será jailbreak sofisticado. Será combinação banal de prompt ambíguo mais ferramenta poderosa mais falta de sandbox. O agente não hackeia no sentido clássico. Ele usa legitimamente uma credencial que alguém deu a ele, interpreta mal o contexto e executa. Nos logs, parece uso legítimo. No negócio, é sinistro.

Onde a conta estoura

  • Falha tecnológica e interrupção: agente apaga, corrompe ou publica dado errado e para a operação do cliente.
  • Cyber e acesso indevido: agente usa credencial válida para acessar sistema de terceiro e isso vira alegação de invasão.
  • Propriedade intelectual: agente copia, resume ou regenera conteúdo protegido em escala, sem trilha clara de proveniência.
  • Responsabilidade de executivos: falta de governança vira tese de negligência na supervisão, e o processo mira o D&O.

O que isso muda na prática

Quem ganha agora é quem vende governança, observabilidade e seguro. Corretoras, escritórios de advocacia e fornecedores de eval e policy engine estão surfando a onda. Quem perde é quem colocou agente com acesso de escrita em produção sem trilha de auditoria, sem limite de blast radius e sem dono claro. Quando o sinistro chegar, a primeira pergunta do perito e do advogado vai ser a mesma: mostre os logs, mostre as policies, mostre quem aprovou o quê.

Se você opera agentes hoje, tem uma ação prática para fazer nesta semana. Mapeie todas as tools que seus agentes podem chamar e classifique em leitura, escrita reversível e escrita irreversível. Tudo que for irreversível, como deletar, publicar, transferir, enviar para fora ou alterar permissão, precisa de três coisas: autenticação com escopo mínimo, confirmação explícita ou janela de aprovação, e log imutável com prompt, resposta, ferramenta e parâmetros. Parece burocrático, mas é exatamente o que separa um bug caro de um processo milionário. E guarde evidência de supervisão. No mundo D&O, governança documentada vale ouro.

A tensão que ninguém quer admitir

Aqui está a dúvida real que fica martelando: a autonomia compensa o risco que ela cria. Todo fornecedor promete agente que resolve de ponta a ponta, mas cada passo autônomo adicional aumenta latência, custo e probabilidade de desvio. Em muitos fluxos, um pipeline determinístico com uma chamada de modelo bem delimitada resolve 90 por cento do valor com 10 por cento do risco. O agente full autônomo resolve os 10 por cento finais, mas concentra quase todo o sinistro potencial. Isso escala tecnicamente, mas escala juridicamente.

E tem o problema da jurisprudência inexistente. Sem case law consolidada, cada acordo milionário vira referência informal para o próximo. Seguradoras vão reagir do jeito clássico: subir prêmio, incluir exclusões, exigir controles mínimos, sublimitar cobertura para IA. O resultado provável é que operar agente sem governança vai ficar mais caro, mais lento e mais questionado em due diligence. Não é o fim dos agentes. É o fim dos agentes sem freio, sem log e sem dono. A questão é se o mercado vai aprender pela arquitetura ou pela conta do sinistro.

Autonomia sem supervisão virou risco segurado

No fim, o recado das seguradoras é um espelho incômodo para quem constrói. Agente não é mais feature divertida, é ator com poder de causar dano. Quem der poder sem supervisão vai pagar em prêmio, em processo ou nos dois. Vale perguntar hoje, antes do incidente: o seu agente poderia causar um prejuízo que você não teria coragem de assinar.