O limite estourou

O uso interno do Claude virou um problema de conta, não de qualidade. Quando um engenheiro tem teto de 100 mil dólares por mês para gastar com modelos de IA, a conversa já não é sobre qual assistente completa melhor o código. É sobre quanto custa cada autocomplete, cada sessão de agent, cada chamada que atravessa a API com contexto gigante de repositório inteiro. Meta e Microsoft chegaram exatamente nesse ponto e decidiram puxar o freio. Não porque o Claude seja ruim, pelo contrário. É porque ele ficou bom demais e caro demais para rodar solto dentro de casa.

O fato

Segundo relato publicado pelo The Information no início de outubro, Microsoft e Meta começaram a reduzir de forma agressiva o uso de ferramentas da Anthropic por funcionários internos, com foco total em coding. A Microsoft cortou tetos mensais de gasto com IA em nuvem e orientou times a migrar para GitHub Copilot e modelos da OpenAI rodando na própria infraestrutura. A Meta fez movimento parecido, derrubando o número de usuários internos do Claude Code de cerca de 60 mil no início do ano para algo em torno de 30 mil, enquanto empurra o MetaCode e o Muse Code, construídos sobre modelos próprios.

É importante separar as coisas. Nenhuma das duas está tirando o Claude do cliente final. O consumo de modelos Anthropic via Azure para empresas segue crescendo, e esse é um negócio de margem e de lock-in que a Microsoft não quer perder. O corte é interno, operacional. A estimativa anterior de que a Microsoft gastaria mais de 1 bilhão de dólares por ano só com tecnologia Anthropic para uso próprio caiu mais de um terço depois da ordem para conter o uso. Na prática, tetos que eram de 100 mil dólares por funcionário por mês em áreas de cloud e IA caíram para cerca de 10 mil dólares na maioria dos casos. São tetos, não gasto real, mas o recado é claro.

Como funciona na visão de quem opera

Para entender o tamanho do rombo, pense em como um coding assistant moderno funciona. Não é uma chamada simples de chat. É um loop de agente que lê arquivos, roda grep semântico, monta contexto de 50 mil a 200 mil tokens, chama o modelo, valida, chama de novo, executa ferramenta, reescreve. Cada tarefa aparentemente simples como refatorar um módulo ou gerar testes pode facilmente consumir algumas dezenas de centenas de milhares de tokens de entrada e vários milhares de saída. Com preço de modelo frontier, isso escala muito rápido quando você tem dezenas de milhares de engenheiros usando várias vezes ao dia.

Na Microsoft, a arquitetura faz diferença. Quando o engenheiro usa Claude via API externa, mesmo com desconto, cada token é custo variável e margem para a Anthropic. Quando usa Copilot ou um modelo OpenAI otimizado dentro do Azure, com batching, cache de prompt, destilação para tarefas simples e roteamento para modelos menores, o custo marginal cai e a infraestrutura já está amortizada. É plausível que a Microsoft esteja aplicando roteamento inteligente, com modelo pequeno para completar linha e modelo grande só para raciocínio de agente complexo. Isso não foi detalhado nos relatos, mas é o padrão que qualquer time de plataforma faria para segurar latência e custo sem matar a produtividade.

Na Meta o raciocínio parece similar, com um detalhe curioso. Mesmo com a queda de usuários pela metade, a empresa teria gasto mais de 105 milhões de dólares com Claude Code em um intervalo de 28 dias. Isso mostra que menos gente não significa menos gasto. Provavelmente quem ficou são os usuários pesados, com fluxos agentivos longos, contexts enormes e uso de funcionalidades mais caras. É o clássico pareto de IA interna. Dez por cento dos devs geram oitenta por cento da fatura porque automatizaram metade do workflow com agentes. Cortar acesso resolve parte, mas não resolve o design do custo por tarefa.

Latência, controle e dependência

Tem outro fator que pesa para um operador. Depender de um concorrente direto para a ferramenta mais crítica do dia a dia do engenheiro é frágil. Se a Anthropic muda preço, muda rate limit, muda comportamento do modelo ou prioriza capacidade para outros clientes, seu ciclo de desenvolvimento sente na hora. Trazer para dentro com MetaCode e Muse Code, ou centralizar no Copilot, dá controle sobre evals, telemetria, retenção de dados e roadmap. A latência também entra aqui. Rodar inferência mais perto do código, com cache de repositório e embeddings próprios, tende a responder mais rápido do que sair para API externa com tudo anexado a cada chamada.

O que isso muda na prática

Quem ganha no curto prazo são os times de plataforma interna e de finanças. Eles retomam previsibilidade de gasto e ganham argumento para investir nos próprios modelos. Quem perde, pelo menos no primeiro mês, é o engenheiro que já tinha calibrado prompt, workflow e atalhos no Claude Code e agora precisa reaprender no Copilot ou no MetaCode. Produtividade de dev não é só benchmark, é hábito. Trocar de assistente quebra ritmo, muda qualidade de sugestão em linguagens específicas e exige ajuste em testes e revisão.

Para quem constrói produto com IA, o recado é direto. Monitore custo por engenheiro por semana, não só custo total. Separe completions simples de tarefas agentivas. Se você não tem essa visibilidade, vai ser surpreendido pela fatura do mesmo jeito que Microsoft e Meta foram. Uma ação prática para aplicar agora é criar três faixas de uso interno. Faixa um, autocomplete local ou modelo pequeno com cache agressivo e sem revisão humana extra. Faixa dois, chat com contexto de arquivo para refatorações, com limite diário de tokens. Faixa três, modo agente com permissão para ler e escrever arquivos, liberado só para repositórios específicos e com trilha de auditoria. A maioria dos times descobre que oitenta por cento do valor está nas faixas um e dois, que custam uma fração da faixa três.

  • Mapeie quais repositórios realmente precisam de agente autônomo e quais vivem bem só com autocomplete.
  • Ative cache de prompt, limite de contexto e roteamento para modelo menor por padrão, deixando o modelo frontier como exceção.
  • Exija permissão explícita para comandos, acesso a credenciais e escrita fora do diretório do projeto, porque a troca de ferramenta não elimina risco de segurança.

Segurança continua no centro. Pesquisas anteriores mostraram falhas em fluxos de coding assistant que permitiam execução indevida e roubo de chaves de API, já corrigidas pela Anthropic, e caso parecido no ecossistema Microsoft com comandos maliciosos embutidos em issues que podiam levar a takeover de repositório. Trocar de Claude para Copilot ou MetaCode não apaga essa superfície de ataque. Só muda o rótulo. Se seu agente pode ler env, rodar shell e abrir PR sozinho, você precisa de sandbox, allowlist de ferramentas e revisão de diff gerado por IA como se fosse código de terceiros.

A tensão que ninguém quer admitir

Aqui fica a dúvida real. Isso resolve ou só move o gargalo de lugar. Cortar teto de 100 mil para 10 mil dólares disciplina, mas também empurra o time para uma ferramenta interna que talvez ainda não tenha a mesma qualidade em tarefas difíceis. Se o dev contorna e roda Claude por fora, com conta pessoal ou via outro proxy, você perde visibilidade e continua pagando em produtividade fragmentada. E tem o custo de construção. Manter MetaCode para 30 mil usuários e Muse Code para mais de 6 mil, com evals, fine tuning, suporte e inferência própria, não é barato. Vale a pena se o volume dilui o fixo e se a qualidade encosta no frontier externo. Se não encostar, a economia vira imposto de produtividade que aparece em prazo estourado e retrabalho.

Outro ponto incômodo é a posição dupla. Microsoft e Meta seguem sendo grandes clientes da Anthropic e ao mesmo tempo concorrentes diretos. É difícil negociar preço duro, pedir roadmap e ainda competir pelo mesmo desenvolvedor. Esse cabo de guerra tende a aumentar, não diminuir. Com receita anualizada da Anthropic na casa de dezenas de bilhões, a demanda externa segura o negócio dela. O corte interno dói mais como sinal político do que como baque financeiro imediato.

Conclusão

No fim, Meta e Microsoft não abandonaram o Claude, só decidiram que ele não pode ser o padrão interno sem controle. A lição para quem opera é simples e desconfortável. Coding com IA escala rápido no valor e mais rápido ainda no custo. Quem vai seguir usando sem limite e torcendo para a conta fechar?