O gargalo não é mais o modelo, é a conta de luz

ChatGPT com 1,2 bilhão de usuários semanais deixou de ser um aplicativo para virar infraestrutura básica da internet. Pense como quem opera: são centenas de milhões de sessões por dia, com picos imprevisíveis, prompts cada vez mais longos, voz, imagem e código rodando juntos. Nessa escala, a pergunta que importa não é se o modelo é mais inteligente que o concorrente. A pergunta é como entregar resposta em dois segundos sem destruir a margem. É exatamente nesse ponto que a OpenAI está sendo testada agora, mesmo comemorando recorde.

Porque ganhar usuário ficou barato quando você corta preço e distribui acesso. Caro mesmo é sustentar inferência para todo mundo, o tempo todo. Cada nova conversa soma tokens de entrada e saída, memória de contexto, chamadas de ferramenta, moderação, re-ranking. Multiplica isso por 1,2 bilhão de pessoas e o custo marginal que parecia pequeno vira uma montanha de GPU ligada 24 horas por dia. Crescer aqui não perdoa ineficiência.

O fato

A OpenAI revelou no seu DevDay que o ChatGPT passou de 1,2 bilhão de usuários semanais. Junto com isso, a empresa citou mais de 35 milhões de usuários semanais no ChatGPT Work e no Codex, além de 2,5 milhões de empresas usando seus produtos. São números que colocam o ChatGPT no mesmo patamar de alcance de Google, YouTube e das maiores redes sociais do planeta, só que com um custo de entrega por usuário muito maior.

Na parte financeira, o relato é de uma receita anualizada próxima de 70 bilhões de dólares, com alta de cerca de 70% desde o início do terceiro trimestre. A métrica de ARR projeta a receita mensal atual para um ano inteiro, então não é caixa garantido, é ritmo. A Anthropic estaria logo atrás, com taxa acima de 65 bilhões em julho e possível empate técnico agora, enquanto prepara um IPO que pode sair já em novembro. O recado é claro: a briga saiu da demo e foi para o balanço.

Esse avanço vem de duas frentes. Vendas enterprise, com contratos grandes e uso pesado de API, e uma guerra de preços agressiva contra o Claude e os modelos chineses. A empresa dobrou a aposta com o recém lançado GPT-6.1-Sol e com a família GPT-6, que também puxa o crescimento rápido do Codex como assistente de código. Preço menor, modelo mais eficiente, mais volume. Na teoria funciona. Na prática, comprime margem de todo mundo.

Como funciona na visão de quem opera

Para atender 1,2 bilhão de pessoas por semana, a OpenAI provavelmente opera um esquema pesado de roteamento e fracionamento de carga. Não é um modelo único respondendo tudo. Deve haver uma mistura de modelos destilados e versões otimizadas para tarefas simples, com os modelos grandes reservados para raciocínio complexo, código longo e uso enterprise. Isso envolve cache agressivo de prompts repetidos, batching dinâmico para aproveitar melhor cada GPU e filas de prioridade para quem paga mais. Latência baixa para o usuário gratuito e throughput alto para API não convivem bem sem esse tipo de malabarismo.

O custo aqui se divide em três partes que quem constrói conhece bem. Token de entrada, token de saída e tempo de ocupação da GPU. Contexto longo é o vilão silencioso. Ele aumenta latência, prende memória e derruba a quantidade de requisições simultâneas por máquina. Quando a OpenAI empurra planos com mais contexto e agentes que fazem várias chamadas em sequência, o ticket médio sobe, mas o custo por sessão sobe junto. A aposta no GPT-6.1-Sol parece uma tentativa de achatar essa curva, com inferência mais barata por token sem perder qualidade perceptível na maioria das tarefas.

O Codex muda ainda mais o perfil. Coding assistant não é chat curto, é workload assíncrono, com repositório inteiro no contexto, múltiplas gerações, testes e reescrita. Isso consome muito mais tokens por tarefa e tolera latência um pouco maior, o que permite usar batch maior e spot capacity. Faz sentido que a OpenAI separe essa fila da fila interativa do ChatGPT. Se tudo caísse no mesmo cluster, o pico de uso de agentes de código quebraria o tempo de resposta do usuário comum. Operar em escala assim é menos sobre ter o melhor modelo e mais sobre isolar workloads e prever demanda por hora.

O que isso muda na prática

Quem ganha no curto prazo é quem está dentro do ecossistema. Empresa que já padronizou em OpenAI ganha preço menor, modelo mais rápido e argumento interno fácil para expandir uso. Provedores de nuvem e de energia ganham junto, porque essa conta de data center vai para alguém. Quem perde é o laboratório médio que tenta competir em preço e o desenvolvedor que monta tudo em cima de um único fornecedor sem plano B. Guerra de preços derruba custo hoje e cria dependência amanhã, ainda mais quando 2,5 milhões de empresas já estão amarradas ao mesmo stack.

  • Audite custo por tarefa, não por token. Meça quanto custa um suporte resolvido, um PR gerado, um relatório pronto.
  • Implemente cache de contexto e roteamento por complexidade, com modelo pequeno para o simples e modelo grande só quando precisa.
  • Crie fallback para Claude ou modelo aberto em fluxos críticos, para não ficar refém de reajuste ou queda.

A ação prática mais urgente é revisar sua arquitetura de chamadas. Se você usa agentes que fazem cinco ou dez chamadas para completar uma tarefa, 1,2 bilhão de usuários significa que a OpenAI vai priorizar eficiência e pode mudar limites, preços e comportamento de modelo sem avisar muito. Trave versão de modelo em produção, registre latência p50 e p95 por endpoint e coloque alerta de custo diário por workspace. Quem não mede isso agora vai descobrir o rombo só na fatura.

O problema que ninguém quer encarar

Aqui entra a tensão real. Receita anualizada de 70 bilhões impressiona, mas data center não se paga com ARR projetado. Se paga com caixa, contrato de longo prazo e energia barata. A OpenAI está assinando capacidade para anos, enquanto compete baixando preço hoje. Isso funciona se o volume enterprise e o Codex pagarem a conta do uso gratuito e barato. Mas e se o uso crescer mais rápido que a disposição das empresas para pagar? A conta não fecha só com hype de usuário semanal.

Tenho dúvida honesta se isso escala do jeito que está desenhado ou se só move o gargalo de lugar. Antes o gargalo era treinar modelo gigante. Agora é servir inferência barata para o planeta inteiro sem quebrar. Destilar modelo ajuda, rotear ajuda, mas no fim cada resposta ainda queima energia física. Preço baixo acelera adoção e ao mesmo tempo esmaga quem precisa investir em infra. Resolve para o usuário final, complica para quem opera. Até quando dá para subsidiar crescimento com capital de data center?

Conclusão prática

No fim, 1,2 bilhão de usuários semanais prova domínio, não lucro garantido. A OpenAI virou utilidade pública de IA e agora precisa provar que sabe operar como uma. Fica a pergunta para quem constrói em cima: seu produto sobrevive se o preço por token dobrar amanhã?