Todo pipeline de IA trava no mesmo ponto: decidir

Decisions API chegou para atacar exatamente esse gargalo que ninguém gosta de admitir. Você tem um modelo que gera bem, classifica mais ou menos e custa caro quando precisa só de um sim, um não ou uma escolha entre três opções. Eu já vivi isso em produção: fila de moderação estourando, roteamento de ticket errando categoria, avaliação de imagem que demora dois segundos quando deveria levar 200 milissegundos. É nesse atrito que a OpenAI está mirando, com promessa de ser cerca de 10 vezes mais rápida que a Responses API para tarefas de avaliação.

Na prática, a proposta parece simples até demais. Em vez de pedir para o modelo escrever uma justificativa longa e depois tentar extrair um rótulo com regex, você pede direto a decisão com probabilidade. Isso reduz token de saída, reduz latência e, em tese, reduz custo. Para quem opera agente autônomo que precisa checar 500 itens por minuto, essa diferença não é detalhe. É o que separa um fluxo viável de um que queima orçamento antes do fim do dia.

O fato sem enfeite

A OpenAI colocou a Decisions API em beta público. Ela avalia texto, imagens ou os dois juntos e devolve três tipos de resposta: probabilidade de sim ou não, escolha dentro de categorias predefinidas e nota em escala. Os exemplos citados são bem operacionais: detectar dano em foto, rotear atendimento do cliente automaticamente e classificar documentos. Suporte inicial é só para o modelo gpt-6-luna, com preço de 0,10 dólar por milhão de tokens de entrada e saída gratuita. Disponibilidade geral vem em breve, mas sem data cravada.

Junto veio uma simplificação nos planos pagos da API, que caíram de cinco para três níveis: Build, Launch e Grow. A subida é automática conforme o total de créditos comprados atinge o próximo patamar. Os limites mensais de uso ficam em 500 dólares, 5 mil dólares e 200 mil dólares. Também há suporte a zero-data retention e uso compatível com HIPAA nos Estados Unidos e na Europa, o que abre porta para saúde, finanças e operações que lidam com dado sensível e não podem deixar rastro para treino.

Como funciona na visão de quem opera

Pensa na Decisions API menos como um chat e mais como um classificador probabilístico com esteroides de modelo de fronteira. Você envia o input, define o esquema de decisão e recebe de volta um score, não um parágrafo. Isso sugere, e aqui é inferência minha a partir do desenho, uma arquitetura destilada e otimizada para inferência curta, provavelmente com cache agressivo, batch interno e cabeçote de classificação calibrado em cima do backbone do modelo. Por isso a conta de 10x mais rápido faz sentido: sem geração autoregressiva longa, o tempo cai de segundos para centenas de milissegundos.

Custo, latência e onde encaixa na arquitetura

No custo, a matemática é direta. A 0,10 dólar por milhão de tokens de entrada e saída gratuita, classificar um ticket médio de 800 tokens sai por fração de centavo. Se você faz 1 milhão de decisões por dia, fala de algo na casa de dezenas de dólares, não centenas. Na arquitetura, o encaixe natural é como porteiro antes do modelo pesado: a Decisions API filtra, roteia e pontua, e só o caso duvidoso ou de alto valor vai para a Responses API ou para um agente completo. Dá para usar como gate de moderação, triagem de imagem, controle de qualidade de RAG e até como juiz barato para avaliar saída de outro modelo.

Para imagem, o ganho tende a ser ainda mais visível. Detectar amassado, risco ou peça faltante não precisa de legenda poética, precisa de probabilidade calibrada e limiar claro. O ponto crítico aqui é calibragem. Probabilidade só serve se for confiável em produção, com curva ROC validada no seu dado, não no demo. Minha aposta é que a API entrega logits bem calibrados para casos comuns, mas vai exigir ajuste de threshold por cliente, por categoria e por turno de operação, porque iluminação, idioma e contexto mudam tudo.

O que isso muda na prática

Quem ganha primeiro é quem tem volume alto de microdecisões: marketplaces, logística, suporte, antifraude leve, gestão documental. Se hoje você paga Responses API para classificar com prompt gigante e parsing frágil, dá para cortar latência e custo de uma vez. Quem perde um pouco são os provedores de modelos pequenos de classificação e startups que vendiam roteador inteligente como diferencial. Quando a plataforma incorpora a função, o middleware vira commodity. E tem o efeito colateral bom: menos código gambiarra para extrair JSON de texto livre.

A ação prática desta semana é simples. Pegue seu fluxo de maior volume onde o modelo hoje responde com texto e você converte para categoria na mão. Duplique esse fluxo em shadow mode com a Decisions API, logue a probabilidade, o tempo e o custo por decisão durante três dias. Defina dois limiares: autoaprova acima de 0,9, revisão humana entre 0,6 e 0,9 e rota de exceção abaixo disso. Se a taxa de concordância com seu ground truth ficar acima de 96 por cento nos casos de alta confiança, você já tem um corte seguro para colocar em produção e aliviar o modelo principal.

  • Latência alvo: meça p95 antes e depois, busque corte de 70 a 90 por cento no tempo de triagem.
  • Custo por mil decisões: compare Responses API contra Decisions API no mesmo lote para provar economia.
  • Qualidade calibrada: valide threshold por categoria com pelo menos 500 exemplos reais da sua operação.

A parte que me deixa com o pé atrás

Aqui vai a tensão real: decidir rápido não é o mesmo que decidir bem quando o mundo muda. Modelo de decisão calibrado em dado de laboratório tende a degradar em silêncio quando chega imagem borrada, texto com ironia ou categoria nova que não estava no esquema. E como a saída é só um número, o erro fica invisível. Você não tem a justificativa para auditar, só tem um 0,87 que parecia confiante. Isso escala? Sim, em throughput. Mas escala em confiança? Só se você montar observabilidade em volta, com amostragem humana, detecção de drift e revalidação constante.

Tem também a dependência de um único modelo suportado, o gpt-6-luna. Preço baixo agora não garante preço baixo depois da beta, e lock in em esquema proprietário de decisão cobra seu preço na hora de migrar. Fora que zero-data retention e HIPAA ajudam, mas não resolvem governança: quem define o limiar, quem responde pelo falso negativo em um caso de dano ou saúde, como versionar o prompt de decisão? A OpenAI moveu o gargalo da geração para a avaliação, mas não eliminou a necessidade de julgamento humano nos casos de cauda longa. No fim, é uma ferramenta excelente para o meio da curva, perigosa se usada como verdade absoluta nas bordas.

Conclusão direta para quem constrói

A Decisions API vale o teste porque resolve custo e latência onde mais dói: na triagem repetitiva em escala. Use como porteiro rápido, não como juiz final. E fica a pergunta que vou monitorar nos meus próprios deploys: quando tudo for decidido em milissegundos, quem vai perceber quando a decisão certa mudar sem avisar?