Seu agente não precisa escrever, ele precisa decidir
Jev e os decision models explodiram porque resolveram um incômodo que todo operador conhece bem. A maior parte do que um agente faz não é gerar texto bonito, é tomar microdecisões o tempo todo. Isso é spam ou não é, esse ticket vai para qual fila, essa ferramenta deve ser chamada agora ou não, essa resposta passou no critério de qualidade. Quando você usa um LLM gigante para responder sim ou não com um parágrafo, você está queimando latência, tokens de saída e dinheiro à toa. É esse gargalo silencioso que a TypeSafe transformou em produto e que agora todo mundo está tentando copiar.
Quem opera pipeline de agentes em produção sente isso no bolso no fim do mês. São milhares de chamadas de roteamento, classificação e julgamento que custam centavos individualmente, mas somadas viram uma fatura absurda. E pior, elas adicionam 800ms aqui, 1,2s ali, até que o usuário desiste no meio do fluxo. A promessa dos decision models é simples e por isso mesmo pegou tão rápido. Trocar geração aberta por uma resposta tipada, com probabilidade e score, em um único forward pass. Sem enrolação, sem tokens de saída, só o sinal que o seu código precisa para seguir.
O fato
A TypeSafe anunciou sua Series AI com valuation de US$7,5B apenas três semanas depois de lançar a API Jev. O número que travou o mercado veio via Sequoia. Mais de US$100M em ARR cruzados ainda na primeira semana de operação. Em qualquer outro ciclo isso seria tratado como erro de digitação. Em 2026, com FOMO de VCs no máximo, virou manchete e validação de categoria. Tem gente acusando astroturfing e inflagem artificial, tem cético apontando que ninguém audita esses números tão cedo, mas o efeito prático já aconteceu. Todo vendor relevante lançou seu próprio decision model no mesmo dia.
A lista de clones é quase constrangedora de tão sincronizada. A OpenAI lançou a Decisions API com três tipos de requisição, probabilidade de uma condição ser verdadeira, escolha em uma lista e score contra níveis, aceitando texto e imagem, rodando em GPT-6 Luna, por US$0,10 por milhão de tokens de entrada sem cobrança de saída e com discurso de até 10x mais velocidade. A Microsoft veio com o Microsoft-Decision-1 focado em LLM judges e triagem de hipóteses científicas. A Perplexity colocou o pplx-decider-v1.1-27b alegando 94,5% de acurácia em Decision Bench com 1.071 casos por US$0,017 a cada mil decisões. A Cloudflare respondeu com clef-omni multimodal para áudio, vídeo, imagem e texto e clef-flash mais barato que o Jev e cerca de 2x mais rápido, com pesos no Hugging Face. A Liquid colocou o d1 no Vercel AI Gateway com suporte a visão para classificar, rotear e pontuar.
Como funciona na visão de operador
Na prática, um decision model não gera, ele pontua. Em vez de pedir para o modelo escrever a resposta, você passa o input e uma lista de opções ou critérios e recebe de volta algo tipado. Por exemplo, probabilidade, escolha e nível de confiança. Tudo em um único forward pass, sem decodificação autoregressiva longa. Isso explica a matemática de custo e latência. Se não há tokens de saída, você elimina a parte mais cara e lenta da inferência. Se o cálculo é feito com log-likelihood normalizado por tamanho em batch, com KV cache compartilhado, como sugere a pesquisa de Selection-based Structured Reasoning da Apple com CMU, dá para responder várias perguntas sobre o mesmo input de uma vez.
O ecossistema em volta já mostra como isso vai ser usado. O Semantic Router do vLLM lançou o Decision 2.0 que responde múltiplas perguntas sobre um input em um pass, com probabilidade por opção. O LangSmith passou a usar Jev como judge que retorna respostas tipadas separadas para dificuldade e corretude em cada trace. Para quem quer rodar local, a Unsloth liberou notebook gratuito que transforma um Qwen3.5-4B em decision model com 8GB de VRAM, e já tem relato de Qwen3.5-0.8B saindo de 37% para 65% de acurácia em 60 passos, cerca de 10 minutos em 4GB. É provável, e aqui é inferência minha como operador, que a maioria desses serviços esteja destilando modelos maiores para cabeças de classificação leves e cobrando pela API o que antes era um prompt improvisado.
O que isso muda na prática
Quem ganha primeiro é quem tem harness de agentes com muito roteamento. A LangChain reportou que rotear cada tarefa para o modelo mais barato capaz de resolver cortou a mediana de custo por task no Open SWE em 64%. Isso não é otimização pequena. É a diferença entre um piloto que nunca sai do vermelho e um produto que aguenta escala. Times de suporte, triagem, moderação, avaliação de RAG e gates de qualidade são candidatos óbvios. Se hoje você tem um GPT-6 ou Claude avaliando se a resposta anterior foi boa com um prompt gigante, você está pagando caro por um sinal que um decision model entrega por fração do custo e com latência menor.
Quem perde, pelo menos no curto prazo, é quem vendeu wrapper de classificador com LLM genérico ou quem montou judge com prompt frágil e parsing de texto livre com regex. Esse código quebra, alucina formato e custa mais. A ação prática aqui é direta e dá para fazer ainda hoje. Exporte os últimos 7 dias de traces do seu agente, filtre todas as chamadas onde a saída esperada era sim ou não, categoria ou nota, e marque custo e latência de cada uma. Depois troque esse lote por um endpoint de decisão, seja Jev, OpenAI Decisions, clef-flash ou um modelo próprio destilado. Meça três coisas por uma semana. Taxa de concordância com seu judge atual, p95 de latência ponta a ponta e custo por mil decisões. Se a concordância ficar acima de 90% e o custo cair mais de 50%, migre o tráfego de roteamento e mantenha o modelo grande só onde geração real importa.
- Roteamento barato: use decision models para classificar, rotear e dar score antes de chamar o modelo caro.
- Judges tipados: troque parsing de texto livre por respostas com probabilidade para dificuldade e corretude.
- Destilação local: teste um Qwen pequeno afinado para suas categorias se volume justificar.
A tensão que ninguém quer admitir
Aqui entra a dúvida real. Isso escala ou só move o gargalo de lugar. Os primeiros avaliadores já avisam que decision models ainda sofrem em consistência e decisões complexas. E os números de latência contam uma história mais nuançada. No paper de SSR, a latência de raciocínio por turno cai mais de 90%, mas a latência fim a fim por pergunta cai só 28% a 54%. Ou seja, você acelera a microdecisão, mas o overhead de orquestração, retrieval e merges continua lá. Em testes da Vals AI com times de agentes no Vibe Code Bench, times custaram 1,8x a 5,1x mais e só uma configuração melhorou de forma relevante, com 7,3 pontos. Decidir mais rápido não adianta se o sistema em volta continua inchado.
Tem também o elefante na sala. US$100M em ARR em sete dias não é tração normal, é evento de categoria com muito marketing, créditos, pré-pagamentos e FOMO. Quando todo vendor lança clone no mesmo dia, o preço por decisão vai para o chão rapidinho. US$0,10 por milhão de tokens de entrada e US$0,017 por mil decisões já apontam para commodity. A TypeSafe criou a categoria, e isso tem valor, mas manter margem de US$7,5B vai exigir mais que ser o benchmark que todo mundo cita. Vai precisar provar que consistência, calibração de probabilidade e governança valem mais que um clef-flash 2x mais rápido ou um modelo open source rodando no seu próprio VPC por quase nada.
Conclusão
Decision models viraram peça padrão do stack de agentes porque atacam custo e latência onde mais dói, no roteamento e no julgamento. A conta agora é simples. Vale testar essa semana no seu pior funil de classificação, mas fica a pergunta que decide se Jev é plataforma ou só feature cara. Quando decisão virar commodity, o que sobra para justificar o prêmio.



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.