O atalho que parecia morto voltou a funcionar

Nemotron 3 virou especialista de nível ouro sem precisar nascer de novo como um modelo gigante diferente. A NVIDIA pegou a mesma família base, aplicou ajuste fino com dados bem curados e colocou os sistemas para encarar dois dos testes mais difíceis que existem para máquinas e humanos: a Olimpíada Internacional de Informática, a IOI, e a Olimpíada Internacional de Matemática, a IMO. O resultado foi desempenho de medalha de ouro nos dois lados, um em código competitivo e outro em prova matemática discursiva. Para quem constrói produto com IA, isso importa mais do que o placar porque sugere que especializar um bom open-weights pode valer mais do que correr atrás do próximo foundation model do zero.

Eu já vi esse filme antes. Alguém anuncia receita simples e reproduzível, a comunidade tenta replicar e descobre que o simples custou milhões em GPU e um time de doutores para curar dados. Então vamos separar o que é fato, o que é engenharia bem feita e o que ainda é custo alto demais para a maioria dos times.

O fato

O que aconteceu foi direto. Partindo do Nemotron 3, dois times criaram especialistas diferentes. Um para programação competitiva, outro para matemática olímpica. Os dois usaram supervised fine-tuning, o SFT, reinforcement learning, o RL, e um loop de inferência que gera, avalia e refina respostas. No caso da IOI 2026, o sistema rodou ao vivo, sob as mesmas restrições de tempo, acesso à internet e submissões dos competidores humanos. Foi uma avaliação prospectiva, não oficial e sem supervisão da organização, então não entrou no ranking oficial. No caso da IMO 2026, as provas enviadas foram corrigidas por corretores oficiais da IMO e somaram 30 de 42 pontos, com nota máxima em quatro problemas.

Em código, os números da evolução são os mais reveladores. O time curou 22 mil problemas e gerou trilhas sintéticas de raciocínio para treinar dois especialistas: o Nemotron-3-Nano-CC, com 30 bilhões de parâmetros totais e 3 bilhões ativos, e o Nemotron-3-Ultra-CC, com 550 bilhões totais e 55 bilhões ativos. Na base de teste da IOI 2025, o Nano saiu de 130 pontos antes do pós-treino para 280 depois do SFT e 291 depois do RL. Com a estratégia de test-time chamada GenCorrect, ele saltou para 468 pontos e passou a barra de ouro de 438,3. O Ultra-CC chegou a 502 com a mesma estratégia. O sistema final de competição para a IOI 2026, baseado no Ultra-CC, marcou 535,4 de 600.

Como funciona na visão de quem opera

A receita tem quatro partes e, no papel, qualquer lab forte consegue repetir. Primeiro, começar de uma base Nemotron capaz. Segundo, curar problemas específicos do domínio com trilhas de raciocínio de alta qualidade. Terceiro, aplicar SFT e, quando ajuda, RL. Quarto, acoplar um loop de inferência que gera candidatos, critica e melhora. Nada aqui é arquitetura alienígena. É pós-treino clássico mais computação extra na hora de responder. A diferença está na qualidade dos dados e no quanto se investe na inferência.

No lado de código, o padrão de ganho por escala foi diferente do esperado. No Nano, o SFT fez a maior parte do trabalho e o RL deu um ganho menor, mas consistente. No Ultra, uma única época de SFT já foi suficiente para superar o Nano totalmente pós-treinado em IOI, ICPC e LiveCodeBench Pro. Em termos de operador, isso tem implicação direta de custo. Modelo pequeno exige mais ciclos de RL e mais iterações de inferência para encostar no ouro. Modelo grande aprende o padrão com menos ajuste, mas cobra a conta na latência e no custo por token porque ativa 55 bilhões de parâmetros por passo. O GenCorrect tenta compensar isso com gerar, testar e corrigir, o que na prática multiplica o número de chamadas e o tempo de resposta por problema.

No lado de matemática, o trabalho foi ainda mais focado em processo, não só em resposta final. O corpus de SFT tinha 414.890 exemplos filtrados por qualidade, distribuídos em 15.818 problemas únicos de prova. O modelo não aprendeu apenas a cuspir a demonstração final. Ele aprendeu a gerar prova, refinar, verificar e fazer meta-verificação, ou seja, julgar se a prova está completa, apontar lacunas e responder a críticas. O modelo de RL foi treinado em 9.597 problemas escolhidos perto da fronteira de capacidade do modelo, aquela região onde ele acerta às vezes e erra às vezes. O sistema final usava os dois especialistas mais o modelo geral juntos. Para cada questão da IMO, eles geravam provas candidatas, pontuavam, criticavam e refinavam as mais promissoras, com uma etapa final de alto custo computacional para escolher a submissão. Tudo em linguagem natural, sem provador formal, sem ferramentas externas e sem internet.

O que isso muda na prática

Quem ganha aqui é quem já tem base aberta forte e precisa de especialista profundo. Se você opera coding assistant para algoritmos difíceis, tutoria de matemática avançada ou agente que precisa provar etapas com rigor, a mensagem é clara: dá para especializar em vez de trocar de base a cada trimestre. Quem perde, pelo menos no discurso, é a tese de que só modelo fechado gigante resolve raciocínio de elite. Resultado duplo ouro com pesos abertos pressiona laboratórios fechados a mostrar mais do que benchmark interno.

Para o dia a dia, a ação prática é montar seu próprio mini GenCorrect antes de culpar o modelo. Separe 200 a 500 problemas reais do seu domínio, com gabarito e critério de correção. Gere duas a três soluções por prompt com temperatura um pouco mais alta, peça para o próprio modelo criticar lacunas lógicas ou falhas em testes unitários, e só então refine a melhor candidata. Meça ganho por rodada e custo por chamada. Na maioria dos casos que testei nesse formato, a segunda passada de crítica vale o custo extra, a terceira só vale para problemas de alto valor. Se uma época de SFT com trilhas boas já sobe seu benchmark interno, você achou o mesmo atalho que a NVIDIA explorou no Ultra.

  • Ajuste fino focado: curadoria pequena e limpa supera volume barulhento em prova e código.
  • Inferência com crítica: gerar, avaliar e refinar rende mais pontos que aumentar contexto.
  • Escolha de escala: modelo menor mais RL e mais passes pode encostar em modelo grande.

A tensão que fica

Aqui entra a dúvida real. Isso escala fora da NVIDIA ou só move o gargalo de lugar. O treino e a inferência descritos foram substanciais. Rodar múltiplos especialistas de 30B a 550B, com busca e refinamento por problema, não é algo que roda com latência baixa e custo previsível em produção. Para IOI e IMO, onde você tem horas por problema e pode gastar milhares de tokens por tentativa, a conta fecha. Para um produto que precisa responder em dois segundos e custar centavos por sessão, talvez não feche. A especialização resolve o problema de capacidade, mas cria um problema novo de operação: mais modelos para versionar, mais pipeline de avaliação e um custo de inferência que varia muito por dificuldade da questão.

Tem outro ponto incômodo. A qualidade das trilhas sintéticas e dos 414 mil exemplos de prova não é detalhe. É o projeto inteiro. Sem esse filtro forte, SFT vira memorização de estilo e RL vira otimização de recompensa frágil. Então a pergunta que eu deixo para quem quer replicar é simples e desconfortável: você tem fonte de problemas difíceis com correção confiável, ou vai treinar seu especialista em dado mediano e esperar comportamento de ouro.

Conclusão

Nemotron 3 mostrou que uma boa base aberta, bem ajustada e com inferência que critica e revisa, chega a ouro em código e matemática de elite. O caminho é reproduzível na ideia, mas pesado no dado e no custo. Vale testar essa receita no seu nicho antes da próxima troca de modelo, ou o gargalo real aí ainda é avaliação e não parâmetro.