Centenas de provas abertas resolvidas de uma vez

matemática de ponta sempre travou em um ponto bem específico: problemas bons demais para largar, difíceis demais para fechar em uma vida de pesquisa. A OpenAI jogou 722 manuscritos nessa ferida, organizados em 372 famílias de resultados, todos gerados por um modelo de fronteira ainda não lançado. Não é um paper isolado, é um lote industrial de soluções para o que o grupo independente AGMAI chama de 'centenas' de questões abertas. Quando você opera com modelos todos os dias, esse volume assusta mais do que impressiona, porque muda a escala do que precisa ser revisado, citado e sustentado.

O fato é direto e precisa ser lido sem hype. Depois de afirmar em setembro que havia resolvido mais de 100 problemas antigos na maioria das áreas, a empresa abriu o pacote com detalhes de raciocínio, estatísticas de tentativas e estimativas de computação. O material está em um repositório no GitHub, com protocolo para revisões e citações, e promessa de melhorar referências, exposição e apresentação. A AGMAI, formada por matemáticos de elite para tentar organizar essa divulgação, já tinha pedido canal acadêmico adequado, nome do modelo, prompts usados e custo de computação, além de um pedido explícito para não tratar resultado matemático como vitrine de produto. O recado mostra o tamanho do desconforto na comunidade.

Como isso foi gerado: visão de operador

Em termos de arquitetura, estamos falando de um modelo voltado a raciocínio longo, provavelmente com busca, verificação e refinamento iterativo sobre provas formais e informais. A OpenAI fala que o resultado médio consumiu o equivalente a três horas de pensamento do ChatGPT Pro. Traduzindo para operação, isso sugere janelas enormes de contexto, múltiplas cadeias de pensamento encadeadas e um verificador interno que filtra tentativas ruins antes de montar o manuscrito final. Não é uma chamada simples de API com resposta curta, é um job assíncrono, caro, com paralelismo alto e taxa de falha relevante, porque nem toda tentativa vira teorema.

O custo aqui importa mais que o marketing. Três horas de raciocínio pesado por resultado, multiplicado por 372 famílias, aponta para milhares de horas de GPU de alta performance, mesmo com otimizações de inferência. Em produção, isso seria inviável como endpoint em tempo real pelo preço e pela latência, mas faz sentido como batch de pesquisa. O padrão provável é amostragem massiva, ranking por um modelo crítico, depois reescrita para formato de artigo. Se você já rodou agentes para prova de código, conhece o comportamento: o modelo acerta por insistência estatística e verificação, não por um insight único e elegante. Funciona, mas cobra em computação e em revisão humana posterior.

A escolha do GitHub em vez de revista tradicional também diz muito. GitHub permite versionar, corrigir, rastrear citação e receber issues da comunidade em horas, enquanto o fluxo acadêmico levaria meses. Para quem constrói, isso é pragmático. Para a matemática, é um choque cultural, porque prova não vive só de estar correta, vive de ser legível, conectada à literatura e reutilizável. A OpenAI admite que precisa melhorar citações e exposição, e isso confirma o que qualquer operador já viu em geração longa: o modelo entrega o esqueleto lógico, mas tropeça em notação, contexto histórico e elegância. Publicar rápido resolve a pressão por transparência, mas transfere o trabalho pesado para revisores humanos.

O que isso muda na prática para quem constrói e pesquisa

Quem ganha agora é quem já tem pipeline de verificação. Grupos com acesso a provadores formais como Lean, Isabelle ou Coq, mais infraestrutura para reproduzir cálculos, conseguem filtrar o que presta nesse lote de 722 textos. Laboratórios menores, matemáticos isolados e revisores sobrecarregados perdem no curto prazo, porque terão de gastar semanas para validar algo gerado em horas. E quem constrói produtos com IA para ciência ganha um novo padrão: não basta gerar resposta que parece certa, é preciso anexar rastro, custo, tentativas e versão do modelo. A recomendação da AGMAI virou, na prática, um checklist de MLOps para pesquisa.

  • Mapeie as 372 famílias antes de ler os 722 arquivos e priorize sua subárea para não se afogar no volume.
  • Exija reprodução assistida com código, lemas intermediários e tentativas falhas quando for avaliar qualquer prova gerada por IA.
  • Registre custo e latência dos seus próprios experimentos de raciocínio longo para comparar com a média de três horas citada.

Na prática, meu ajuste imediato seria tratar esse repositório como dados brutos, não como literatura final. Eu clonaria, rodaria busca por palavras-chave da minha área, separaria resultados que citam trabalhos que conheço e marcaria tudo o mais como pendente de verificação. Para times de produto, a ação é parecida: se você usa modelo para raciocínio matemático, financeiro ou de engenharia, crie uma camada de verificação externa e log completo de computação. Não dá mais para confiar em resposta elegante sem saber quantas tentativas foram descartadas e quanto custou cada acerto. Transparência virou parte da API, mesmo que informal.

Isso escala ou só move o gargalo

A tensão real não é se a IA sabe matemática, é onde o gargalo vai parar. Antes, o limite era gerar a ideia da prova. Agora, com centenas de manuscritos saindo de uma vez, o limite vira revisão, reputação e crédito. Quem garante que cada prova não reaproveita sem citar o trabalho de um humano que passou dez anos no lema intermediário. Como fica a autoria quando o modelo foi treinado em décadas de artigos e depois cospe a síntese final. A AGMAI tocou nesse ponto ao criticar o uso de resultados como marketing, porque cada anúncio apressado corrói a confiança que sustenta a revisão por pares. Resolver o problema técnico e quebrar o processo social ao mesmo tempo não é vitória completa.

Tem também a dúvida de custo e generalização. Três horas de pensamento por resultado médio pode parecer pouco perto de anos humanos, mas é muito perto de qualquer orçamento de inferência em escala. Se o próximo lote precisar de dez horas por prova e de um modelo ainda maior e fechado, só dois ou três laboratórios vão jogar esse jogo. A matemática avançaria, mas ficaria dependente de infraestrutura privada e de modelos não auditáveis. E rivais como a Anthropic já empurram na mesma direção, com direito a ruído sobre até problema do Prêmio Millennium. A velocidade é real, mas a ciência não funciona só com velocidade, funciona com reprodução independente. Sem modelo aberto, prompts e logs, escalamos a produção de teoremas e afunilamos a capacidade de confiar neles.

Conclusão operacional

No fim, a OpenAI entregou volume recorde, processo versionável e um sinal claro de que raciocínio profundo em lote já produz matemática publicável. O que falta provar é se a comunidade consegue absorver, corrigir e creditar tudo isso sem se esgotar. Vale acompanhar menos o número de problemas resolvidos e mais quantas dessas 372 famílias sobrevivem intactas depois de seis meses de escrutínio pesado.