700 provas de uma vez: o que a OpenAI realmente soltou
Provas matemáticas geradas por IA deixaram de ser um benchmark curioso e viraram um problema operacional para quem vive de pesquisa. No dia 6 de outubro de 2026, a OpenAI publicou mais de 700 manuscritos de uma só vez no GitHub, afirmando ter resolvido centenas de problemas em aberto. Não foi um paper isolado, foi uma descarga. O blog Proofs and Prompts reuniu mais de 100 respostas de pesquisadores e o tom varia entre fascínio intelectual, choque, paralisia e luto por um modo de trabalhar que parecia protegido da automação.
Para entender o baque, é preciso lembrar de onde viemos. Há poucos anos, modelos de linguagem erravam questões que um bom aluno de graduação resolvia com rotina. A partir de meados de 2026, a curva mudou. Veio a Unit Distance Conjecture, vieram avanços em Navier-Stokes e depois dez soluções apresentadas no lançamento do modelo Astra. O lote de outubro é a tentativa de transformar esses picos em demonstração de escala. A mensagem implícita é clara: se o modelo resolveu dezenas, por que não centenas em paralelo.
O fato, sem enfeite
O que aconteceu é simples e incômodo ao mesmo tempo. A OpenAI subiu centenas de PDFs e códigos, reivindicando provas novas para problemas conhecidos e alguns bem difíceis. Ainda é cedo para dizer o que se sustenta. Alguns manuscritos já foram retirados, outros foram criticados por serem quase ilegíveis para humanos. Mesmo assim, vários nomes pesados disseram ter ficado impressionados. Ben Green afirmou que ficou absolutamente chocado, porque o lote teria resolvido cerca de três quartos das metas de um grant europeu prestigioso que ele havia recebido em junho. Roman Sauer reconheceu uma técnica que desenvolveu ao longo de anos aplicada pela IA em dois problemas totalmente diferentes. Ele resumiu com um estou atônito.
Os nomes maiores tentaram colocar freio e contexto. Peter Scholze pediu paciência e lembrou que matemática é uma maratona, não uma corrida de velocidade, e que o objetivo continua sendo a compreensão humana, que leva tempo. Terence Tao teve uma reação mista. Ele viu ideias novas e inteligentes que podem render frutos depois de digeridas, mas lamentou a ausência de pessoas para discutir o trabalho, apresentar em seminários e ensinar aos alunos. Ele falou em caminho não percorrido e pediu união da comunidade. Alvaro Lozano-Robledo chamou o dia 6 de outubro de possivelmente o dia mais importante da história da matemática até aqui, mas ponderou que a OpenAI mirou a Hipótese de Riemann e entregou apenas uma variante mais fraca, a quase RH. É enorme, mas não é a RH. Hugo Duminil-Copin, medalha Fields de 2022, escreveu que já esperava ser superado de forma sistemática um dia, mas que a força do anúncio o pegou desprevenido.
Como um modelo cospe matemática nova
A OpenAI não detalhou o pipeline completo, mas dá para inferir bastante a partir do padrão recente de sistemas de raciocínio. O cenário mais plausível não é um único prompt gerando um PDF. É um sistema agentic rodando com muito compute em tempo de teste, que alterna entre rascunho informal, tentativa de formalização, busca em literatura e autocrítica. Provavelmente há um loop com verificadores formais do tipo Lean ou Coq para filtrar passos inválidos, mais heurísticas para propor lemas intermediários e atacar casos particulares antes de generalizar. Quando o verificador trava, o agente volta, reescreve a estratégia e tenta outra decomposição do problema.
Em termos de operador, pense em arquitetura, custo e latência. Arquitetura: orquestração de agentes com memória longa, acesso a arXiv e a bases de provas, mais ferramentas de computação simbólica e numérica. Custo: gerar centenas de provas longas com cadeias de raciocínio de milhões de tokens não é barato. Mesmo com queda no preço por token, cada tentativa séria pode custar de dezenas a centenas de dólares em inferência, e as tentativas descartadas multiplicam isso. Ninguém confirma números, mas é razoável supor que o lote inteiro custou na casa de centenas de milhares de dólares só em compute, sem contar engenharia. Latência: não é chat. É batch de horas ou dias por problema, com paralelismo massivo. Isso explica por que veio em lote no GitHub e não como API interativa.
Johannes Schmitt levantou um ponto que faz muito sentido para quem constrói produto. Ele argumentou que os papers são um subproduto do esforço para melhorar os modelos, não um projeto puro de avanço da matemática. Quando os benchmarks fáceis saturam, problemas em aberto viram o novo teste de estresse. Ian Agol fez outra comparação útil ao lembrar de Grigori Perelman em 2002, que publicou a prova de um dos maiores resultados do século com poucas palestras e deixou para várias equipes reconstruir os passos faltantes durante anos. A diferença agora é que quem jogou a bomba não foi um matemático recluso, foi uma empresa de um trilhão de dólares. O gargalo deixou de ser encontrar a ideia e passou a ser validar e entender a ideia.
O que isso muda para quem pesquisa e constrói
Quem ganha no curto prazo é quem já trabalha na fronteira entre matemática e computação. Grupos com pipeline de verificação formal, bons revisores e acesso a compute conseguem garimpar o lote, validar o que presta e publicar a versão humana e legível antes dos outros. Departamentos que investiram em Lean, Isabelle e assistentes de prova estão em vantagem. Quem perde, pelo menos agora, é o pesquisador que depende de um ciclo lento de um problema por ano, sem automação, e o aluno que precisa de exposição didática para entrar na área. Tao acertou no ponto sensível: prova sem gente para explicar, ensinar e conectar com outros resultados vale menos para a comunidade, mesmo que esteja correta.
Tem também um alerta que vai além da matemática. Scholze avisou que sistemas capazes desse nível de descoberta algorítmica podem eventualmente encontrar formas de quebrar criptografia amplamente usada. A dificuldade de achar esses algoritmos, na visão dele como não especialista em segurança, não parece muito maior do que o que esses sistemas já demonstram. Se isso se confirmar, o impacto na infraestrutura digital seria catastrófico. Não é motivo para pânico imediato, mas é motivo para levar criptoagilidade e criptografia pós quântica muito mais a sério a partir de agora.
Se você orienta, estuda ou constrói com IA para ciência, faça uma ação prática nesta semana. Monte um funil de triagem para provas geradas por IA. Primeiro, separe os manuscritos por área e priorize os que citam lemas que você consegue testar em código. Segundo, rode verificação assistida com Lean ou ao menos cheque computacional dos casos base e das construções explícitas. Terceiro, reescreva o argumento central em uma página, com suas palavras, antes de citar como válido. Essa disciplina simples separa o que é ideia aproveitável do que é ruído bem formatado e evita que seu grupo construa em cima de prova retratada dias depois.
- Regra de ouro: não cite prova de IA sem reproduzir o lema chave você mesmo, em código ou no papel.
- Para labs: crie uma fila de verificação com dois revisores humanos e um agente verificador, com status público de validado, duvidoso ou refutado.
- Para alunos: use o lote como exercício de leitura crítica, tente quebrar a prova antes de tentar entender por completo.
Isso escala ou só move o gargalo?
Aqui está a tensão real. Gerar é barato perto de verificar. A OpenAI mostrou que consegue produzir volume, mas a matemática não vive de volume, vive de confiança e de conexões. Se cada prova exige meses de trabalho humano para tornar legível, corrigir buracos e integrar ao resto da teoria, então não resolvemos o gargalo, só mudamos ele de lugar. Saímos da escassez de ideias para a escassez de atenção qualificada. E atenção qualificada não escala com GPU, escala com formação, tempo e seminário.
Há ainda a questão da beleza, que apareceu em várias reações com certo desgosto. Uma prova elegante ensina um truque reutilizável, cria intuição e abre portas. Uma prova de 200 páginas cuspida por busca massiva pode estar certa e mesmo assim ser pedagogicamente inútil. O risco é inundarmos o arXiv com resultados corretos porém opacos, que ninguém consegue ensinar. Isso não é detalhe estético, é custo de manutenção do conhecimento. Ciência que ninguém entende vira caixa preta, e caixa preta cobra juros em forma de erros sutis, dependências frágeis e retratações silenciosas.
No fim, quem entende a matemática?
O lote da OpenAI provavelmente vai deixar um saldo misto: alguns resultados verdadeiramente novos e férteis, vários resultados menores inflados como grandes avanços e uma parte que não vai sobreviver à revisão. O progresso é real, o método de lançamento foi brutal e a comunidade ainda está processando o luto. A pergunta que fica não é se a IA vai provar teoremas, porque ela já está provando. A pergunta é quem vai ter tempo, incentivo e estrutura para transformar essas provas em entendimento humano duradouro.



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.