PesquisaEm alta

OpenAI publica 722 manuscritos de matemática de um modelo sem nome

A OpenAI publicou 722 manuscritos de matemática produzidos por um modelo interno que ela não revelou, não precificou e não oferece em nenhuma API. Os textos vieram com provas formais em Lean, mas boa parte dos resultados ainda não passou por verificação independente.

Mariana SilvaMariana Silva
Popularidade: 1,500
OpenAI publica 722 manuscritos de matemática de um modelo sem nome

A OpenAI publicou 722 manuscritos de matemática produzidos por um modelo interno que ela não revelou, não precificou e não oferece em nenhuma API. Os textos vieram com provas formais em Lean, mas boa parte dos resultados ainda não passou por verificação independente.

O que a OpenAI publicou em matemática

Em 6 de outubro, a OpenAI publicou um artigo de pesquisa chamado "Sharing AI progress in mathematics" e, no mesmo dia, apareceu um repositório no GitHub com o endereço openai/math. Juntos, os dois trazem 722 manuscritos de matemática organizados em 372 famílias, sob licença aberta.

Cada família agrupa artigos relacionados, como um resultado principal e seus desdobramentos, e é classificada por área da matemática. O acervo é acompanhado de formalizações em Lean, uma linguagem que permite a um computador checar se uma prova está correta, além de resumos enxutos do raciocínio do modelo.

Segundo o texto, a maior parte dos resultados saiu do mesmo procedimento: um modelo interno de fronteira recebeu cerca de 4 mil problemas ao longo da avaliação. Em média, cada resultado consumiu o equivalente a cerca de três horas de raciocínio do ChatGPT Pro, o plano de assinatura mais caro da empresa.

O modelo que assinou os manuscritos não tem nome

O detalhe que chama atenção é a autoria. Os manuscritos saíram de um modelo interno que a OpenAI não nomeou, não colocou à venda e não expôs em API. Trata-se de um sistema usado em avaliações internas de desenvolvimento, e não de um produto que qualquer pessoa possa chamar.

Isso deixa a comunidade numa posição incomum. Os resultados matemáticos estão públicos e podem ser checados, mas a ferramenta que os produziu não. Não dá para reproduzir por conta própria o que o modelo fez para chegar ali, nem medir seu desempenho em outros problemas. O valor do que foi publicado depende, então, de verificar cada prova por si, e não de confiar no sistema que as gerou.

Modelo sem nome. Prova sem dono? Não exatamente.

Como funcionam as provas em Lean e a verificação

Lean é uma linguagem de programação usada para escrever provas de modo que um computador possa conferir cada passo. Quando uma prova é traduzida para Lean e passa no checador, há uma garantia mecânica de que ela não tem furos lógicos, o que é bem mais forte do que a leitura humana de um artigo.

O problema é a cobertura. Muitos manuscritos vieram com formalizações em Lean, mas não todos. O próprio README do repositório avisa que resultados sem formalização podem conter erros, e a OpenAI diz que pretende corrigir eventuais falhas e atualizar o acervo com novas formalizações conforme elas forem obtidas. Segundo a empresa, ajudou a preparar os manuscritos e a formalizar as provas, mas a argumentação matemática em si foi gerada pelo sistema.

Sem formalização, sem garantia.

Reportagens também mencionam que a OpenAI compartilhou uma solução gerada por IA para um problema do milênio, o Navier-Stokes, com prova em Lean. Vale tratar esse ponto com cautela: um arquivo em Lean só vale tanto quanto a sua verificação, e o status desse material específico ainda estava sendo discutido.

O que a matemática ganha e o que fica em aberto

Para quem pesquisa matemática, o acervo é útil de um jeito prático: são centenas de resultados organizados e, quando há prova em Lean, prontos para checagem automática. Uma máquina confere cada passo lógico, então um resultado formalizado pode ser validado com rapidez, sem depender de um revisor humano demorado.

O que fica em aberto é a verificação independente. Formalizar uma prova não é o mesmo que saber que ela está completa e correta, e o próprio README reconhece que existe material sem essa garantia. Até que pesquisadores de fora reexecutem as provas e publiquem as conclusões, o tamanho do avanço real segue em discussão. A OpenAI também diz que vai manter o histórico público do acervo, registrando correções e revisões como novas versões, o que é um caminho razoável para esse tipo de conteúdo.

Como acompanhar os resultados da OpenAI em matemática

Se você quer avaliar o material, o ponto de partida é o repositório openai/math, onde cada manuscrito traz os arquivos de PDF, o código-fonte e instruções de citação. Quem tem familiaridade com Lean pode tentar rodar as formalizações disponíveis e ver quais passam no checador. Quem não tem esse conhecimento ainda pode acompanhar o debate público, que deve se concentrar justamente em quantos resultados sobrevivem a uma checagem independente nos próximos meses. Essa resposta é o que vai separar um acervo grande de um avanço comprovado.

Compartilhar esta notícia

Fontes

Notícias de IA relacionadas

Mesa de reunião escura com um livro antigo aberto e um painel luminoso de circuitos ao fundo, em tons de âmbar e azul profundo
Pesquisa

Anthropic reuniu líderes religiosos para debater se o Claude pode ter consciência

A Anthropic consultou dezenas de estudiosos de religião sobre a possível consciência do Claude, segundo o The New York Times. A empresa usa uma constituição de 84 páginas para guiar o modelo.

Popularidade: 1,200
DeepSeek abre código de sua pilha de IA para os chips Huawei Ascend
Pesquisa

DeepSeek abre código de sua pilha de IA para os chips Huawei Ascend

A DeepSeek liberou como código aberto um conjunto de ferramentas para programar os chips Ascend, da Huawei, com componentes que espelham o que já havia publicado para o hardware da Nvidia.

Popularidade: 1,450
Ferramentas de avaliação de LLM: Promptfoo, DeepEval e RAGAS
Pesquisa

Ferramentas de avaliação de LLM: Promptfoo, DeepEval e RAGAS

Escolher o modelo é a parte fácil. Difícil é medir se ele continua funcionando depois que você mexe no prompt. Estas são as ferramentas que fazem esse trabalho.

Popularidade: 980
O que significa LLM? Como funciona um grande modelo de linguagem
Pesquisa

O que significa LLM? Como funciona um grande modelo de linguagem

LLM virou sigla obrigatória em qualquer conversa sobre tecnologia, e quase ninguém explica de onde ela vem. Este guia traduz o termo, mostra o que acontece por dentro e onde o modelo costuma errar.

Popularidade: 1,180