Die am 6. Oktober 2026 angekündigte Sammlung umfasst laut OpenAI mathematische Ergebnisse eines internen Frontier-Modells. Nach Angaben des Unternehmens bearbeitete das Modell rund 4.000 Probleme. Veröffentlicht wurden 722 Manuskripte, aufgeteilt in 372 Forschungsfamilien. Sie behandeln unter anderem Themen aus Zahlentheorie, theoretischer Informatik und mathematischer Physik. Dazu zählen Ansätze zu einer schwächeren Form der Riemannschen Vermutung, zu zwei Hilbertschen Problemen und zur NP-Schwere.
Das GitHub-Repository enthält Protokolle für Überarbeitungen und Zitierungen. Für viele Beweise gibt es zudem Formalisierungen in Lean, einer Programmiersprache für computerprüfbare mathematische Beweise. OpenAI will weitere Formalisierungen ergänzen, sobald sie vorliegen. Das Repository enthält außerdem zehn Zusammenfassungen der Modellüberlegungen sowie Statistiken zu den bearbeiteten Aufgaben und Schätzungen des Rechenaufwands. OpenAI beziffert den durchschnittlichen Aufwand pro Ergebnis auf ungefähr drei Stunden ChatGPT-Pro-Denkzeit.
Die formale Prüfung mit Lean kann nachvollziehen, ob die einzelnen Beweisschritte den festgelegten Regeln entsprechen. Sie beurteilt jedoch nicht automatisch, ob ein Ergebnis wissenschaftlich relevant oder originell ist. In der Fachwelt gibt es laut dem vorliegenden Bericht Bedenken, ob die große Zahl an KI-generierten Arbeiten ausreichend von Menschen geprüft werden kann und wie sich die Originalität der Lösungswege beurteilen lässt.
OpenAI erklärt, es habe sich vor der Veröffentlichung mit der unabhängigen Advisory Group on Mathematics and Artificial Intelligence am Institute for Advanced Study beraten. Das Unternehmen will Workshops, Konferenzen und spezielle Programme finanzieren, die der Einordnung wichtiger KI-Ergebnisse dienen sollen; Einzelheiten dazu sollen folgen. Außerdem arbeitet OpenAI nach eigenen Angaben an einer verantwortungsvollen Veröffentlichung des verwendeten Modells und will interne Modelle weiterhin in Mathematik und anderen Wissenschaften evaluieren.
