Die Arbeit „Beyond Imitation“ untersucht, ob KI-Systeme Fehler in wissenschaftlichen Arbeiten finden können, statt lediglich menschliche Rezensionen nachzuahmen. Dazu entwickelte Sakana AI sowohl den Contradiction Benchmark als auch das Review-System Multi-Layered Review (MLR). Der Benchmark umfasst 1.164 gezielt eingefügte Widersprüche in 257 Arbeiten aus fünf Konferenzen: ACL, AISTATS, CVPR und ICML 2025 sowie NeurIPS 2024.
MLR nutzt drei Agenten mit den API-Modellen Claude Haiku 3.5 und Claude Sonnet 4. Ein Agent fasst Angaben zu Experimenten und Implementierung aus dem Anhang zusammen. Ein weiterer kann optional per Websuche frühere Forschung einordnen. Der Review-Agent erstellt zunächst eine grobe Übersicht, prüft die Arbeit anschließend im Detail und führt die Ergebnisse schliesslich zu einer Rezension mit Stärken, Schwächen, Fragen, Bewertung und Aufgabenliste zusammen. Das System verarbeitet PDF-Dateien und benötigt laut Sakana AI weder Fine-Tuning noch eine GPU.
Im Benchmark erkannte MLR mit vier Rezensionen 73,43 Prozent der Widersprüche, die eine zentrale Kernaussage betrafen. Über alle Schweregrade hinweg lag die Erkennungsrate bei 40,95 Prozent. Das beste Vergleichssystem, AgentReview, fand 14,81 Prozent der Fehler in Kernaussagen. Schon ein einzelner MLR-Durchlauf erreichte dort 60,79 Prozent. Die Bewertung der Rezensionen erfolgte durch ein weiteres KI-Modell; auf fehlerfreien Arbeiten lag dessen Genauigkeit bei 99,9 Prozent.
Bei 211 tatsächlich zurückgezogenen arXiv-Arbeiten fiel die Trefferquote geringer aus: MLR erzielte 26,07 Prozent bei ähnlichen und 16,11 Prozent bei exakten Übereinstimmungen. Auch die Übereinstimmung mit menschlichen Bewertungen war nicht durchgehend gleich: Für ICLR-2025-Einreichungen betrug die Korrelation 0,586, verglichen mit 0,742 zwischen menschlichen Bewertungen. Bei ICML 2025 lag MLR mit 0,429 knapp unter AI Reviewer mit 0,439. Eine Rezension kostet laut Sakana AI ungefähr 0,47 US-Dollar, ohne den optionalen Literatur-Agenten. Verdeckte Prompt-Injection-Angriffe beeinflussten weiterhin alle getesteten KI-Reviewer.
