← Alle KI-News
Aionity · KI-NewsModelle

Sakana AI testet ein KI-System auf Fehler in Forschungsarbeiten

Sakana AI stellt mit Multi-Layered Review ein Verfahren für KI-gestützte Peer-Reviews vor. In einem eigens aufgebauten Test erkannte es 73,43 Prozent der eingebauten Widersprüche in Kernaussagen – deutlich mehr als das beste Vergleichssystem.

Symbolbild: Sakana AI testet ein KI-System auf Fehler in Forschungsarbeiten
Symbolbild · KI-generiert

Die Arbeit „Beyond Imitation“ untersucht, ob KI-Systeme Fehler in wissenschaftlichen Arbeiten finden können, statt lediglich menschliche Rezensionen nachzuahmen. Dazu entwickelte Sakana AI sowohl den Contradiction Benchmark als auch das Review-System Multi-Layered Review (MLR). Der Benchmark umfasst 1.164 gezielt eingefügte Widersprüche in 257 Arbeiten aus fünf Konferenzen: ACL, AISTATS, CVPR und ICML 2025 sowie NeurIPS 2024.

MLR nutzt drei Agenten mit den API-Modellen Claude Haiku 3.5 und Claude Sonnet 4. Ein Agent fasst Angaben zu Experimenten und Implementierung aus dem Anhang zusammen. Ein weiterer kann optional per Websuche frühere Forschung einordnen. Der Review-Agent erstellt zunächst eine grobe Übersicht, prüft die Arbeit anschließend im Detail und führt die Ergebnisse schliesslich zu einer Rezension mit Stärken, Schwächen, Fragen, Bewertung und Aufgabenliste zusammen. Das System verarbeitet PDF-Dateien und benötigt laut Sakana AI weder Fine-Tuning noch eine GPU.

Im Benchmark erkannte MLR mit vier Rezensionen 73,43 Prozent der Widersprüche, die eine zentrale Kernaussage betrafen. Über alle Schweregrade hinweg lag die Erkennungsrate bei 40,95 Prozent. Das beste Vergleichssystem, AgentReview, fand 14,81 Prozent der Fehler in Kernaussagen. Schon ein einzelner MLR-Durchlauf erreichte dort 60,79 Prozent. Die Bewertung der Rezensionen erfolgte durch ein weiteres KI-Modell; auf fehlerfreien Arbeiten lag dessen Genauigkeit bei 99,9 Prozent.

Bei 211 tatsächlich zurückgezogenen arXiv-Arbeiten fiel die Trefferquote geringer aus: MLR erzielte 26,07 Prozent bei ähnlichen und 16,11 Prozent bei exakten Übereinstimmungen. Auch die Übereinstimmung mit menschlichen Bewertungen war nicht durchgehend gleich: Für ICLR-2025-Einreichungen betrug die Korrelation 0,586, verglichen mit 0,742 zwischen menschlichen Bewertungen. Bei ICML 2025 lag MLR mit 0,429 knapp unter AI Reviewer mit 0,439. Eine Rezension kostet laut Sakana AI ungefähr 0,47 US-Dollar, ohne den optionalen Literatur-Agenten. Verdeckte Prompt-Injection-Angriffe beeinflussten weiterhin alle getesteten KI-Reviewer.

War der Artikel hilfreich?

💡 Tipp: Wenn du einen KI-gestützten Review-Workflow entwickelst, kannst du MLRs Erkennungsrate bei Kernaussagen als Vergleichswert für eigene Tests heranziehen.

Einzelne Quelle. Wir haben diese Meldung bisher nur bei einem Medium gefunden.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

Alle KI-Meldungen live im Discord Die wichtigsten auch auf X und Bluesky.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.