GitHub hat mit ReviewBench einen offenen Benchmark für KI-gestützte Code-Reviews vorgestellt. Er soll die Leistung von Agenten bewertbar machen, die Änderungen in Code überprüfen. Als Grundlage dienen repräsentative Pull-Requests von GitHub. Damit richtet sich der Test auf Code-Reviews in konkreten Projekten und nicht nur auf isolierte Codebeispiele.
Für die Bewertung nutzt ReviewBench nach der Beschreibung von GitHub sogenannte Multi-Source Ground Truth. Das bezeichnet hier eine Bewertungsgrundlage, die aus mehreren Quellen gespeist wird. Der verfügbare Auszug nennt außerdem eine Kalibrierung als Bestandteil des Benchmarks, führt den Gedanken dazu aber nicht vollständig aus. Weitere Angaben zu Bewertungsmaßstäben oder zum Umfang des Datensatzes liegen in den vorliegenden Informationen nicht vor.
In der von GitHub veröffentlichten Rangliste erreicht Copilot den ersten Platz. Ein unabhängiger Test bewertet das Ergebnis anders. Welche Systeme dort verglichen wurden und wie die abweichende Bewertung zustande kommt, geht aus den vorliegenden Angaben nicht hervor. Die unterschiedlichen Resultate zeigen, dass die Platzierung von Copilot nicht als einheitliches Testergebnis dargestellt werden kann.
ReviewBench ist als offener Benchmark angelegt. Sein Zweck ist, KI-Code-Reviews anhand einer gemeinsamen Grundlage vergleichbar zu machen. Die genannten Informationen liefern jedoch keine Einzelwerte zu den getesteten Agenten und keine näheren Details dazu, wie die Qualität der Reviews oder vorgeschlagene Korrekturen bewertet werden. Auch die Rangliste lässt sich deshalb hier nicht über den ersten Platz von Copilot hinaus einordnen.
