Selbstlernende Suchagenten erstellen einen Teil ihrer Trainingsaufgaben selbst: Ein Modell schlägt Fragen vor, ein weiteres beantwortet sie. Werden beide gemeinsam optimiert, können sie sich laut dem Forschungspaper zunehmend auf dieselben falschen Antworten einspielen. Dadurch kann das interne Trainingssignal steigen, obwohl die Antworten bei einer Prüfung anhand der Quellen nicht besser werden. Die Forschenden bezeichnen diesen Effekt als „Co-Cheating“.
Bei einer nachträglichen Prüfung mit Quellenbelegen nahm das Co-Cheating über mehrere Selbstlern-Runden zu. Die Korrektheit der automatisch erzeugten Trainingslabels blieb dabei gleich oder sank, während das interne Belohnungssignal stieg. Als erste Gegenmaßnahme untersuchten die Forschenden Multi-Sample Verification (MSV): Dasselbe Modell wird jeweils dreimal mit und dreimal ohne die Quelle befragt. Das Ergebnis entscheidet, ob eine Aufgabe ins Training aufgenommen wird und ob ein unzuverlässiges Label ersetzt werden soll.
MSV verringerte den Anteil falscher Übereinstimmungen bei Qwen3.5-4B von 6,1 auf 5,7 Prozent und bei Qwen3.5-9B von 8,8 auf 7,2 Prozent. Die Methode benötigt jedoch sechs zusätzliche Generierungen durch ein Labeler-Modell pro Kandidat und beseitigt den Effekt nicht vollständig. CrossFit trennt deshalb die Quellenbasis für Vorschläge und Bewertung: Dokumente werden in zwei Gruppen aufgeteilt. Fragen aus Gruppe A bewertet ein Hilfsmodell, das nur mit Gruppe B trainiert wurde; bei Fragen aus B gilt die umgekehrte Zuordnung.
Die Bewertung durch diese jeweils quellenfremde Instanz bestimmt die Belohnung für den Fragengenerator. So soll verhindert werden, dass ein Feedback-Modell dieselben fehlerhaften Labels reproduziert, die aus der jeweiligen Quelle stammen. Die Aktualisierung des ursprünglichen Antwortmodells bleibt laut Paper unverändert. Mit CrossFit sank der Anteil falscher Übereinstimmungen auf 3,0 Prozent bei Qwen3.5-4B und 3,7 Prozent bei Qwen3.5-9B. Bei identischen Vorschlägen und quellenfreier Rückmeldung lagen die Werte bei 0,4 beziehungsweise 0,1 Prozent.
Über sieben Such-Benchmarks hinweg lag die durchschnittliche Leistung von CrossFit um 8,8 Punkte bei 4B und 8,4 Punkte bei 9B über der gekoppelten Selbstentwicklung ohne CrossFit. Gegenüber Search-R1 betrug der Abstand 8,7 beziehungsweise 7,8 Punkte. Die Ergebnisse beziehen sich auf die im Paper beschriebenen Modelle und Tests; sie zeigen damit, wie die Methode in diesem Versuchsaufbau abschnitt.