RealCompanion setzt bei einer Schwierigkeit bestehender Tests an: Sie erzeugen häufig sowohl die Person als auch die Fragen und legen vorab fest, welche Informationen wichtig sind. Das Paper stellt stattdessen Gesprächsverläufe aus zehn realen Beziehungen mit einem KI-Begleiter bereit. Zusammen umfassen sie 27.218 Nachrichten und reichen jeweils über bis zu 120 Tage. Die Gespräche werden durch vier daraus abgeleitete Dateien ergänzt: ein Profil, eine Persona, eine Gesprächsreferenz und einen Fragenkatalog. Die Angaben in diesen Dateien verweisen auf die Nachrichten, auf denen sie beruhen.
Auch die Kennzeichnungen der Gespräche enthalten jeweils eine Begründungskette. Diese wurde laut Paper Schritt für Schritt mit dem Gesprächsverlauf abgeglichen. So soll nachvollziehbar sein, aus welchen Nachrichten eine bestimmte Antwort oder Einschätzung hervorgeht. Der Benchmark untersucht damit nicht nur, ob ein System eine passende Antwort liefert, sondern auch, ob die dafür verwendeten Informationen im Verlauf belegt sind.
Die Auswertung zeigt nach Angaben der Forschenden, dass Erinnerungen an frühere Nachrichten bei den Testfragen selten erforderlich sind. Bei 2,2 Prozent der Fragen sei Gedächtnis nötig; zugleich finde ein zeitlich begrenztes Suchfenster die benötigte Nachricht bei 95,9 Prozent der Fragen. Die Forschenden warnen deshalb vor zusammengefassten Messwerten: Bei der üblichen Häufigkeit stammten 96 Prozent des Zugewinns durch bereitgestellte Gesprächsdaten aus Nachrichten, die für die jeweilige Frage gar nicht gebraucht würden.
Keines der getesteten Verfahren konnte zuverlässig erkennen, wann eine Erinnerung tatsächlich erforderlich war. Fragen, die eigens für dieselben Gesprächsverläufe erstellt wurden, verrieten laut Paper den Hinweis darauf; wurden Nachrichten als Erinnerungen markiert, stieg ihre Nutzung um zehn bis vierzehn Prozentpunkte. Außerdem rekonstruierten drei Agentensysteme die Persona mit demselben F1-Wert, obwohl sich ihre Kosten um den Faktor 31 unterschieden. Das Paper veröffentlicht den Benchmark samt Gesprächsdaten und abgeleiteten Dateien; die Ergebnisse beziehen sich auf die untersuchten Systeme und diesen Datensatz.
