← Alle KI-News
Aionity · KI-NewsForschung

RealCompanion prüft, wie KI lange Gespräche versteht

Der Benchmark RealCompanion umfasst zehn Beziehungen zu einem KI-Begleiter und 27.218 Nachrichten aus Zeiträumen von bis zu 120 Tagen. Er soll untersuchen, ob Systeme frühere Gesprächsinhalte passend erinnern und daraus auf eine Person schließen können.

Symbolbild: RealCompanion prüft, wie KI lange Gespräche versteht
Symbolbild · KI-generiert

RealCompanion setzt bei einer Schwierigkeit bestehender Tests an: Sie erzeugen häufig sowohl die Person als auch die Fragen und legen vorab fest, welche Informationen wichtig sind. Das Paper stellt stattdessen Gesprächsverläufe aus zehn realen Beziehungen mit einem KI-Begleiter bereit. Zusammen umfassen sie 27.218 Nachrichten und reichen jeweils über bis zu 120 Tage. Die Gespräche werden durch vier daraus abgeleitete Dateien ergänzt: ein Profil, eine Persona, eine Gesprächsreferenz und einen Fragenkatalog. Die Angaben in diesen Dateien verweisen auf die Nachrichten, auf denen sie beruhen.

Auch die Kennzeichnungen der Gespräche enthalten jeweils eine Begründungskette. Diese wurde laut Paper Schritt für Schritt mit dem Gesprächsverlauf abgeglichen. So soll nachvollziehbar sein, aus welchen Nachrichten eine bestimmte Antwort oder Einschätzung hervorgeht. Der Benchmark untersucht damit nicht nur, ob ein System eine passende Antwort liefert, sondern auch, ob die dafür verwendeten Informationen im Verlauf belegt sind.

Die Auswertung zeigt nach Angaben der Forschenden, dass Erinnerungen an frühere Nachrichten bei den Testfragen selten erforderlich sind. Bei 2,2 Prozent der Fragen sei Gedächtnis nötig; zugleich finde ein zeitlich begrenztes Suchfenster die benötigte Nachricht bei 95,9 Prozent der Fragen. Die Forschenden warnen deshalb vor zusammengefassten Messwerten: Bei der üblichen Häufigkeit stammten 96 Prozent des Zugewinns durch bereitgestellte Gesprächsdaten aus Nachrichten, die für die jeweilige Frage gar nicht gebraucht würden.

Keines der getesteten Verfahren konnte zuverlässig erkennen, wann eine Erinnerung tatsächlich erforderlich war. Fragen, die eigens für dieselben Gesprächsverläufe erstellt wurden, verrieten laut Paper den Hinweis darauf; wurden Nachrichten als Erinnerungen markiert, stieg ihre Nutzung um zehn bis vierzehn Prozentpunkte. Außerdem rekonstruierten drei Agentensysteme die Persona mit demselben F1-Wert, obwohl sich ihre Kosten um den Faktor 31 unterschieden. Das Paper veröffentlicht den Benchmark samt Gesprächsdaten und abgeleiteten Dateien; die Ergebnisse beziehen sich auf die untersuchten Systeme und diesen Datensatz.

War der Artikel hilfreich?
Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

Alle KI-Meldungen live im Discord Die wichtigsten auch auf X und Bluesky.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.