← Alle KI-News
Aionity · KI-NewsForschung

Learn2Play Bench prüft, wie LLM-Agenten aus Spielen lernen

Ein neues Benchmark testet, ob LLM-Agenten Regeln durch wiederholtes Spielen erschließen und ihr Wissen übertragen können. Laut den Forschenden schnitten Menschen bei den höchsten erreichten Punktzahlen besser ab als die untersuchten Agenten.

Symbolbild: Learn2Play Bench prüft, wie LLM-Agenten aus Spielen lernen
Symbolbild · KI-generiert

Learn2Play Bench besteht aus eigens entwickelten textbasierten Spielen. Deren Regeln sind entweder neuartig oder so ungewöhnlich, dass Agenten sie nicht einfach aus ihren Trainingsdaten oder aus den Spielanweisungen übernehmen können. Stattdessen müssen sie durch Interaktionen herausfinden, welche Aktionen zum Erfolg führen. Das soll sichtbar machen, ob ein Agent tatsächlich aus seinen Erfahrungen lernt oder vor allem vorhandenes Wissen und Schlussfolgerungsfähigkeiten nutzt.

Die Spiele liefern nach jedem Zug eine Rückmeldung und werden automatisch bewertet. Agenten können mehrere Versuche unternehmen, sodass sich ihre Leistung über wiederholte Durchläufe vergleichen lässt. Zudem variieren die Forschenden die Spielsituationen. Damit prüfen sie, ob ein Agent Erkenntnisse aus einem Spiel auf eine veränderte Situation übertragen kann. Untersucht werden außerdem unterschiedliche Basismodelle, Verfahren zur Weiterentwicklung der Agenten und sogenannte Agent-Harnesses, also die Umgebung und Abläufe, mit denen ein Modell Aufgaben bearbeitet.

Eine zentrale Beobachtung betrifft den Umgang mit bisherigen Erfahrungen: Agenten konnten laut Paper wirksamer lernen, wenn sie vollständige Aufzeichnungen ihrer Aktionen und der darauf folgenden Rückmeldungen behielten. Eine Zusammenfassung in Form von Regeln oder Strategien schnitt demgegenüber schlechter ab. Das Ergebnis bezieht sich auf die untersuchten Spiele und Agenten; das Paper beschreibt damit keinen allgemeinen Nachweis, dass vollständige Protokolle bei jeder Aufgabe überlegen sind.

Auch im Vergleich mit Menschen zeigte sich ein Abstand. Die besten menschlichen Spielerinnen und Spieler erzielten höhere Spitzenwerte als die getesteten Agenten. Sie probierten vielfältigere Vorgehensweisen aus und wiederholten Aktionen seltener. Bei festgehaltenem Basismodell konnte zudem eine Änderung des Agent-Harnesses die Leistung verbessern und zugleich die geschätzten Kosten für die Inferenz senken. Learn2Play Bench soll damit verschiedene Einflüsse auf das Lernen in kontrollierten Spielsituationen vergleichbar machen; konkrete Zahlen zu den Punkteständen oder Kosten enthält die vorliegende Zusammenfassung der Ergebnisse nicht.

War der Artikel hilfreich?
Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

Alle KI-Meldungen live im Discord Die wichtigsten auch auf X und Bluesky.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.