Agenten lernen in AgentGarten in virtuellen Welten, die sie erkunden und in Echtzeit beeinflussen können. Die Umgebungen sollen dabei sowohl verlässliche Regeln und Zustände als auch realistische visuelle Eindrücke bieten. Dafür verbindet das Framework unterschiedliche Simulations-Backends mit einem Renderer, der Beobachtungen aus strukturierten Angaben zu den Welten erzeugt. Eine gemeinsame Schnittstelle soll die Verwendung verschiedener Umgebungen ermöglichen.
Die Simulations-Backends halten den Zustand einer Welt dauerhaft fest und führen Interaktionsregeln aus, die als Programm definiert sind. Der Renderer erzeugt daraus visuelle Ansichten. Für ihn wurde ein vortrainiertes Videomodell an Geometriebedingungen angepasst und anschließend mit einem Verfahren namens Adversarial Forcing weiter trainiert. Dabei können frühere Beobachtungen exakt wiederholt werden, sodass spätere Vorhersagen rückwirkend beeinflussen, wie der Renderer diese früheren Eindrücke verarbeitet. Zusätzlich fließen Trainingssignale aus realen Daten ein.
Die Agenten nehmen die Welt über Bilder wahr und handeln darin in Echtzeit. Nach jeder Lernrunde werden Erfahrungen in sogenannten Playbooks zusammengefasst. Nachfolgende Agenten übernehmen diese Sammlungen und können sie weiterentwickeln. So baut das Framework auf vorherigen Durchläufen auf, statt jede Runde unabhängig zu beginnen.
In der empirischen Untersuchung berichten die Forschenden von einem deutlichen Unterschied beim Lernaufwand: Agenten erreichten ein Lernergebnis nach vier Runden, während ein Vergleich mit herkömmlichem Reinforcement Learning Millionen Runden benötigte. Die Anzahl und Schwierigkeit der Umgebungen sollen sich erweitern lassen, indem neue Welten als Code geschrieben und über dieselbe Schnittstelle gerendert werden. Das Paper beschreibt damit einen Ansatz, bei dem Agenten ihre Fähigkeiten durch wiederholte Interaktion und weitergegebene Erfahrungen ausbauen.
