Bei herkömmlichen Ansätzen wird der Arbeitskontext eines Sprachmodells etwa zusammengefasst, komprimiert oder durch externe Speicherung ergänzt. Die Forschenden schlagen stattdessen vor, den Kontext wie eine Datei zu behandeln, die das Modell eigenständig bearbeiten darf. Es kann ältere Nachrichten umschreiben, wichtige Fakten erhalten, Unnötiges entfernen und den bisherigen Fortschritt festhalten. Auch erfolglose Versuche und mögliche nächste Schritte kann es in internen Notizen dokumentieren.
Untersucht wurden drei Varianten: ein untrainierter Ansatz, Anweisungen in natürlicher Sprache mit anschließender Verbesserung der Strategie sowie Reinforcement Learning. Bei der zweiten Variante kann das Modell zudem ein internes Dokument mit erlernten Verfahren zur Kontextverwaltung weiterentwickeln und später wiederverwenden. Beim Reinforcement Learning war der Aufgabenerfolg das Hauptziel; zusätzlich wurde die Recheneffizienz berücksichtigt.
In den Tests erreichte die Zero-Shot-Variante auf BrowseComp-Plus eine um 11,4 Prozent höhere Genauigkeit bei 21,5 Prozent weniger FLOPs. Auf dem 12-stündigen EdgeBench erzielte sie fünf Prozent höhere Werte und benötigte 59 Prozent weniger FLOPs. Bei einer 24-stündigen Aufgabe mit mehreren Agenten und mehreren Code-Repositories fiel die Verbesserung laut den Forschenden bei gleichem Rechenaufwand um 65 Prozent größer aus. Mit In-Context Learning stieg die Genauigkeit bei Aufgaben aus ContextBench um bis zu 35,9 Prozentpunkte, ebenfalls bei geringerem Rechenaufwand.
Beim Reinforcement Learning verbesserte sich Qwen3.5-9B auf BrowseComp-Plus von 28,8 auf 42,5 Prozent. Die relative Verbesserung betrug 47,6 Prozent, während der FLOP-Verbrauch um 12 Prozent sank. Zugleich kann ein Modell beim Bearbeiten seines Kontexts wichtige, später nicht wiederherstellbare Informationen löschen. Die Forschenden verweisen außerdem auf Sicherheitsrisiken: Prompt-Injections oder selbst erzeugte Anweisungen könnten über den veränderbaren Kontext über mehrere Gesprächsschritte hinweg bestehen bleiben. Mehr Kontrolle über den Kontext garantiere zudem nicht, dass das Modell richtig entscheidet, welche Informationen es behalten oder entfernen sollte.
