RRSI steht für Regularized Recursive Self-Improvement. Das Tutorial beschreibt ein Verfahren, bei dem ein Agent seine Prompts, Werkzeuge, sein Gedächtnis, seinen Kontrollablauf und seine Unteragenten verändern kann. Das Sprachmodell selbst bleibt dabei eingefroren. Ziel ist, zu verhindern, dass der Agent seine Struktur zu stark an jene Aufgaben anpasst, anhand derer Änderungen entwickelt werden.
Der vollständige Ablauf lässt Änderungen von Claude Opus auf Vertex AI entwerfen und bewertet sie in Docker-Benchmarks. Das Tutorial führt stattdessen vor allem die Python-Regeln aus, die entscheiden, welche Änderungen übernommen werden. Es installiert dafür das Paket aus dem Google-Research-Repository und bindet es an den Commit `be50316e1db05914068a973f322770ef08ed7ba1`. Laut Tutorial benötigt die gezeigte Ausführung weder einen API-Schlüssel noch eine GPU oder einen Datensatz-Download.
Zu den behandelten Bausteinen gehören eine Schätzung von Leistung und Kosten, eine kalibrierte Rauschgrenze sowie zwei Zweige des Auswahlverfahrens. Hinzu kommen ein schrittweise angepasstes Änderungsbudget, eine deterministische Prüfung auf Datenlecks und eine Historie der vorgenommenen Änderungen. Die Konfiguration enthält unter anderem Werte für die Zahl der Runden, Versuche pro Aufgabe und Kandidaten pro Runde. Das Tutorial ordnet diese Einstellungen den Funktionen im Paket zu.
Für den praktischen Vergleich wird eine simulierte Agentenumgebung an die RRSI-Schnittstelle `Domain` angeschlossen. Weil die Umgebung selbst erstellt ist, lässt sich laut Tutorial die tatsächliche Wirkung jeder Änderung nachvollziehen. Die Auswahlentscheidungen von RRSI werden außerdem einer Suche ohne Regularisierung gegenübergestellt, die jeweils die Änderung mit der höchsten Bewertung behält. Damit zeigt das Beispiel die Bewertungs- und Auswahlregeln, nicht den vollständigen Ablauf mit Claude Opus und Docker-Benchmarks.
