← Alle KI-News
Aionity · KI-NewsForschung

NVIDIA trainiert KI-Agenten, nach frühen Fehlern wieder aufzuholen

PivotOPD soll mehrstufige KI-Agenten darauf trainieren, folgenreiche frühe Fehler zu vermeiden und sich davon zu erholen. In Tests mit drei Agenten-Benchmarks erzielte das Verfahren im Durchschnitt die besten Ergebnisse unter 13 verglichenen Methoden.

Symbolbild: NVIDIA trainiert KI-Agenten, nach frühen Fehlern wieder aufzuholen
Symbolbild · KI-generiert

NVIDIA-Forschende entwickelten PivotOPD gemeinsam mit der Princeton University und der University of Maryland. Das Verfahren ist eine Trainingsmethode, kein eigenes Modell: Getestet wurde es mit Qwen3-1.7B und Qwen3-8B. Ein „pivotal mistake“ liegt vor, wenn eine Aktion den kürzesten Weg zur Lösung verlängert oder eine Aufgabe unlösbar macht. In 155 von 262 fehlgeschlagenen Abläufen von drei Qwen3-Modellgrößen trat mindestens ein solcher Fehler auf. Er geschah meist zwischen Zug 8 und 12 von insgesamt 30; danach vergingen weitere 18 bis 21 Züge ohne Erholung.

PivotOPD ergänzt gruppenbasiertes Reinforcement Learning um drei Schritte. Ein größeres Lehrermodell untersucht Abläufe nachträglich und schlägt kritische Züge samt passender Aktion vor. Eine präventive Distillation soll das Modell von seinem Fehler weglenken. Nach einem erkannten Fehler trainiert eine weitere Distillation Erholungsaktionen für bis zu K Züge. Auf ALFWorld lagen die erkannten Fehler in durchschnittlich 77,8 Prozent der fehlgeschlagenen Abläufe höchstens einen Zug vom Fehler des Orakels entfernt.

In Wiederholungen von 72 folgenreichen Fehlern gelang PivotOPD die Erholung in 72,7 Prozent der Fälle. Zum Vergleich: Das Basismodell erreichte 8,3 Prozent, Standard-OPD 20,3 Prozent und eine nur präventive Variante 45,8 Prozent. Im Schnitt brauchte PivotOPD 9,7 Züge für die Erholung; das optimale Ergebnis lag bei 6,2. Bei den drei Benchmarks ALFWorld, WebShop und Search-based QA erreichte das Verfahren laut den Tests im Durchschnitt die besten Werte gegenüber 13 Vergleichsmethoden. Mit Qwen3-8B lagen die Ergebnisse bei 93,0 Prozent auf ALFWorld, 47,4 Prozent auf Search-based QA und 81,9 Prozent Erfolgsrate auf WebShop.

Auch SWE-Bench Verified wurde getestet: Ein mit Nemotron-3.5-SFT trainierter Student verbesserte sich durch PivotOPD von 62,8 auf 66,0 Prozent. Standard-OPD erreichte 63,0 Prozent, das Lehrermodell 73,0 Prozent. Das Training lief auf NVIDIA-H100-Systemen. Für den Einsatz entstehen laut NVIDIA keine zusätzlichen Inferenzkosten. Auf ALFWorld betrug der Trainingsaufschlag gegenüber GRPO mit einem 1.7B-Modell und vier H100-GPUs bei K = 1 12,4 Prozent; bei K = 2 waren es 94,2 Prozent, unter anderem wegen zusätzlicher Wiederholungen in der Umgebung.

War der Artikel hilfreich?

Einzelne Quelle. Wir haben diese Meldung bisher nur bei einem Medium gefunden.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

Alle KI-Meldungen live im Discord Die wichtigsten auch auf X und Bluesky.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.