← Alle KI-News
Aionity · KI-NewsForschung

Studie vergleicht On-Policy- und Off-Policy-Destillation

Eine Untersuchung mit Llama3- und Qwen2.5-Modellen kommt zu einem differenzierten Ergebnis: Nicht die Rollout-Policy allein bestimmt die Leistung beim Wissenstransfer. Auch die Richtung der KL-Divergenz und die Lernrate spielen eine wichtige Rolle.

Symbolbild: Studie vergleicht On-Policy- und Off-Policy-Destillation
Symbolbild · KI-generiert

Beim Wissenstransfer von stärkeren auf schwächere Sprachmodelle wird diskutiert, ob On-Policy-Lernen Vorteile gegenüber Off-Policy-Lernen hat. Dabei erzeugt das studentische Modell bei On-Policy-Verfahren selbst die Rollouts, auf denen es trainiert wird. Frühere Vergleiche mit anderen Trainingsverfahren veränderten oft mehrere Faktoren zugleich. Die Studie isoliert deshalb den Einfluss der Rollout-Policy in einem kontrollierten Destillationsaufbau.

Die Forschenden variierten unabhängig voneinander die Rollout-Policy, die Richtung der KL-Divergenz auf Token-Ebene und die Lernrate. Untersucht wurden die Modellfamilien Llama3 und Qwen2.5 sowie Aufgaben aus den Bereichen Wissenschaft, Medizin und Arithmetik. Die Ergebnisse zeigen, dass die KL-Richtung Leistung und Abdeckung der Ausgaben stärker prägt als die Rollout-Policy. Die Lernrate beeinflusst demnach, wie stark das Modell zuvor Gelerntes vergisst und wie spärlich sich seine Parameter ändern.

Bei Forward KL blieb die Leistung laut Studie über unterschiedliche Rollout-Policies hinweg stabil. Reverse KL reagierte deutlich empfindlicher auf diese Änderung und schnitt mit studentisch erzeugten Rollouts besser ab. Die Untersuchung erklärt diesen Unterschied auch mit Analysen der KL-Gradienten und betrachtet zusätzlich einen stufenlosen Übergang zwischen Rollouts von Student und Teacher. Damit hängt der Nutzen von On-Policy-Daten nach den Ergebnissen davon ab, welches Lernziel und welche Optimierungseinstellungen verwendet werden.

On-Policy-Daten verbesserten außerdem die Übertragung auf schwierigere Varianten der Countdown-Arithmetikaufgabe, und zwar bei beiden KL-Richtungen. Dieser Vorteil blieb nach einem anschließenden RLVR-Training jedoch nicht zuverlässig erhalten. Die Forschenden berichten, dass ihre übergreifenden Ergebnisse auch bei Änderungen an Gradient Clipping, bei stichprobenbasierten KL-Schätzungen und bei Aufgaben mit längeren Schlussfolgerungsketten Bestand hatten. Die Studie stellt damit die Annahme infrage, dass On-Policy-Rollouts grundsätzlich vorzuziehen sind.

War der Artikel hilfreich?
Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.