On-Policy Distillation (OPD) trainiert ein Student-Modell anhand eigener Ausgaben, die ein Teacher-Modell bewertet. Nutzen beide Modelle unterschiedliche Tokenizer, müssen ihre Vorhersagen aufeinander abgestimmt werden. Die Studie untersucht, ob eine umfassendere Ausrichtung das Lernen verbessert. Dafür werteten die Forschenden drei Teacher-Student-Paare mit unterschiedlichen Tokenizern bei mathematischem Schlussfolgern und Codegenerierung aus.
Bei einer strikten 1:1-Zuordnung deckten die Gruppen bereits den größten Teil der vom Student erzeugten Tokens ab, obwohl sich die Vokabulare deutlich unterschieden. Auf Antworten, die vor der Distillation von den Student-Modellen erzeugt wurden, entfiel an diesen Positionen im Durchschnitt nahezu die gesamte Wahrscheinlichkeit des Teachers und des Students auf das gemeinsame Vokabular.
Ein weiteres Verfahren berechnete Reverse KL an jeder strikt ausgerichteten Position nur für eine vom Student ausgewählte Teilmenge der 16 wahrscheinlichsten Tokens aus dem gemeinsamen Vokabular. Seine Genauigkeit lag laut Studie auf einem ähnlichen Niveau wie bei OPD mit dem gesamten gemeinsamen Vokabular. Beide Varianten übertrafen die untersuchten Baselines für unterschiedliche Tokenizer.
Zusätzlich prüften die Forschenden eine Supervision über mittlere quadratische Fehler für Log-Wahrscheinlichkeiten ganzer Spannen, also auch für Gruppen ohne strikte Zuordnung. Damit wurde eine vollständige Abdeckung erreicht, die Genauigkeit sank jedoch. Bei Trainingsständen, die nur mit dem strikten Verlust trainiert worden waren, zeigten die Gradienten der Spannen eine schwache oder negative Richtungsübereinstimmung mit den strikten Gradienten. Zugleich nahm ihre Stärke im Verhältnis zu diesen zu. Die Autoren sehen darin mögliche Hinweise auf den Genauigkeitsverlust und sprechen sich dafür aus, die Zuverlässigkeit der Supervision stärker zu gewichten als ihre bloße Abdeckung.
