← Alle KI-News
Aionity · KI-NewsForschung

Studie zeigt Grenzen breiter Tokenizer-Ausrichtung beim Modelltraining

Eine Untersuchung zur On-Policy Distillation vergleicht Verfahren für Modelle mit unterschiedlichen Tokenizern. Dabei erreichte eine eng begrenzte Form der Ausrichtung vergleichbare Genauigkeit wie eine breitere Variante, während zusätzliche Supervision die Ergebnisse verschlechterte.

Symbolbild: Studie zeigt Grenzen breiter Tokenizer-Ausrichtung beim Modelltraining
Symbolbild · KI-generiert

On-Policy Distillation (OPD) trainiert ein Student-Modell anhand eigener Ausgaben, die ein Teacher-Modell bewertet. Nutzen beide Modelle unterschiedliche Tokenizer, müssen ihre Vorhersagen aufeinander abgestimmt werden. Die Studie untersucht, ob eine umfassendere Ausrichtung das Lernen verbessert. Dafür werteten die Forschenden drei Teacher-Student-Paare mit unterschiedlichen Tokenizern bei mathematischem Schlussfolgern und Codegenerierung aus.

Bei einer strikten 1:1-Zuordnung deckten die Gruppen bereits den größten Teil der vom Student erzeugten Tokens ab, obwohl sich die Vokabulare deutlich unterschieden. Auf Antworten, die vor der Distillation von den Student-Modellen erzeugt wurden, entfiel an diesen Positionen im Durchschnitt nahezu die gesamte Wahrscheinlichkeit des Teachers und des Students auf das gemeinsame Vokabular.

Ein weiteres Verfahren berechnete Reverse KL an jeder strikt ausgerichteten Position nur für eine vom Student ausgewählte Teilmenge der 16 wahrscheinlichsten Tokens aus dem gemeinsamen Vokabular. Seine Genauigkeit lag laut Studie auf einem ähnlichen Niveau wie bei OPD mit dem gesamten gemeinsamen Vokabular. Beide Varianten übertrafen die untersuchten Baselines für unterschiedliche Tokenizer.

Zusätzlich prüften die Forschenden eine Supervision über mittlere quadratische Fehler für Log-Wahrscheinlichkeiten ganzer Spannen, also auch für Gruppen ohne strikte Zuordnung. Damit wurde eine vollständige Abdeckung erreicht, die Genauigkeit sank jedoch. Bei Trainingsständen, die nur mit dem strikten Verlust trainiert worden waren, zeigten die Gradienten der Spannen eine schwache oder negative Richtungsübereinstimmung mit den strikten Gradienten. Zugleich nahm ihre Stärke im Verhältnis zu diesen zu. Die Autoren sehen darin mögliche Hinweise auf den Genauigkeitsverlust und sprechen sich dafür aus, die Zuverlässigkeit der Supervision stärker zu gewichten als ihre bloße Abdeckung.

War der Artikel hilfreich?
Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

Neue KI-Meldungen direkt in deinem Feed: Folge @Aionity_News auf X

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.