← Alle KI-News
Aionity · KI-NewsOpen Source

AllenAI veröffentlicht Olmo-core 3 für das Training großer MoE-Modelle

Olmo-core 3 ist ein überarbeitetes Trainingssystem für Mixture-of-Experts-Modelle. AllenAI berichtet von höherem Durchsatz in Benchmarks und einer Skalierung auf mehr als eine Billion Gesamtparameter.

Symbolbild: AllenAI veröffentlicht Olmo-core 3 für das Training großer MoE-Modelle
Symbolbild · KI-generiert

AllenAI hat Olmo-core 3 vorgestellt, eine offene Trainingsinfrastruktur für große Mixture-of-Experts-Modelle (MoE). Das System ist Teil der technischen Grundlage für eine kommende Olmo-Generation. MoE-Modelle aktivieren für einzelne Texteingaben nur einen Teil ihrer Parameter. Mit zunehmender Modellgröße steigen jedoch auch die Anforderungen an Speicher, Datenverteilung und Kommunikation zwischen GPUs. Olmo-core 3 soll diese Abläufe effizienter organisieren.

In einem Benchmark erhöhte AllenAI den Expertenpool von 8 auf 128, während pro Token weiterhin nur vier Experten ausgewählt wurden. Die Zahl der aktiven Parameter pro Token blieb dadurch bei ungefähr 3,2 Milliarden. Die Gesamtkapazität wuchs von 4,6 Milliarden auf 47 Milliarden Parameter; der Trainingsdurchsatz sank dabei um weniger als 5 Prozent. AllenAI gibt außerdem an, die Infrastruktur mit mehr als einer Billion Gesamtparametern getestet zu haben.

Eine Änderung betrifft die Verteilung der Experten auf GPUs. Die frühere MoE-Implementierung in Olmo-core nutzte Fully Sharded Data Parallelism (FSDP) und sammelte Modellgewichte für kleine Datenpakete wiederholt ein. Olmo-core 3 verwendet stattdessen ein System auf Basis von Distributed Data Parallelism (DDP): Experten bleiben auf GPUs gespeichert, während die zugehörigen Daten an sie weitergeleitet werden. Expert Parallelism, Pipeline Parallelism und ein verteilter Optimizer teilen Modell und Trainingszustand zusätzlich auf mehrere GPUs auf.

In einem vorläufigen Test mit acht NVIDIA B300 GPUs verarbeitete ein MoE-Modell mit 47 Milliarden Parametern laut AllenAI 52.000 Tokens pro Sekunde und GPU. Die vorherige FSDP-Implementierung erreichte 19.400 Tokens pro Sekunde und GPU; AllenAI beziffert den Unterschied auf etwa den Faktor 2,7. Ein separater Test mit vier NVIDIA B300 GPUs ergab mit MXFP8 rund 21 Prozent mehr Trainingsdurchsatz als mit BF16. Dabei waren die Berechnungen gleichmäßig auf die Experten verteilt. Olmo-core 3 kombiniert diese Verfahren mit weiteren Optimierungen für Routing und GPU-Berechnungen.

War der Artikel hilfreich?

💡 Tipp: Wenn du MoE-Modelle trainierst, kannst du den veröffentlichten Olmo-core-3-Code prüfen und die Infrastruktur für eigene Trainingsläufe testen.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.