AllenAI hat Olmo-core 3 vorgestellt, eine offene Trainingsinfrastruktur für große Mixture-of-Experts-Modelle (MoE). Das System ist Teil der technischen Grundlage für eine kommende Olmo-Generation. MoE-Modelle aktivieren für einzelne Texteingaben nur einen Teil ihrer Parameter. Mit zunehmender Modellgröße steigen jedoch auch die Anforderungen an Speicher, Datenverteilung und Kommunikation zwischen GPUs. Olmo-core 3 soll diese Abläufe effizienter organisieren.
In einem Benchmark erhöhte AllenAI den Expertenpool von 8 auf 128, während pro Token weiterhin nur vier Experten ausgewählt wurden. Die Zahl der aktiven Parameter pro Token blieb dadurch bei ungefähr 3,2 Milliarden. Die Gesamtkapazität wuchs von 4,6 Milliarden auf 47 Milliarden Parameter; der Trainingsdurchsatz sank dabei um weniger als 5 Prozent. AllenAI gibt außerdem an, die Infrastruktur mit mehr als einer Billion Gesamtparametern getestet zu haben.
Eine Änderung betrifft die Verteilung der Experten auf GPUs. Die frühere MoE-Implementierung in Olmo-core nutzte Fully Sharded Data Parallelism (FSDP) und sammelte Modellgewichte für kleine Datenpakete wiederholt ein. Olmo-core 3 verwendet stattdessen ein System auf Basis von Distributed Data Parallelism (DDP): Experten bleiben auf GPUs gespeichert, während die zugehörigen Daten an sie weitergeleitet werden. Expert Parallelism, Pipeline Parallelism und ein verteilter Optimizer teilen Modell und Trainingszustand zusätzlich auf mehrere GPUs auf.
In einem vorläufigen Test mit acht NVIDIA B300 GPUs verarbeitete ein MoE-Modell mit 47 Milliarden Parametern laut AllenAI 52.000 Tokens pro Sekunde und GPU. Die vorherige FSDP-Implementierung erreichte 19.400 Tokens pro Sekunde und GPU; AllenAI beziffert den Unterschied auf etwa den Faktor 2,7. Ein separater Test mit vier NVIDIA B300 GPUs ergab mit MXFP8 rund 21 Prozent mehr Trainingsdurchsatz als mit BF16. Dabei waren die Berechnungen gleichmäßig auf die Experten verteilt. Olmo-core 3 kombiniert diese Verfahren mit weiteren Optimierungen für Routing und GPU-Berechnungen.
