Kolibri ist ein Mixture-of-Experts-Modell mit insgesamt 78,1 Milliarden Parametern. Pro Token werden nach Angaben von Aleph Alpha 3,46 Milliarden davon aktiviert: Ein Token wird an sechs von 384 spezialisierten Experten weitergeleitet, zusätzlich kommt ein gemeinsamer Experte zum Einsatz. Die Gewichte stehen unter der Apache-2.0-Lizenz auf Hugging Face bereit. Nutzende können außerdem für einzelne Anfragen den gewünschten Aufwand für Schlussfolgerungen festlegen.
Die Architektur kombiniert verschiedene Aufmerksamkeitsverfahren. Von 50 Transformer-Blöcken nutzen 40 ein gleitendes Kontextfenster von 512 vorherigen Tokens; die übrigen zehn verarbeiten den gesamten Kontext. Dadurch wächst der Key-Value-Cache laut technischer Beschreibung nur in den zehn Blöcken mit voller Aufmerksamkeit mit. Das Modell unterstützt ein Kontextfenster von bis zu 1.048.576 Tokens. Bei der Bereitstellung mit vLLM ist standardmäßig ein Fenster von 262.144 Tokens eingestellt; für die volle Länge sind zusätzliche Konfigurationsoptionen nötig.
Aleph Alpha trainierte Kolibri zunächst mit 20 Billionen Tokens auf 768 NVIDIA-B200-GPUs. Darauf folgten 3,44 Billionen Tokens im Mid-Training und eine Langkontextphase mit 201 Milliarden Tokens. Für das Training kamen laut Unternehmen mehr als zwei Billionen zusätzliche deutsche Tokens hinzu, darunter kuratierte Webdaten und synthetisch erzeugte Inhalte. Beim Nachtraining wurden überwachte Feinabstimmung und Reinforcement Learning mit mehr als 1,2 Millionen internen Aufgaben kombiniert.
Die FP8-Gewichte belegen rund 78 GB. Kolibri lässt sich laut Aleph Alpha auf einer einzelnen B200, B300 oder H200 betreiben; für zwei H100 SXM5 wird ebenfalls Unterstützung genannt. In den von Aleph Alpha veröffentlichten Vergleichen erreicht das Modell unter anderem 84,3 Punkte bei GPQA Diamond und 96,9 bei AIME 2025 auf Englisch. Bei BFCL v4 liegt es mit 61,4 Punkten unter dem Vergleichswert von Qwen3.5 35B-A3B, der 70,5 erreicht. Die Ergebnisse stammen aus einem von Aleph Alpha verwendeten Evaluationsaufbau.
