Die Modelle gehören zur d1-Familie und sind als Open-Weight-Modelle auf Hugging Face verfügbar. Sie beantworten benannte Fragen in einem Durchlauf: etwa mit Ja oder Nein samt Wahrscheinlichkeit, mit einer Auswahl samt Verteilung über die Optionen oder mit einem Wert auf einer geordneten Skala. Mehrere Fragen lassen sich für denselben Eingabestatus gemeinsam stellen. Die Ausgabe enthält laut Liquid AI null Output-Tokens; die Modelle sind nicht für Chat gedacht.
Der d1-3B hat 3,12 Milliarden Parameter, nutzt einen Bildencoder und verarbeitet bis zu 32.768 Tokens Kontext. d1-omni-600M umfasst 587 Millionen Parameter und kombiniert einen gemeinsamen Modellkern mit einem Bild- und einem Audioencoder. Es akzeptiert Text mit einem Bild oder Text mit Audio, aber nicht Bild und Audio zugleich. Audioaufnahmen dürfen bis zu 30 Sekunden lang sein; das Audiotraining umfasste englische Sprachbefehle an einen Assistenten.
Liquid AI nennt unter anderem Moderation, Weiterleitung von Anfragen, Klassifizierung und visuelle Prüfung als Einsatzfelder. Für d1-3B gibt das Unternehmen eine Laufzeit von 35 Millisekunden für ein Bild mit 384 Pixeln auf Jetson AGX Thor an. Bei einer Frage nennt Liquid AI 8 Millisekunden auf RTX 4090 und 9 Millisekunden auf AMD MI325X; auf Jetson reichen die Werte von 16 Millisekunden auf AGX Thor bis 50 Millisekunden auf Orin Nano. Die Messungen beziehen sich auf einzelne warme Anfragen.
Auf Decision Index v0.2.1 erreicht d1-3B nach Liquid AIs eigener Auswertung 48,57 Punkte. Das Unternehmen gibt an, dass dieser Wert unter Modellen mit weniger als 10 Milliarden Parametern am höchsten liegt; Winnow-12B kommt demnach auf 50,02. Liquid AI führte den offiziellen Scorer selbst aus, die Werte sind keine Einreichungen auf der Rangliste. Beide Modelle lassen sich über Transformers laden und werden laut Anbieter auch von llama.cpp unterstützt. Für d1-omni-600M bezeichnet Liquid AI die Veröffentlichung als frühe Forschungsfassung.
