Google DeepMind hat EmbeddingGemma 2 vorgestellt, ein Embedding-Modell auf Basis der Gemma-4-Architektur. Es wandelt Text, Code, Bilder, Videos und Audio in Repräsentationen um, die sich gemeinsam durchsuchen und vergleichen lassen. So kann etwa eine Textanfrage passende Bilder finden oder eine Sprachnotiz einen Videoclip auffindbar machen. Die Modellgewichte sind laut Google DeepMind auf Hugging Face und Kaggle verfügbar.
Das Modell umfasst insgesamt 740 Millionen Parameter und unterstützt ein Kontextfenster von 8K Tokens. Nach Angaben von Google DeepMind kann es damit bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes verarbeiten. Die Architektur ist modular: Für reine Textaufgaben sind 270 Millionen Parameter vorgesehen; Bild- und Audio-Encoder lassen sich ergänzen. Für den vollen Funktionsumfang werden alle drei Komponenten genutzt.
Für den Einsatz auf Geräten nennt Google DeepMind einen Arbeitsspeicherbedarf von rund 191 MB bei quantisierten Textgewichten und etwa 567 MB für das vollständige multimodale Modell. Die Messwerte beziehen sich auf ein Google Pixel 11 Pro. Entwickler können außerdem die Ausgabevektoren von 768 auf 512, 256 oder 128 Dimensionen kürzen. Laut Google DeepMind kann das den Speicherbedarf lokaler Vektordatenbanken um bis zu den Faktor 6 verringern.
Bei der Code-Suche erreicht EmbeddingGemma 2 laut Google DeepMind 78,68 Punkte im Benchmark MTEB Code; EmbeddingGemma kam dort auf 68,76. Für mehrsprachige Textaufgaben gibt Google an, dass die Leistung des Vorgängers gehalten wird. Die Apache-2.0-Lizenz erlaubt eine kommerzielle Nutzung. Google nennt als Einsatzmöglichkeiten unter anderem lokale Suche, Retrieval-Augmented-Generation-Systeme und das Auffinden bestimmter Momente in Videos. Beispiele lassen sich in der Google AI Edge Gallery ausprobieren.
