← Alle KI-News
Aionity · KI-NewsModelle· Aktualisiert 22:15 Uhr

Google DeepMind bringt multimodales EmbeddingGemma 2 heraus

EmbeddingGemma 2 bildet Text, Code, Bilder, Videos und Audio in einem gemeinsamen Vektorraum ab. Das Modell mit 740 Millionen Parametern ist für lokale Verarbeitung ausgelegt und steht unter der Apache-2.0-Lizenz.

Symbolbild: Google DeepMind bringt multimodales EmbeddingGemma 2 heraus
Symbolbild · KI-generiert

Google DeepMind hat EmbeddingGemma 2 vorgestellt, ein Embedding-Modell auf Basis der Gemma-4-Architektur. Es wandelt Text, Code, Bilder, Videos und Audio in Repräsentationen um, die sich gemeinsam durchsuchen und vergleichen lassen. So kann etwa eine Textanfrage passende Bilder finden oder eine Sprachnotiz einen Videoclip auffindbar machen. Die Modellgewichte sind laut Google DeepMind auf Hugging Face und Kaggle verfügbar.

Das Modell umfasst insgesamt 740 Millionen Parameter und unterstützt ein Kontextfenster von 8K Tokens. Nach Angaben von Google DeepMind kann es damit bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes verarbeiten. Die Architektur ist modular: Für reine Textaufgaben sind 270 Millionen Parameter vorgesehen; Bild- und Audio-Encoder lassen sich ergänzen. Für den vollen Funktionsumfang werden alle drei Komponenten genutzt.

Für den Einsatz auf Geräten nennt Google DeepMind einen Arbeitsspeicherbedarf von rund 191 MB bei quantisierten Textgewichten und etwa 567 MB für das vollständige multimodale Modell. Die Messwerte beziehen sich auf ein Google Pixel 11 Pro. Entwickler können außerdem die Ausgabevektoren von 768 auf 512, 256 oder 128 Dimensionen kürzen. Laut Google DeepMind kann das den Speicherbedarf lokaler Vektordatenbanken um bis zu den Faktor 6 verringern.

Bei der Code-Suche erreicht EmbeddingGemma 2 laut Google DeepMind 78,68 Punkte im Benchmark MTEB Code; EmbeddingGemma kam dort auf 68,76. Für mehrsprachige Textaufgaben gibt Google an, dass die Leistung des Vorgängers gehalten wird. Die Apache-2.0-Lizenz erlaubt eine kommerzielle Nutzung. Google nennt als Einsatzmöglichkeiten unter anderem lokale Suche, Retrieval-Augmented-Generation-Systeme und das Auffinden bestimmter Momente in Videos. Beispiele lassen sich in der Google AI Edge Gallery ausprobieren.

War der Artikel hilfreich?

💡 Tipp: Wenn du eine lokale Suche über Text, Bilder oder Audio entwickelst, kannst du die Demos in der Google AI Edge Gallery testen oder die Modellgewichte für eigene Anwendungen nutzen.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

Neue KI-Meldungen direkt in deinem Feed: Folge @Aionity_News auf X

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.