← Alle KI-News
Aionity · KI-NewsForschung

Encoderfreie multimodale Modelle könnten bei 10²² FLOPs aufholen

Ein Forschungspaper vergleicht multimodale Sprachmodelle mit und ohne vortrainierten visuellen Encoder. Demnach schneiden encoderfreie Modelle bei kleinen Rechenbudgets multimodal zunächst schlechter ab, könnten den Abstand bei etwa 10²² FLOPs aber aufholen.

Viele multimodale Large Language Models nutzen einen vortrainierten visuellen Encoder, der Bildinformationen verarbeitet und dem Modell eine visuelle Ausgangsbasis liefert. Encoderfreie Modelle erhalten dagegen rohe Pixel als Eingabe und lernen visuelle Repräsentationen selbst. Das Forschungspaper untersucht, wie sich beide Ansätze mit wachsendem Trainingsaufwand entwickeln, und vergleicht dafür ihre Skalierungsgesetze.

Bei der optimalen Verteilung des Rechenaufwands zeigen sich Unterschiede je nach Lernziel. Wird ein multimodales Ziel verfolgt, verschiebt der Verzicht auf den visuellen Encoder die rechnerisch optimale Konfiguration in Richtung größerer Modelle. Für das Textziel verändert sich die optimale Aufteilung laut den Ergebnissen dagegen kaum. Auch bei der Textleistung verlaufen die Verlust-Rechenaufwand-Kurven beider Modelltypen nahezu gleich.

Anders fällt der Vergleich bei multimodalen Aufgaben aus: Encoderfreie Modelle liegen bei kleinen Größen zunächst zurück. Die untersuchte Skalierung legt jedoch nahe, dass sie bei ungefähr 10²² FLOPs aufholen könnten. Das Paper ordnet diesen Wert als innerhalb praktisch erreichbarer Vortrainingsbudgets ein. Es handelt sich dabei um eine Vorhersage auf Basis der untersuchten Skalierung, nicht um die Aussage, dass jedes encoderfreie Modell bei diesem Rechenaufwand gleich abschneidet.

Die Ergebnisse beschreiben außerdem, wie das Sprachmodell ohne visuellen Encoder dessen Funktion teilweise übernimmt. Mit mehr Trainingsrechenleistung werden wechselseitige Verbindungen zwischen visuellen Tokens zunehmend vorteilhaft. Zugleich verlagert sich die visuelle Verarbeitung in frühere Modellschichten, und das Routing visueller Tokens auf Experten wird stärker gebündelt. Nach Darstellung des Papers spricht dies dafür, dass der Vorteil eines vortrainierten visuellen Encoders mit größerem Maßstab abnimmt. Offen bleibt damit insbesondere, wie sich die vorhergesagten Skalierungseffekte bei konkreten Modellen und Trainingsläufen zeigen.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.