← Alle KI-News
Aionity · KI-News

Google Research stellt Diffusion Controller für Bildgeneratoren vor

Google Research beschreibt Diffusion Controller als Zusatznetz, das die Bildgenerierung gezielter auf Prompts und andere Vorgaben ausrichten soll. Dabei soll das Basismodell unverändert bleiben; in einer vollständig anpassbaren Variante berichtet Google von einer Gewinnrate von 90 Prozent gegenüber dem Basismodell.

Symbolbild: Google Research stellt Diffusion Controller für Bildgeneratoren vor
Symbolbild · KI-generiert

Diffusion Controller behandelt die schrittweise Umwandlung von Rauschen in ein Bild als kontinuierlichen Steuerungsprozess. Ein leichtgewichtiges Zusatznetz verändert dabei während der Generierung deren Verlauf, um ein vorgegebenes Ziel stärker zu berücksichtigen. Als Beispiel nennt Google Research einen Prompt für eine Eidechse mit Sonnenbrille: Das Modell soll die Brille ergänzen, ohne dabei die Gestalt oder die Schuppen der Eidechse zu verzerren. Das vortrainierte Basismodell bleibt laut Google unangetastet.

Der Ansatz soll zwei bisher getrennt behandelte Arten der Einflussnahme auf Bildmodelle zusammenführen: Anpassungen während der Generierung, etwa Classifier-Free Guidance, und nachträgliches Fine-Tuning. Für die praktische Optimierung nennt Google zwei Verfahren, die sich auf einen abschließenden Bewertungsscore stützen. Beim ersten kommen Policy Gradients und PPO zum Einsatz. Eine Begrenzung der Anpassungsschritte soll dabei starke, unstete Änderungen während des Trainings verhindern. Das zweite Verfahren nutzt eine Reward-weighted Loss, die Generierungen mit hohen Bewertungen stärker berücksichtigt.

Nach Angaben von Google Research übertraf das leichte Zusatznetz den dort als Industriestandard bezeichneten Ansatz beim Abgleich mit menschlichen Präferenzen. Für eine vollständig freigeschaltete Version, bei der interne Gewichte des Modells verändert werden können, nennt Google eine Gewinnrate von 90 Prozent gegenüber dem Basismodell. Die Angabe bezieht sich auf die von Google beschriebenen Ergebnisse; konkrete Testbedingungen oder eine genaue Definition der Gewinnrate sind im vorliegenden Auszug nicht ausgeführt.

Google zufolge lässt sich Diffusion Controller auch an Modelle mit eingeschränktem Zugang und geschlossene Modelle anbinden. Der Beitrag stellt den Ansatz als Möglichkeit dar, die Steuerung der Bilderzeugung zu verbessern, ohne die Stabilität und Bildqualität des Basismodells zu beeinträchtigen. Beschrieben werden außerdem zwei Trainingswege, aber keine Angaben zu Verfügbarkeit, konkreten unterstützten Modellen oder einer Veröffentlichung des Zusatznetzes.

💡 Tipp: Wenn du Bildgeneratoren für konkrete Motive oder visuelle Vorgaben einsetzt, ist Diffusion Controller ein von Google beschriebener Ansatz zur gezielteren Steuerung, ohne das Basismodell anzupassen.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.