Kandinsky 6.0 Video umfasst die Modelle Lite mit 3 Milliarden Parametern und Pro mit 29 Milliarden Parametern. Beide erzeugen fünf Sekunden lange Videos mit synchronem Audio mit 44 kHz. Die Ausgabe unterstützt Lippensynchronisation und lässt sich sowohl aus Texteingaben als auch aus Bildern generieren. Ein integriertes Super-Resolution-Modell skaliert die Auflösung auf Full-HD mit 1920 × 1080 Pixeln hoch.
Technisch baut Kandinsky 6.0 Video auf den Videogenerierungsfähigkeiten von Kandinsky 5.0 auf. Die neue Architektur verbindet einen vortrainierten Videostream mit einem eigens trainierten Audiostream. Dafür nutzt sie bidirektionale Cross-Attention, um Bild und Ton zeitlich und inhaltlich aufeinander abzustimmen. Das Training beginnt mit dem Audiomodell, das anhand großer Audiodatensätze von Grund auf trainiert wird. Danach werden beide Streams mit zusammengehörigen Audio- und Videodaten gemeinsam weitertrainiert.
Auf das Vortraining folgen laut Paper überwachtes Fine-Tuning, ein Post-Training mit Reinforcement Learning und Distillation. Dabei soll die Qualität der einzelnen Modalitäten erhalten bleiben, während Audio und Video gemeinsam ausgerichtet werden. In direkten menschlichen Vergleichstests schneidet Kandinsky 6.0 Video Pro dem Paper zufolge deutlich besser ab als Kandinsky 5.0 Video Pro. Im Vergleich mit führenden Modellen zur Audio-Video-Erzeugung sei es konkurrenzfähig, besonders bei der Sprachqualität.
Der Code, die Modell-Checkpoints und eine Integration in diffusers werden unter der MIT-Lizenz veröffentlicht. Damit umfasst die Freigabe sowohl die Modelle als auch Bestandteile, die für ihre Nutzung und Einbindung in Entwicklungsumgebungen relevant sind. Die Ergebnisse und technischen Angaben beziehen sich auf das vorgestellte Paper zu Kandinsky 6.0 Video.
