← Alle KI-News
Aionity · KI-NewsForschung

OneStreamer verbindet Video-Wahrnehmung mit Gedächtnis und Reaktion

Das Forschungsteam hinter OneStreamer stellt ein Verfahren für die laufende Verarbeitung von Videos vor. Es soll wichtige Informationen festhalten und Antworten geben, sobald genügend Belege vorliegen.

Bei der Verarbeitung eines laufenden Videos ist oft zunächst unklar, welche Beobachtungen für spätere Fragen wichtig werden. OneStreamer soll dieses Problem lösen, indem das Modell fortlaufend Informationen aus dem Video festhält und zugleich auf Aufgaben reagiert. Beide Prozesse werden über eine gemeinsame Generierung trainiert. Die gespeicherten Angaben sollen auch dann als Kontext dienen, wenn frühere Bildmerkmale nicht erneut verarbeitet werden.

Ein Baustein ist die Proactive Hierarchical Caption Memory (PHCM). Sie erzeugt zeitlich verankerte Beschreibungen einzelner Details sowie Zusammenfassungen abgeschlossener Ereignisse. Während des Trainings dienen Beschreibungen des laufenden Videos als Vorgaben dafür, wie das Modell bereits beobachtete Abschnitte interpretieren soll. Bei der Nutzung ergänzen die erzeugten Aufzeichnungen ein aktuelles Sichtfenster auf das Video und können so Informationen aus der Vergangenheit für spätere Fragen verfügbar halten.

Mit Proactive State Transition Learning (PSTL) adressiert das Verfahren wiederholte Wartezustände in den Trainingsdaten. Die Methode erhält die Aufsicht an allen Ausgabepunkten und wählt gezielt repräsentative Zustandswechsel und anhaltende Zustände aus. Den Forschenden zufolge übertrifft PSTL eine dichte Zustandsaufsicht, obwohl dabei nur 27,5 Prozent der annotierten Zustandstokens zur Aufsicht verwendet werden. Eine eigens entwickelte Datenpipeline stimmt Inhalte und Zeitpunkte der Ausgaben auf die jeweils verfügbaren Videobelege ab.

Aus gestreamten Beschreibungen und Frage-Antwort-Daten sowie bereinigten Open-Source-Daten entstand OneStreamer-1M. Der Datensatz umfasst laut Paper mehr als eine Million Einträge zu unterschiedlichen Aufgaben. Das Modell mit 4 Milliarden Parametern erzielte unter den verglichenen Methoden die besten Ergebnisse in allen acht untersuchten Benchmarks für das Verständnis laufender Videos. Ablationstests zeigten außerdem, dass gespeicherte Beschreibungen die Beantwortung historischer Fragen verbessern, ohne die Echtzeitwahrnehmung zu beeinträchtigen. Die Ergebnisse beziehen sich auf die im Paper beschriebenen Vergleiche und Tests.

War der Artikel hilfreich?
Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.