← Alle KI-News
Aionity · KI-NewsForschung

Omni-IO Skills verbindet Agenten mit multimodalen Werkzeugen

Ein Forschungsteam stellt mit Omni-IO Skills ein modulares Gerüst vor, das bestehende Agenten über Skills und eine einheitliche Ausführungsschnittstelle für verschiedene Medienformate erweitert. In Tests stiegen die Unterstützungsraten für Eingaben auf 100 Prozent.

Omni-IO Skills soll allgemeine Agenten bei Aufgaben unterstützen, die über Text hinausgehen. Das vorgestellte Agent Harness koordiniert Fähigkeiten für Bilder, Audio, Video, Dokumente, 3D-Assets und Code. Statt das zugrunde liegende Modell für jede zusätzliche Modalität anzupassen, kombiniert das System vorhandene Modelle und Werkzeuge. Es organisiert außerdem Abläufe, Abhängigkeiten, Zwischenergebnisse und spätere Überarbeitungen.

Das Konzept besteht aus hierarchisch aufgebauten Skills, einer standardisierten Schnittstelle für multimodale Ausführung, einer Orchestrierung nach Abhängigkeiten und einem dauerhaft gespeicherten Asset Registry. Mehrere zusammenhängende Arbeitsschritte werden als Declare Execution Graphs dargestellt. Darin können voneinander unabhängige Vorgänge gleichzeitig laufen. Erfolgreiche Ergebnisse werden registriert und können in späteren Schritten oder über mehrere Interaktionen hinweg wiederverwendet werden. Die Ausführung kann über austauschbare Backends erfolgen.

Die 27 Skills decken laut Paper 38 repräsentative Aufgaben ab. Sie verteilen sich auf sieben Arten von Ergebnissen und vier Fähigkeitsbereiche: Verstehen, Generieren, Schlussfolgern und Abrufen. Bewertet wurde das System unter anderem mit UniM-90. Dort stieg die Eingabe-Unterstützungsrate für GPT-5.6 Sol von 40,00 auf 100 Prozent und für Claude Sonnet 5 von 38,89 auf 100 Prozent.

Auch beim Semantic–Quality Coupled Score weist das Paper höhere Werte aus: Für GPT-5.6 Sol veränderte sich der Wert von 26,99 auf 74,94, für Claude Sonnet 5 von 27,82 auf 77,78. Der Strict Structure Score erreichte 100,00 beziehungsweise 99,78. Die Autoren stellen den Ansatz als Möglichkeit dar, Fähigkeiten auf Ebene des Agent Harness zusammenzuführen, ohne den Reasoning-Kern des jeweiligen Agenten zu verändern. Die Ergebnisse beziehen sich auf die im Paper beschriebenen Tests und Aufgaben.

War der Artikel hilfreich?

💡 Tipp: Wenn du multimodale Agenten entwickelst, kannst du den Ansatz als Beispiel dafür nutzen, wie sich Werkzeuge und Zwischenergebnisse über mehrere Arbeitsschritte koordinieren lassen.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.