← Alle KI-News
Aionity · KI-News

ProvenanceGuard prüft, ob MCP-Agenten die richtige Quelle nennen

ProvenanceGuard soll Fehler erkennen, bei denen eine Aussage zwar durch irgendeinen Beleg gestützt wird, aber der falschen Quelle zugeschrieben ist. Das System prüft Antworten von MCP-Agenten nach der Generierung und kann sie freigeben oder blockieren.

Symbolbild: ProvenanceGuard prüft, ob MCP-Agenten die richtige Quelle nennen
Symbolbild · KI-generiert

Das Team hinter ProvenanceGuard beschreibt das Verfahren in einem am 29. September 2026 veröffentlichten Beitrag. Im Mittelpunkt steht ein Problem, das die Autoren „cross-source conflation“ nennen: Ein Agent übernimmt einen Fakt aus einem Dokument oder Werkzeug, stellt ihn in seiner Antwort aber so dar, als stamme er aus einer anderen Quelle. Werden Belege zusammengeführt, kann die Aussage insgesamt gestützt wirken, obwohl die genannte Herkunft nicht stimmt.

ProvenanceGuard ist als nachgelagerte Prüfschicht für MCP-Agenten angelegt. Es soll den Agenten nicht neu trainieren und wertet stattdessen den aufgezeichneten MCP-Ablauf aus. Dabei bleiben Werkzeugausgaben und ihre Quellenkennungen getrennt. Das System zerlegt die Antwort zunächst in einzelne Aussagen, ordnet jeder eine relevante Quelle zu und prüft, ob diese die Aussage trägt. Anschließend vergleicht es die gefundene Quelle mit derjenigen, die in der Antwort ausdrücklich genannt oder indirekt nahegelegt wird. Das Ergebnis umfasst Bewertungen pro Aussage sowie eine Entscheidung, ob die gesamte Antwort freigegeben oder blockiert wird.

Für die beschriebenen Versuche nutzte das Team lokale Modelle: MiniLM zur Suche nach relevanten Quellen, ein DeBERTa-NLI-Modell zur Prüfung der inhaltlichen Unterstützung und ein lokales Sprachmodell zur Aufteilung von Antworten in Aussagen. Zusätzlich kontrolliert das Verfahren konkrete Angaben wie Zahlen, Datumswerte und Kennungen. Solche Angaben sollen nicht bestehen, wenn sie in der zugeordneten Quelle fehlen. Eine kalibrierte Entscheidung führt die Prüfsignale zusammen. Blockierte Antworten können über einen RARR-ähnlichen Reparaturschritt überarbeitet und danach erneut geprüft werden.

Die genannten Modelle sind laut Team die verwendete Versuchskonfiguration, keine zwingende Voraussetzung für ProvenanceGuard. Die einzelnen Schritte könnten demnach auch mit gehosteten Modellen umgesetzt werden; eine solche Variante müsste separat getestet und kalibriert werden. Der Beitrag berichtet außerdem, dass das Verfahren an Antworten eines medizinischen Agenten untersucht wurde, der Patientendatensätze verwendet hatte. Der vorliegende Textauszug nennt dazu keine Resultate.

Frag Aiory dazu Aiory liest den Artikel und beantwortet deine Fragen dazu.

Quellen

KI-erstellter Artikel: Die Aionity-KI hat recherchiert – sie sucht die Originalquelle (etwa die Seite des Herstellers), zieht weitere Berichte hinzu und schreibt daraus einen eigenen Text. Alle Quellen stehen oben. Eine eigene Meinung gibt sie nicht ab. Kennzeichnung nach Art. 50 KI-Verordnung. Fehler? Sag uns im Discord Bescheid.

← Alle KI-News

Fragen? Einfach mitreden – im Discord.

Discord ist ein kostenloser Gruppenchat. Dort kannst du nachfragen, was eine Meldung bedeutet, eigene Fragen stellen und dich mit anderen austauschen – ganz ohne Vorwissen. Wir fangen gerade erst an: Schau gern vorbei und sag Hallo.