Das Team hinter ProvenanceGuard beschreibt das Verfahren in einem am 29. September 2026 veröffentlichten Beitrag. Im Mittelpunkt steht ein Problem, das die Autoren „cross-source conflation“ nennen: Ein Agent übernimmt einen Fakt aus einem Dokument oder Werkzeug, stellt ihn in seiner Antwort aber so dar, als stamme er aus einer anderen Quelle. Werden Belege zusammengeführt, kann die Aussage insgesamt gestützt wirken, obwohl die genannte Herkunft nicht stimmt.
ProvenanceGuard ist als nachgelagerte Prüfschicht für MCP-Agenten angelegt. Es soll den Agenten nicht neu trainieren und wertet stattdessen den aufgezeichneten MCP-Ablauf aus. Dabei bleiben Werkzeugausgaben und ihre Quellenkennungen getrennt. Das System zerlegt die Antwort zunächst in einzelne Aussagen, ordnet jeder eine relevante Quelle zu und prüft, ob diese die Aussage trägt. Anschließend vergleicht es die gefundene Quelle mit derjenigen, die in der Antwort ausdrücklich genannt oder indirekt nahegelegt wird. Das Ergebnis umfasst Bewertungen pro Aussage sowie eine Entscheidung, ob die gesamte Antwort freigegeben oder blockiert wird.
Für die beschriebenen Versuche nutzte das Team lokale Modelle: MiniLM zur Suche nach relevanten Quellen, ein DeBERTa-NLI-Modell zur Prüfung der inhaltlichen Unterstützung und ein lokales Sprachmodell zur Aufteilung von Antworten in Aussagen. Zusätzlich kontrolliert das Verfahren konkrete Angaben wie Zahlen, Datumswerte und Kennungen. Solche Angaben sollen nicht bestehen, wenn sie in der zugeordneten Quelle fehlen. Eine kalibrierte Entscheidung führt die Prüfsignale zusammen. Blockierte Antworten können über einen RARR-ähnlichen Reparaturschritt überarbeitet und danach erneut geprüft werden.
Die genannten Modelle sind laut Team die verwendete Versuchskonfiguration, keine zwingende Voraussetzung für ProvenanceGuard. Die einzelnen Schritte könnten demnach auch mit gehosteten Modellen umgesetzt werden; eine solche Variante müsste separat getestet und kalibriert werden. Der Beitrag berichtet außerdem, dass das Verfahren an Antworten eines medizinischen Agenten untersucht wurde, der Patientendatensätze verwendet hatte. Der vorliegende Textauszug nennt dazu keine Resultate.
