Google beschreibt AQuA (Ambient Quality Agent) als Ergänzung zu den Tests vor dem Start eines Agenten. Im laufenden Betrieb können sich Nutzungsmuster ändern oder Updates an Modell, Werkzeugen und Ablaufsteuerung die Gesprächsqualität beeinflussen. Technische Prüfungen können dabei weiterhin erfolgreich sein, obwohl ein Agent etwa eine Sitzplatzreservierung ohne Verfügbarkeitsprüfung bestätigt oder eine unpassende Empfehlung gibt. AQuA soll solche wiederkehrenden Fehler sichtbar machen und ihre Ursachen eingrenzen.
Das System läuft unbeaufsichtigt neben dem Agenten im Google-Cloud-Projekt. Es kann Sitzungsverläufe aus Cloud Trace, Cloud Logging oder BigQuery auswerten. Läufe lassen sich nach Zeitplan, nach einer Bereitstellung oder bei Bedarf starten. Pro Durchlauf zieht AQuA eine zufällige Stichprobe von bis zu 1.000 aktuellen Sitzungen. Google begrenzt die Stichprobe nach eigenen Angaben, damit die Kosten eines Durchlaufs vorhersehbar bleiben. Transkripte, Quellcode-Snapshots und BigQuery-Tabellen verbleiben im Projekt. AQuA verarbeitet keine Anfragen des Agenten und schreibt nicht in ihn zurück.
Die Auswertung umfasst fünf Schritte. Zunächst bewertet AQuA Sitzungen anhand einer Checkliste mit neun Kriterien, darunter Vorgehensweise, Werkzeugauswahl und -argumente, Bezug auf vorhandene Informationen sowie Aufgabenerfüllung. Bei einem Fehler hält es fest, was tatsächlich geschah und was erwartet worden wäre. Anschließend gruppiert es Befunde mit einem ähnlichen Fehlermuster. Ein separates Modell prüft solche Gruppen anhand von bis zu drei vollständigen Transkripten und verwirft sie, wenn die Belege nicht ausreichen.
Für die Ursachenanalyse gleicht AQuA fehlerhafte Verläufe mit dem Quellcode-Snapshot der betreffenden Bereitstellung ab. So sollen unterschiedliche Fehlerquellen auseinandergehalten werden: etwa ein Fehler des Modells, eine falsche Weiterleitung durch die Ablaufsteuerung, ein unzureichend beschriebenes Werkzeug oder eine fehlende Regel in den Anweisungen. Google veröffentlicht AQuA als kombinierbare Bausteine, die Teams in eigenen Projekten betreiben und an ihren technischen Aufbau anpassen können.
