Die unabhängige Forschungsfirma Coleman Parkes führte die Umfrage im Auftrag von Undo durch. Befragt wurden Führungskräfte, die für die Entwicklung geschäftskritischer Software verantwortlich sind. Die meisten arbeiten mit C/C++. Im Mittelpunkt standen Codebasen, deren Verhalten und Auswirkungen auf bestehende Systeme nachvollziehbar sein müssen.
Die Teams verbringen im Durchschnitt pro Woche 9,8 Stunden mit dem Schreiben von Code und 16,9 Stunden mit dem Beheben von Fehlern, die während der Entwicklung oder im Betrieb auffallen. Das Debugging macht damit 42 Prozent der durchschnittlichen Arbeitswoche aus. 79 Prozent der Befragten sagen, KI-Agenten könnten Code deutlich schneller erzeugen. Der zusätzliche Aufwand, den generierten Code zu prüfen und Fehler darin aufzuspüren, führe jedoch dazu, dass sich die gesamte Zeit bis zur Veröffentlichung nicht verkürze.
Auch beim Verständnis des Codes sehen die Befragten Schwierigkeiten: 35 Prozent des KI-generierten Codes gelangen laut Umfrage in den Produktivbetrieb, bevor das Team ihn vollständig verstanden hat. 80 Prozent geben an, dass Coding-Agenten bei schwierigen Aufgaben in komplexen Codebasen Probleme haben. Etwa ein Drittel der Teams setzt KI-Agenten deshalb für Verständnis und Fehlersuche nur in einfacheren Codebasen ein und nutzt bei komplexeren Systemen weitere Methoden, um Vertrauen in die Ergebnisse zu gewinnen.
Fehler im Betrieb waren weit verbreitet: 81 Prozent der Befragten hatten in den vorangegangenen sechs Monaten mindestens einen Vorfall oder Dienstausfall, der interne Nutzer oder Kunden betraf. 14 Prozent erlebten solche Fälle mehrmals im Monat. 93 Prozent berichteten mindestens einmal von einer falschen Ursachenanalyse aufgrund einer Halluzination; 18 Prozent nannten dies mehrmals monatlich. Bei 91 Prozent gelangten mindestens einmal schwerwiegende Fehler oder schlecht optimierter Code in die Produktion. 8 Prozent meldeten solche Fälle mehrmals pro Monat.
