Blog
KI-Agenten: Ein Erfolg ist noch kein Betriebstest
KI-Agenten können denselben Auftrag einmal korrekt und beim nächsten Lauf anders ausführen. IBM Research zeigt an einem AppWorld-Test, warum eine durchschnittliche Erfolgsquote dafür nicht genügt: Ein ReAct-Agent mit GPT-4.1 bestand 77,4 Prozent der Läufe, aber nur 53,0 Prozent der Aufgaben in allen fünf Wiederholungen.
Genauigkeit und Konsistenz sind zwei Kennzahlen
Die übliche Durchschnittsquote beantwortet, wie oft ein Agent insgesamt erfolgreich ist. Sie beantwortet nicht, ob ein heute bestandener Ablauf morgen reproduzierbar bleibt. IBM bezeichnet die Differenz im Beispiel als Konsistenzlücke von 24,4 Prozentpunkten.
Der vorgeschlagene Consistency Analyzer untersucht aufgezeichnete Trajektorien und sucht Entscheidungspunkte, an denen kleine Änderungen die nächste Aktion kippen lassen. Dafür werden einzelne Schritte kontrolliert mehrfach abgetastet, ohne den kompletten Geschäftsprozess erneut auszuführen. Laut IBM reduzierten daraus erzeugte Leitlinien die gemessene Lücke im Versuch von 24,4 auf 12,0 Prozentpunkte, ohne die durchschnittliche Genauigkeit zu verschlechtern.
Optimierung braucht einen Prüfprozess
AWS verfolgt mit Amazon Bedrock AgentCore einen ergänzenden Ansatz. Produktions-Traces und ein Bewertungssignal dienen dazu, Änderungen am System-Prompt vorzuschlagen. Teams sollen Varianten zunächst in Offline-Batch-Evaluationen und anschließend in kontrollierten Online-A/B-Tests validieren, bevor sie eine neue Konfiguration übernehmen.
Beide Ansätze machen denselben Betriebsfehler sichtbar: Ein erfolgreicher Demo-Lauf ist noch kein Nachweis für einen stabilen Agenten. Auch eine automatisch optimierte Konfiguration darf nicht direkt zum neuen Standard werden. Sie braucht eine feste Testsuite, Vergleichswerte und einen klaren Freigabepunkt.
Was DACH-Unternehmen messen sollten
Für einen produktionsnahen Piloten sollten Sie mindestens vier Werte getrennt erfassen:
- Erfolgsquote über alle Läufe,
- Anteil der Aufgaben, die in jeder Wiederholung bestehen,
- Art und Position abweichender Tool-Entscheidungen,
- Kosten und Laufzeit pro wiederholtem Test.
Testen Sie kritische Vorgänge mehrfach mit identischem Auftrag und kontrollierter Umgebung. Dazu zählen etwa Vertragsprüfung, Kontenabgleich, Ticket-Routing oder Änderungen an produktiven Systemen. Legen Sie außerdem fest, welche Abweichung tolerierbar ist und wann ein Mensch übernehmen muss.
Der zweite Lauf ist damit kein überflüssiger Test. Er prüft eine andere Eigenschaft: nicht, ob Ihr Agent die Aufgabe kann, sondern ob Sie sich im Betrieb auf sein Verhalten verlassen können.