---
title: "KI-Agenten: Ein Erfolg ist noch kein Betriebstest"
description: "Ein bestandener Lauf beweist keine Zuverlässigkeit. Warum Unternehmen Agenten wiederholt testen und Konsistenz getrennt von Genauigkeit messen sollten."
date: 2026-09-17
lang: de
tags: [governance, automatisierung, softwareentwicklung, analyse]
author: "thinkai.at"
canonical: https://thinkai.at/blog/agenten-konsistenz-statt-einmalerfolg/
---

# KI-Agenten: Ein Erfolg ist noch kein Betriebstest

**KI-Agenten** können denselben Auftrag einmal korrekt und beim nächsten Lauf anders ausführen. IBM Research zeigt an einem AppWorld-Test, warum eine durchschnittliche Erfolgsquote dafür nicht genügt: Ein ReAct-Agent mit GPT-4.1 bestand 77,4 Prozent der Läufe, aber nur 53,0 Prozent der Aufgaben in allen fünf Wiederholungen.

## Genauigkeit und Konsistenz sind zwei Kennzahlen

Die übliche Durchschnittsquote beantwortet, wie oft ein Agent insgesamt erfolgreich ist. Sie beantwortet nicht, ob ein heute bestandener Ablauf morgen reproduzierbar bleibt. IBM bezeichnet die Differenz im Beispiel als Konsistenzlücke von 24,4 Prozentpunkten.

Der vorgeschlagene Consistency Analyzer untersucht aufgezeichnete Trajektorien und sucht Entscheidungspunkte, an denen kleine Änderungen die nächste Aktion kippen lassen. Dafür werden einzelne Schritte kontrolliert mehrfach abgetastet, ohne den kompletten Geschäftsprozess erneut auszuführen. Laut IBM reduzierten daraus erzeugte Leitlinien die gemessene Lücke im Versuch von 24,4 auf 12,0 Prozentpunkte, ohne die durchschnittliche Genauigkeit zu verschlechtern.

## Optimierung braucht einen Prüfprozess

AWS verfolgt mit Amazon Bedrock AgentCore einen ergänzenden Ansatz. Produktions-Traces und ein Bewertungssignal dienen dazu, Änderungen am System-Prompt vorzuschlagen. Teams sollen Varianten zunächst in Offline-Batch-Evaluationen und anschließend in kontrollierten Online-A/B-Tests validieren, bevor sie eine neue Konfiguration übernehmen.

Beide Ansätze machen denselben Betriebsfehler sichtbar: Ein erfolgreicher Demo-Lauf ist noch kein Nachweis für einen stabilen Agenten. Auch eine automatisch optimierte Konfiguration darf nicht direkt zum neuen Standard werden. Sie braucht eine feste Testsuite, Vergleichswerte und einen klaren Freigabepunkt.

## Was DACH-Unternehmen messen sollten

Für einen produktionsnahen Piloten sollten Sie mindestens vier Werte getrennt erfassen:

- Erfolgsquote über alle Läufe,
- Anteil der Aufgaben, die in jeder Wiederholung bestehen,
- Art und Position abweichender Tool-Entscheidungen,
- Kosten und Laufzeit pro wiederholtem Test.

Testen Sie kritische Vorgänge mehrfach mit identischem Auftrag und kontrollierter Umgebung. Dazu zählen etwa Vertragsprüfung, Kontenabgleich, Ticket-Routing oder Änderungen an produktiven Systemen. Legen Sie außerdem fest, welche Abweichung tolerierbar ist und wann ein Mensch übernehmen muss.

Der zweite Lauf ist damit kein überflüssiger Test. Er prüft eine andere Eigenschaft: nicht, ob Ihr Agent die Aufgabe kann, sondern ob Sie sich im Betrieb auf sein Verhalten verlassen können.

## Quellen

- [IBM Research auf Hugging Face — Your Agent Aced the Task. Will It Do It Again?](https://huggingface.co/blog/ibm-research/altk-evolve-consistency)
- [AWS — Optimizing agent system prompts with Amazon Bedrock AgentCore](https://aws.amazon.com/blogs/machine-learning/optimizing-agent-system-prompts-with-amazon-bedrock-agentcore/)
