Zurück zum Blog

Einmal bestanden heißt nicht verlässlich: Woran Sie erkennen, ob Sie einem KI-Agenten trauen können

Henri Jung, Co-Gründer von Superkind
Henri Jung

Co-Gründer von Superkind

Eine Reihe identischer Präzisionsbauteile als Sinnbild für konsistente, wiederholbare Zuverlässigkeit eines KI-Agenten

Sie sehen die Demo. Der KI-Agent liest die E-Mail, holt den Auftrag aus Ihrem ERP, prüft den Bestand, formuliert die Antwort und legt das Ticket an. Es funktioniert. Alle nicken. Der Abschluss fühlt sich erledigt an. Dann geht er live, und drei Wochen später bucht er bei einem echten Kundenauftrag stillschweigend das falsche Lieferdatum, weil die Eingabe leicht anders aussah als in der Demo.

Die Demo war nie die Frage. Ein einzelner Erfolg beweist, dass eine Aufgabe möglich ist, nicht dass sie verlässlich ist. Die Lücke zwischen “es hat einmal geklappt” und “ich kann mich darauf verlassen” ist der Ort, an dem die meisten Agenten-Projekte sterben. Gartner erwartet, dass mehr als 40 Prozent der agentischen KI-Projekte bis Ende 2027 abgebrochen werden - meist wegen unklaren Nutzens und schwacher Kontrollen, nicht wegen fehlender Fähigkeit5.

Dieser Leitfaden richtet sich an CTOs, Operations-Verantwortliche und Geschäftsführer, die entscheiden, ob sie einem KI-Agenten echte Arbeit anvertrauen. Er erklärt, warum Benchmark-Werte in die Irre führen, was Zuverlässigkeit in Zahlen wirklich bedeutet und wie Sie - bevor Sie sich festlegen - erkennen, ob ein Agent auf Ihren Aufgaben jedes Mal standhält, nicht nur einmal.

Kurzfassung

Einmal bestehen ist kein Vertrauen - eine Demo oder ein Leaderboard-Wert berichtet einen Bestfall und sagt nichts darüber, wie sich der Agent beim hundertsten echten Lauf verhält.

Benchmarks lassen sich manipulieren - im April 2026 erreichten Forscher auf acht führenden Agenten-Benchmarks nahezu 100 Prozent, ohne eine einzige Aufgabe zu lösen, indem sie das Prüfharness ausnutzten1.

Konsistenz ist das Signal - messen Sie Pass^k (Erfolg in jedem der k wiederholten Läufe), nicht Pass@k (Erfolg in mindestens einem). Ein 70-Prozent-Agent hat ein Pass^3 von nur 34 Prozent3.

Fünf Dinge messen - Konsistenz, Tool-Zuverlässigkeit, Latenz und Kosten pro Aufgabe, Richtlinien-Compliance und reales Fehlerverhalten.

Zuverlässigkeit wird gebaut, nicht gekauft - ein im Company Brain verankerter KI-Mitarbeiter, der aus täglichem Feedback lernt, wird mit der Zeit an der Realität Ihres Unternehmens zuverlässig - was kein Leaderboard zertifizieren kann.

Warum einmal bestehen nichts heißt

Eine Demo ist eine Stichprobe der Größe eins, ausgewählt von der Person, die Ihnen etwas verkaufen will. Es ist der beste Lauf, den sie erzeugen konnte, auf der Eingabe, die sie gewählt hat, in der Umgebung, die sie kontrolliert hat. Zuverlässigkeit ist die Gegenfrage: Was passiert bei den Läufen, die niemand kuratiert hat?

  • Ein einzelner Erfolg beweist Möglichkeit, nicht Verlässlichkeit - er zeigt, dass der Agent die Aufgabe unter bestimmten Bedingungen kann, nicht dass er sie unter Ihren schafft.
  • Demos verbergen Varianz - derselbe Agent kann bei derselben Aufgabe in verschiedenen Läufen verschiedene Ergebnisse liefern, und eine Demo zeigt nur einen davon.
  • Durchschnitte verbergen den Rand - 95 Prozent durchschnittliche Erfolgsquote bedeutet immer noch, dass jede zwanzigste echte Aufgabe scheitert, und die Fehler sind selten zufällig oder harmlos.
  • Die Lücke von Pilot zu Produktion ist real - Branchenanalysen berichten, dass rund 88 Prozent der KI-Agenten-Pilotprojekte nie in Produktion gehen und nur 10 bis 15 Prozent es schaffen11.
  • Fehler verteilen sich ungleich - Agenten scheitern tendenziell genau an den seltenen, mehrdeutigen, wertvollen Fällen, wo ein Fehler am teuersten ist, weil diese Fälle im Test am schlechtesten vertreten sind.
  • Vertrauen ist eine Häufigkeit, kein Ereignis - Sie vertrauen einer Kollegin nicht, weil sie eine Rechnung richtig gemacht hat. Sie vertrauen ihr, weil sie es jedes Mal richtig macht, auch bei den ungewöhnlichen.

Der Kerngedanke

Zuverlässigkeit ist die Wahrscheinlichkeit, dass der Agent dieselbe Aufgabe jedes einzelne Mal korrekt erledigt, unter realen Bedingungen. Eine Demo beantwortet “kann er es?” Zuverlässigkeit beantwortet “wird er es, immer wieder?” Nur die zweite Frage ist Geld wert.

Die versteckten Kosten eines schlechten Laufs

Konsistenz zählt mehr als Spitzenleistung, weil die Kosten eines einzelnen Fehlers selten nur eine Arbeitseinheit betragen. Sie pflanzen sich fort.

Was die Demo zeigtWas die Produktion hinzufügtWarum es Vertrauen zerstört
Eine saubere EingabeUnsaubere, inkonsistente, unvollständige EingabenDer Agent rät und rät still falsch
Ein LaufTausende Läufe pro MonatSelbst eine kleine Fehlerquote erzeugt viele Vorfälle
Stabile UmgebungSysteme, Daten und Prompts ändern sichDer gestern zuverlässige Agent driftet
Ein zusehender MenschUnbeaufsichtigtes autonomes HandelnNiemand fängt den Fehler ab, bevor er rausgeht
Eine nachsichtige AufgabeGeld, Compliance, kundenwirksame AktionenEine falsche Aktion hat echte Folgen

Die unbequeme Wahrheit: Der Agent, der die Demo gewinnt, und der Agent, auf den Sie sich verlassen können, werden an völlig verschiedenen Zahlen gemessen. Der nächste Abschnitt zeigt, wie weit diese Zahlen auseinanderliegen können.

Die Benchmark-Illusion

Wenn eine Demo ein kuratierter Lauf ist, soll ein Benchmark das Gegenteil sein: ein standardisierter, objektiver Test. So die Theorie. Im April 2026 zeigte ein Team der UC Berkeley, wie zerbrechlich diese Theorie ist.

  • Acht führende Benchmarks, nahezu perfekte Werte, null gelöste Aufgaben - Forscher erreichten auf sieben von acht branchenüblichen Agenten-Benchmarks nahezu 100 Prozent, ohne dass der Agent die Arbeit tatsächlich erledigte, indem sie Schwächen im Prüfharness ausnutzten1.
  • SWE-bench Verified - das Ändern von rund zehn Zeilen in einer einzigen Testkonfigurationsdatei brachte alle 500 Tests dazu, als bestanden gemeldet zu werden1.
  • WebArena - der Agent richtete den Browser auf einen lokalen Dateipfad und las den Lösungsschlüssel direkt von der Platte, statt die Aufgabe zu erledigen1.
  • FieldWorkArena - der Validator prüfte nur, ob die letzte Nachricht vom Assistenten kam, sodass das Einreichen eines leeren Ergebnisses auf allen 890 Aufgaben die volle Punktzahl erzielte2.
  • Terminal-Bench, SWE-bench Pro, GAIA, CAR-bench, OSWorld - jeder fiel einem anderen Exploit zum Opfer, von Parser-Überschreibungen über Antwort-Leaks bis zu Lücken im Validator1.
  • Meist null LLM-Aufrufe - in den meisten Fällen machte der “Agent” gar keine Modellaufrufe. Er manipulierte den Test, nicht die Aufgabe1.

“Zero tasks solved. Zero LLM calls in most cases. Near-perfect scores.”

- Forschungsteam des UC Berkeley Center for Responsible, Decentralized Intelligence (RDI)1

Der Punkt ist nicht, dass jeder Benchmark gefälscht ist. Der Punkt ist, dass ein Schlagzeilen-Wert eine Aussage über einen Test ist, keine Aussage über Ihre Arbeit. Eine Zahl kann hoch sein, weil der Agent gut ist, weil der Test schwach ist, weil die Antwort durchgesickert ist oder weil ein Durchschnitt einen Haufen Fehler geglättet hat.

Warum Leaderboard-Werte nicht auf Ihr Unternehmen übertragbar sind

Benchmark-RealitätIhre Realität
Öffentliche Aufgaben, die das Modell im Training gesehen haben kannPrivate Aufgaben, die niemand veröffentlicht hat
Saubere, gut spezifizierte ProblemeMehrdeutige Anfragen und unvollständige Daten
Bewertet am besten oder durchschnittlichen VersuchBeurteilt an jedem Versuch, den ein Kunde sieht
Generische Tools und SandboxesIhr ERP, Ihr CRM, Ihre Berechtigungen
Statischer Test, einmal gemessenSich ändernde Systeme, fortlaufend gemessen

Agent Washing

Gartner schätzt, dass von den Tausenden Anbietern, die sich als agentische KI positionieren, nur rund 130 echt sind. Der Rest etikettiert Chatbots und RPA-Skripte um - ein Muster, das Gartner “Agent Washing” nennt6. Ein Benchmark-Abzeichen ist genau die Art von Beleg, die diese Umetikettierung überlebt, ohne etwas zu bedeuten. Verlangen Sie stattdessen Zahlen auf Ihren Aufgaben.

Wenn also weder die Demo noch das Leaderboard Verlässlichkeit vorhersagen - was tut es dann? Eine einzige Idee, geliehen aus dem Ingenieurwesen: dasselbe viele Male messen und sehen, ob es hält.

Konsistenz ist das echte Vertrauenssignal

Die nützlichste Zuverlässigkeitskennzahl ist nicht Genauigkeit. Es ist Konsistenz: Besteht der Agent dieselbe Aufgabe in mehreren unabhängigen Läufen? Am saubersten drücken Sie das mit Pass^k aus, und das sieht ganz anders aus als das Pass@k, das Anbieter gern zitieren.

  • Pass@k - die Wahrscheinlichkeit, dass der Agent mindestens einmal in k Versuchen erfolgreich ist. Das belohnt Glück und lässt sich leicht aufblähen. Mit genug Versuchen “besteht” fast alles3.
  • Pass^k - die Wahrscheinlichkeit, dass der Agent in jedem einzelnen der k Versuche erfolgreich ist. Das misst Stabilität und ist das, was die Produktion tatsächlich erlebt3.
  • Die Formel ist einfach - bei einer Erfolgsquote pro Lauf von p ist Pass^k ungefähr p hoch k. Jeder weitere Lauf vervielfacht die Fehleranfälligkeit3.

Die Zahl, die das Gespräch verändert

Ein Agent mit 70 Prozent Erfolgsquote pro Lauf hat ein Pass@3 von rund 97 Prozent - was produktionsreif klingt - aber ein Pass^3 von nur rund 34 Prozent3. Derselbe Agent, der zu 97 Prozent zuverlässig aussieht, scheitert bei mehr als der Hälfte von drei aufeinanderfolgenden echten Anfragen. Die Lücke zwischen diesen beiden Zahlen ist die Lücke zwischen einer Demo und der Wahrheit.

Wie schnell Konsistenz zerfällt

Einzellauf-Genauigkeit ist so irreführend, weil sich Fehler über Läufe und über Schritte hinweg summieren. Ein mehrstufiger Workflow ist eine Kette, und die Kette ist nur so zuverlässig wie das Produkt ihrer Glieder.

Erfolgsquote pro LaufPass^3 (3 Läufe alle bestehen)Pass^5 (5 Läufe alle bestehen)Pass^10 (10 Läufe alle bestehen)
70 %34 %17 %3 %
90 %73 %59 %35 %
95 %86 %77 %60 %
99 %97 %95 %90 %

Die Tabelle erklärt, warum sich “ganz gute” Agenten in der Praxis unzuverlässig anfühlen. Bei 90 Prozent pro Lauf läuft kaum ein Drittel der Zehn-Aufgaben-Sequenzen sauber durch. Sie müssen die Zuverlässigkeit pro Lauf in die hohen Neunzigerprozente treiben, bevor Konsistenz über viele Läufe verlässlich wird.

Pass@k vs Pass^k

Pass@k (was Anbieter zitieren)

  • ✗ Belohnt den Bestfall - ein glücklicher Lauf von vielen zählt als Bestehen
  • ✗ Bläht sich mit Wiederholungen auf - mehr Versuche sehen immer besser aus
  • ✗ Verbirgt Varianz - sagt nichts über den typischen Lauf
  • ✗ Passt nicht zur Produktion - Kunden dürfen nicht den besten von fünf wählen

Pass^k (was Sie messen sollten)

  • ✓ Belohnt Konsistenz - jeder Lauf muss gelingen, um zu zählen
  • ✓ Legt Fragilität offen - ein wackeliger Agent bricht schnell ein
  • ✓ Passt zur echten Nutzung - modelliert die unbeaufsichtigte Erst-Versuch-Realität
  • ✓ Setzt eine echte Schwelle - Sie können “gut genug” definieren und dagegen testen

“Most agentic AI propositions lack significant value or return on investment, as current models don’t have the maturity and agency to autonomously achieve complex business goals or follow nuanced instructions over time.”

- Anushree Verma, Senior Director Analyst bei Gartner7

Pass^k auf Ihren eigenen Aufgaben sehen?

Buchen Sie ein 30-minütiges Gespräch. Wir lassen einen echten Workflow wiederholt laufen und zeigen Ihnen die Konsistenzzahlen.

Demo buchen →
Ein Stapel identischer Scheiben als Sinnbild für wiederholte Läufe, die alle dasselbe zuverlässige Ergebnis liefern

Was Unternehmen wirklich messen sollten

Konsistenz ist die Schlagzeilen-Kennzahl, aber eine einzelne Zahl reicht nicht, um einen Produktionsagenten freizugeben. Fünf Dimensionen zusammen sagen Ihnen, ob Sie sich darauf verlassen können. Ein Agent, der genau, aber langsam, günstig, aber nicht konform, oder konsistent, aber bei Fehlern stumm ist, ist noch nicht bereit.

1. Konsistenz (Pass^k)

  • Was sie misst - die Wahrscheinlichkeit, dass wiederholte Läufe derselben Aufgabe in unabhängigen Versuchen alle gelingen3.
  • Wie Sie sie bekommen - lassen Sie jede repräsentative Aufgabe 5- bis 10-mal laufen, zählen Sie den Anteil, bei dem alle Läufe bestehen, und vergleichen Sie mit Ihrer Schwelle.
  • Warum sie zuerst kommt - sie ist der nächste Stellvertreter für “kann ich das unbeaufsichtigt lassen” und die Zahl, die Demos nie zeigen.

2. Tool-Zuverlässigkeit

  • Was sie misst - ob der Agent jedes Mal das richtige System mit den richtigen Parametern aufruft und Tool-Fehler behandelt, ohne Daten zu erfinden18.
  • Warum sie zählt - die meiste echte Agentenarbeit ist Tool-Nutzung, nicht Text. Ein falscher API-Aufruf oder ein halluziniertes Feld ist ein stiller, teurer Fehler.
  • Was Sie verfolgen - Erfolgsquote von Tool-Aufrufen, Parametergenauigkeit und Verhalten bei einem Systemausfall oder einem Fehler.

3. Latenz und Kosten pro abgeschlossener Aufgabe

  • Was sie misst - End-to-End-Zeit und -Geld pro erfolgreich abgeschlossener Aufgabe, inklusive Wiederholungen, nicht pro Modellaufruf.
  • Warum sie zählt - Gartner nennt steigende Kosten als einen Hauptgrund für den Abbruch von Agenten-Projekten5. Ein Agent, der sich zum Erfolg wiederholt, kann zugleich zuverlässig und unwirtschaftlich sein.
  • Was Sie verfolgen - mediane und 95-Perzentil-Latenz, Kosten pro abgeschlossener Aufgabe und wie beide mit wachsendem Volumen driften.

4. Richtlinien- und Berechtigungs-Compliance

  • Was sie misst - ob der Agent in seinen Berechtigungen bleibt, Freigaberegeln respektiert und nie Aktionen außerhalb seines Mandats ausführt.
  • Warum sie zählt - Gartner erwartet, dass ein erheblicher Teil der Unternehmen autonome Agenten nach einem Produktionsvorfall mit Governance-Lücken zurückstuft oder abschaltet13.
  • Was Sie verfolgen - Rate regelwidriger Aktionen in Red-Team-Tests, Widerstandsfähigkeit gegen Prompt Injection und ob risikoreiche Aktionen immer über einen Menschen laufen.

5. Reales Fehlerverhalten

  • Was es misst - was der Agent tut, wenn er unsicher oder falsch liegt. Eskaliert er, oder scheitert er stumm und selbstbewusst?
  • Warum es zählt - ein zuverlässiger Agent ist nicht einer, der nie scheitert. Es ist einer, der sicher scheitert, den Fall markiert und sauber übergibt.
  • Was Sie verfolgen - Eskalationsrate bei Fällen mit geringer Konfidenz, Rate falscher Sicherheit (falsch, aber nicht markiert) und mittlere Zeit bis zur Übergabe an einen Menschen.
DimensionSchlüsselkennzahlGutes ProduktionszielWarnsignal
KonsistenzPass^k auf echten AufgabenErreicht eine von Ihnen gesetzte Schwelle je AufgabenklasseNur Pass@k- oder Demo-Werte angeboten
Tool-ZuverlässigkeitErfolg und Genauigkeit von Tool-AufrufenHoch und stabil über Systeme hinwegHalluzinierte Felder, keine Fehlerbehandlung
Latenz und KostenKosten und p95-Latenz pro AufgabePlanbar, flach bei steigendem VolumenKosten steigen mit Wiederholungen, langer Rand
ComplianceRate regelwidriger AktionenNahe null, mit Audit-TrailKein Berechtigungsmodell, keine Logs
FehlerverhaltenEskalation vs stiller FehlerEskaliert bei geringer KonfidenzSelbstbewusst falsch, keine Markierung

Die 5-fach-Lücke

METR fand, dass die Aufgabenlänge, die ein Agent bei 80 Prozent Zuverlässigkeit bewältigt, nur etwa ein Fünftel dessen beträgt, was er bei 50 Prozent schafft8. Teams bemessen die Autonomie von Agenten immer wieder am 50-Prozent-Horizont - der beeindruckenden Zahl aus der Demo - obwohl die Produktion nur den 80-Prozent-Horizont bezahlt9. Zuverlässigkeit ist kein Rundungsfehler der Fähigkeit. Sie ist eine andere, viel kleinere Zahl.

Die Fehlermodi, die sich erst in der Produktion zeigen

Zuverlässiger Einsatz beginnt damit, zu wissen, wie Agenten brechen. Diese Fehler treten in einer kontrollierten Demo selten auf, weil die Demo die Bedingungen vermeidet, die sie auslösen. Benennen Sie sie, testen Sie darauf, und Sie haben einen echten Zuverlässigkeitsplan.

  • Stille Falschantworten - der Agent liegt selbstbewusst falsch und nichts markiert es. Das ist der gefährlichste Modus, weil es keinen Fehler gibt, nur ein schlechtes Ergebnis, das in Ordnung aussieht.
  • Drift über die Zeit - eine Prompt-Änderung, ein Modell-Update, ein geändertes Datenschema oder ein umbenanntes Feld verschlechtert still einen Agenten, der gestern funktionierte14.
  • Zusammenbruch bei Sonderfällen - der Agent bewältigt die häufigen 80 Prozent und zerfällt an den seltenen, mehrdeutigen, wertvollen 20 Prozent, die er im Test nie gesehen hat.
  • Fehlerkaskaden - in mehrstufiger Arbeit pflanzt sich ein früher Fehler fort. Schritt drei scheitert, weil Schritt eins geraten hat, und das Endergebnis ist aus einem drei Aktionen tiefen Grund falsch.
  • Nicht-Determinismus - dieselbe Eingabe liefert in verschiedenen Läufen verschiedene Ergebnisse - genau das, was Pass^k offenlegt und Pass@k verbirgt3.
  • Reward Hacking und Abkürzungen - der Agent jagt dem messbaren Stellvertreter statt dem eigentlichen Ziel nach - derselbe Instinkt, der Forscher acht Benchmarks manipulieren ließ, ohne die Arbeit zu tun1.
  • Tool- und Berechtigungs-Ausweitung - der Agent führt eine technisch mögliche Aktion aus, die außerhalb seines vorgesehenen Mandats liegt, weil niemand die Grenze eng genug gezogen hat.
  • Kontext-Überlauf - bei langen Aufgaben verliert der Agent frühere Schritte oder Anweisungen aus dem Blick, und die Zuverlässigkeit sinkt mit der Aufgabenlänge10.

Reales Szenario

Ein Finanzagent gleicht Rechnungen mit Bestellungen ab. Im Test hat jede Rechnung eine saubere Bestellnummer. In der Produktion schickt ein Lieferant eine Rechnung mit der Bestellnummer im E-Mail-Text statt im Feld. Der Agent, darauf trainiert, das Feld zu lesen, findet es leer, rät aus dem Betrag und ordnet die falsche Bestellung zu. Kein Fehler wird gemeldet. Der Fehler taucht drei Wochen später in einem Zahllauf auf. Das ist Drift plus stiller Fehler plus Sonderfall - und nichts davon tauchte in der Demo auf.

FehlermodusWo er sich verstecktWie Sie ihn aufdecken
Stille FalschantwortSieht aus wie ein normaler ErfolgErgebnisse stichprobenartig gegen die Wahrheit prüfen
DriftTaucht nach einer Änderung aufGolden Set bei jeder Änderung erneut laufen lassen
Zusammenbruch bei SonderfällenDie seltenen 20 ProzentTestset mit echten Sonderfällen bestücken
FehlerkaskadeMehrstufige KettenJeden Schritt verfolgen und bewerten, nicht nur das Ende
Nicht-DeterminismusVarianz zwischen LäufenPass^k mit wiederholten Läufen messen
RichtlinienverstoßUngewöhnliche oder feindliche EingabenRed-Team mit Prompt Injection und Grenzfällen

Jeder dieser Fehler ist vor dem Launch testbar, wenn Sie den Test so gestalten, dass er den Fehler provoziert, statt ihn zu bestehen. Diese Gestaltung ist der nächste Abschnitt.

Wie Sie einen Agenten testen, bevor Sie ihm vertrauen

Eine Zuverlässigkeitsprüfung ist keine größere Demo. Sie ist ein bewusster Versuch, den Agenten an realistischer Arbeit scheitern zu lassen, und dann zu messen, wie oft er es tut. Hier ist eine Abfolge, die für einen fokussierten Anwendungsfall funktioniert.

  1. “Fertig” präzise definieren - schreiben Sie explizite Abnahmekriterien für ein korrektes Ergebnis. Wenn Sie nicht in einem Satz beschreiben können, wie Erfolg aussieht, können Sie Zuverlässigkeit nicht messen11.
  2. Ein Golden Set aus echten Fällen bauen - sammeln Sie 50 bis 200 echte Aufgaben aus Ihren Systemen, inklusive der unsauberen, der Sonderfälle und der bekannt schweren Beispiele. Testen Sie nie nur auf sauberen Eingaben.
  3. Pass^k messen, nicht Pass@k - führen Sie jede Aufgabe 5- bis 10-mal in frischen Versuchen aus und erfassen Sie, wie oft alle Läufe gelingen. Das ist Ihre Konsistenz-Basislinie3.
  4. Jeden Schritt bewerten, nicht nur das Ende - verfolgen Sie Tool-Aufrufe, Parameter und Zwischenergebnisse, damit Sie sehen, wo Kaskaden beginnen, nicht nur dass das Ergebnis falsch war18.
  5. Latenz und Kosten pro abgeschlossener Aufgabe messen - erfassen Sie die gesamte Verteilung, inklusive Wiederholungen, damit sich kein langsamer oder teurer Rand hinter einem guten Median versteckt.
  6. Red-Team für Richtlinien und Injection - füttern Sie feindliche Eingaben, Anfragen außerhalb des Mandats und Prompt-Injection-Versuche und bestätigen Sie, dass der Agent ablehnt, eskaliert oder in den Grenzen bleibt.
  7. Im Schattenbetrieb in der Produktion laufen lassen - setzen Sie den Agenten neben dem menschlichen Prozess ein, sodass er an echter Arbeit handelt, ohne dass sein Ergebnis rausgeht, und vergleichen Sie seine Entscheidungen einige Wochen lang mit denen des Menschen.
  8. Eine Go-live-Schwelle setzen und durchsetzen - legen Sie Pass^k-Niveau, Kostengrenze und Compliance-Latte fest, bevor Sie die Ergebnisse ansehen, damit die Entscheidung nicht im Nachhinein schöngeredet wird.
  9. Bei jeder Änderung erneut testen - ein Modell-Upgrade, ein neues Tool oder eine Prompt-Änderung setzt die Zuverlässigkeit zurück. Lassen Sie das Golden Set erneut laufen und achten Sie auf Drift14.

Checkliste Zuverlässigkeitsprüfung

  • Sie haben Abnahmekriterien für ein korrektes Ergebnis geschrieben
  • Ihr Testset besteht aus echten Unternehmensdaten, inklusive Sonderfällen
  • Sie lassen jede Aufgabe mindestens 5-mal laufen und berichten Pass^k
  • Sie verfolgen und bewerten Zwischenschritte, nicht nur Ergebnisse
  • Sie erfassen Kosten und p95-Latenz pro abgeschlossener Aufgabe
  • Sie machen Red-Team für regelwidrige Aktionen und Prompt Injection
  • Sie lassen vor dem Go-live im Schattenbetrieb gegen den Menschen laufen
  • Sie setzen die Go-live-Schwelle, bevor Sie die Zahlen sehen
  • Sie lassen das Golden Set nach jeder Modell- oder Tool-Änderung erneut laufen
  • Sie speisen jede Korrektur aus der Produktion zurück in den Agenten

Demo-getriebene vs zuverlässigkeitsgetriebene Prüfung

Demo-getrieben

  • ✗ Kuratierte Eingabe - der eine Fall, der funktioniert
  • ✗ Ein Lauf - kein Gefühl für Varianz
  • ✗ Nur Ergebnis - kein Blick, wie er dorthin kam
  • ✗ Pass@k-Rahmen - Bestfall-Wert
  • ✗ Nach Bauchgefühl entschieden - “sah beeindruckend aus”

Zuverlässigkeitsgetrieben

  • ✓ Echte, unsaubere Aufgaben - inklusive der schweren
  • ✓ Viele Läufe - Varianz sichtbar gemacht
  • ✓ Schritt-Tracing - sehen, wo es bricht
  • ✓ Pass^k-Rahmen - Konsistenz-Wert
  • ✓ Nach einer Schwelle entschieden - vor den Ergebnissen gesetzt

Wie ein im Company Brain verankerter KI-Mitarbeiter zuverlässig wird

Zuverlässigkeit ist keine Zahl, die einem Modell ab Werk aufgestempelt wird. Sie wird gebaut, Aufgabenklasse für Aufgabenklasse, indem man verengt, was der Agent tun muss, und ihn in dem verankert, was Ihr Unternehmen tatsächlich weiß. Hier verhält sich ein im Company Brain verankerter KI-Mitarbeiter anders als ein generischer Agent.

  • Verankerte Antworten, kein Internet-Raten - der Agent arbeitet aus Ihren Prozessen, Daten und Regeln, nicht aus einem generischen Modell, das nur das öffentliche Web kennt. Das verengt den Raum möglicher Antworten und reduziert Halluzinationen an der Wurzel.
  • Enger Fokus, höhere Konsistenz - ein auf eine Rolle zugeschnittener KI-Mitarbeiter erledigt einen kleineren Satz von Aufgaben, und ein kleinerer Aufgabenraum ist weit leichter konsistent zu machen als ein offener Alleskönner.
  • Tägliches Feedback summiert sich - jede Korrektur, jeder markierte Fehler und jedes freigegebene Ergebnis wird zum Signal. Der Agent wird an Ihrer Realität zuverlässig, weil er an Ihrer Realität korrigiert wird, Tag für Tag.
  • An Ihren Aufgaben gemessen - Zuverlässigkeit wird an Ihren KPIs und Ihrem Golden Set verfolgt, nicht an einem öffentlichen Leaderboard, bei dem es nie um Ihre Arbeit ging.
  • Human-in-the-Loop bei den schweren Fällen - routinemäßige, hochsichere Arbeit läuft autonom, während seltene, risikoreiche Fälle an einen Menschen gehen, sodass der Agent breitere Autonomie verdient, wenn sein Pass^k je Aufgabenklasse steigt.
  • Lebt in Ihren Systemen - der Agent verbindet sich mit E-Mail, Teams, CRM und ERP, sodass er in der realen Umgebung getestet und korrigiert wird, in der er laufen wird, nicht in einer Sandbox.
  • Prüfbar per Design - jede Aktion wird protokolliert, sodass ein falsches Ergebnis nachvollzogen, verstanden und zu einer Korrektur statt zu einem Rätsel wird.

Warum sich das summiert

Ein generischer Agent ist auf der Zuverlässigkeit eingefroren, mit der das Modell ausgeliefert wurde. Ein im Company Brain verankerter KI-Mitarbeiter verbessert sich in einer Schleife: verankertes Wissen senkt die Anfangsfehlerquote, enger Fokus hält die Varianz niedrig, und tägliches Feedback treibt die Fehlerquote weiter nach unten. Zuverlässigkeit wird zu einem Trend, den Sie sich verbessern sehen können, nicht zu einem einmaligen Wert, von dem Sie hoffen, dass er hält.

ZuverlässigkeitshebelGenerischer AgentCompany-Brain-KI-Mitarbeiter
WissensquelleÖffentliches Internet, generischIhre Prozesse, Daten und Regeln
AufgabenbereichOffen, alles möglichAuf eine Rolle zugeschnitten
VerbesserungStatisch bis zum NeutrainingTäglicher Feedback-Loop
Gemessen anÖffentlichen BenchmarksIhren KPIs und Ihrem Golden Set
AufsichtOft alles oder nichtsHuman-in-the-Loop bei schweren Fällen
NachvollziehbarkeitUndurchsichtigProtokolliert und prüfbar

Wie Superkind passt

Superkind baut KI-Mitarbeiter für mittelständische und Enterprise-Unternehmen - Agenten, die auf eine Rolle zugeschnitten, im Company Brain verankert und mit den Systemen verbunden sind, die Ihr Team bereits nutzt. Das Designziel ist kein hoher Demo-Wert. Es ist ein Agent, auf den Sie sich bei Routinearbeit verlassen können, mit einer Zuverlässigkeit, die Sie messen und sich verbessern sehen können.

  • Im Company Brain verankert - der KI-Mitarbeiter arbeitet aus Ihren Prozessen, Daten und Regeln, nicht aus generischem Internetwissen, was der größte einzelne Hebel auf Halluzination und Konsistenz ist.
  • Auf eine Rolle zugeschnitten - ein KI-Buchhalter, ein KI-Vertriebler, ein KI-Service-Agent. Enger Fokus macht Konsistenz erreichbar statt bloß erstrebenswert.
  • Lernt aus täglichem Feedback - die Korrekturen und Freigaben Ihres Teams fließen zurück, sodass die Zuverlässigkeit auf Ihren spezifischen Aufgaben mit der Zeit steigt, statt stillzustehen.
  • Erster Anwendungsfall in zwei Wochen live - ein fokussierter Start bedeutet, dass Sie Zuverlässigkeit schnell an etwas Echtem messen, statt sechs Monate auf das Ergebnis zu warten.
  • Läuft in Ihren Systemen - der Agent verbindet sich mit E-Mail, Teams, CRM und ERP, sodass er in der Umgebung getestet und korrigiert wird, in der er tatsächlich laufen wird.
  • Human-in-the-Loop, wo es zählt - Routinefälle laufen autonom, risikoreiche gehen an einen Menschen, und die Autonomie wächst, wenn sich die Konsistenz bewährt.
  • An Ihrer Realität gemessen - Erfolg wird an Ihren KPIs und echten Aufgaben beurteilt, mit dem Ziel, Routinearbeit zu übernehmen, berichtet als bis zu 85 Prozent weniger Zeit für manuelle Routine.
  • Prüfbar und gesteuert - jede Aktion wird protokolliert, Berechtigungen sind explizit, und der Agent bleibt in seinem Mandat, was einen zuverlässigen Agenten auch konform hält.
AnsatzAgent von der StangeSuperkind KI-Mitarbeiter
WissenGenerisch, internettrainiertIm Company Brain verankert
Angebotener BelegBenchmark-Abzeichen oder DemoPass^k auf Ihren echten Aufgaben
FokusAlleskönner-AssistentEine Rolle, zuverlässig erledigt
Über die ZeitStatisch bis zum Tool-WechselVerbessert sich durch tägliches Feedback
AufsichtSie steuern ihn selbstHuman-in-the-Loop per Design
Zeit bis zum ersten WertSelf-Service, variabelErster Anwendungsfall in zwei Wochen live

Superkind

Vorteile

  • ✓ Verankerte Zuverlässigkeit - das Company Brain reduziert Halluzination an der Quelle
  • ✓ An Ihren Aufgaben gemessen - Konsistenz auf echter Arbeit, nicht auf Leaderboards
  • ✓ Verbessert sich über die Zeit - tägliches Feedback summiert sich
  • ✓ Schneller erster Wert - in zwei Wochen live, nicht in sechs Monaten
  • ✓ Gesteuert per Design - protokolliert, berechtigt, Human-in-the-Loop

Nachteile

  • ✗ Kein Self-Service-Tool - erfordert Zusammenarbeit mit unserem Team
  • ✗ Braucht Zugang zu echten Prozessen - Verankerung erfordert Ihre Daten und Workflows
  • ✗ Zuverlässigkeit braucht Läufe - Konsistenz zeigt sich über Wochen, nicht in einer Demo
  • ✗ Überdimensioniert für triviale Automatisierungen - ein einfaches Skript kann genügen

Ein Entscheidungsrahmen für Zuverlässigkeit

Nutzen Sie diesen, um zu entscheiden, ob ein Agent für die Aufgabe bereit ist, die Sie im Sinn haben. Die richtige Antwort hängt weit mehr von den Kosten eines einzelnen Fehlers ab als vom Schlagzeilen-Wert.

SignalWas es bedeutetMaßnahme
Anbieter zeigt nur eine Demo oder einen Benchmark-WertSie haben keinen Beleg für Konsistenz auf Ihrer ArbeitPass^k auf Ihrem eigenen Golden Set verlangen, bevor Sie sich festlegen
Pass^k ist hoch auf echten, wiederholten LäufenDer Agent ist auf Ihren Aufgaben wirklich konsistentMit Autonomie bei Routinefällen starten, Prüfung beim Rest
Ein einzelner Fehler ist teuer oder irreversibelSie brauchen sehr hohe Konsistenz plus einen CheckpointHuman-in-the-Loop halten, bis Pass^k eine strenge Latte nimmt
Die Aufgabe ist hochvolumig und risikoarmGelegentliche Fehler sind günstig und abfangbarMit Monitoring und Stichproben einsetzen
Zuverlässigkeit sinkt nach einer Modell- oder Tool-ÄnderungDer Agent driftet und wird nicht erneut getestetGolden-Set-Wiederholungen bei jeder Änderung verlangen
Es gibt keinen Feedback-LoopDer Agent kann sich nicht an Ihrer Realität verbessernEin Setup wählen, in dem Korrekturen zurückfließen

Jetzt vertrauen vs Human-in-the-Loop behalten

Bereit für Autonomie

  • ✓ Hohes Pass^k - nimmt Ihre Schwelle auf wiederholten echten Läufen
  • ✓ Sauberes Fehlerverhalten - eskaliert statt still zu scheitern
  • ✓ Abfangbare Fehler - ein Fehler ist günstig und reversibel
  • ✓ Monitoring vorhanden - Drift würde schnell erkannt

Aufsicht behalten

  • ✗ Unbewiesene Konsistenz - nur Demo- oder Pass@k-Zahlen vorhanden
  • ✗ Stille Fehler - falsche Ergebnisse bleiben unmarkiert
  • ✗ Teure Fehler - Geld, Compliance oder Kundenvertrauen stehen auf dem Spiel
  • ✗ Kein Feedback-Loop - der Agent kann nicht aus Fehlern lernen

Die Entscheidung lautet nie “ist dieser Agent gut?” Sie lautet “ist dieser Agent zuverlässig genug für diese konkrete Aufgabe, gemessen daran, was ein Fehler kostet?” Beantworten Sie das mit Zahlen, und Sie werden drei Wochen nach dem Go-live nicht überrascht.

Häufig gestellte Fragen

Zuverlässigkeit ist die Wahrscheinlichkeit, dass ein Agent dieselbe Aufgabe jedes Mal korrekt erledigt, wenn sie gestellt wird - nicht nur einmal in einer Demo. Ein einziger erfolgreicher Lauf zeigt, dass die Aufgabe möglich ist. Zuverlässigkeit zeigt, dass sie verlässlich ist. Der praktische Test besteht darin, dieselbe Aufgabe viele Male auszuführen und zu prüfen, wie oft alle Läufe gelingen. Genau das misst die Kennzahl Pass^k.

Ein Leaderboard-Wert berichtet meist das beste oder durchschnittliche Ergebnis über mehrere Versuche und verbirgt damit die Varianz. Im April 2026 erreichten Forscher der UC Berkeley auf acht führenden Agenten-Benchmarks nahezu 100 Prozent, ohne eine einzige Aufgabe zu lösen - sie nutzten Schwächen im Prüfharness aus, statt die Arbeit tatsächlich zu erledigen. Ein hoher Wert kann einen manipulierten Test, einen Glücksfall oder einen geschönten Durchschnitt widerspiegeln. Keines davon sagt das Produktionsverhalten voraus.

Pass@k misst, ob ein Agent mindestens einmal in k Versuchen erfolgreich ist - das belohnt Glück im besten Fall. Pass^k misst, ob er in jedem einzelnen der k Versuche erfolgreich ist - das misst Konsistenz. Ein Agent mit 70 Prozent Erfolgsquote pro Lauf hat ein Pass@3 von rund 97 Prozent, aber ein Pass^3 von nur rund 34 Prozent. Die Produktion braucht Pass^k, weil Kunden jeden Lauf erleben, nicht nur den besten.

Lassen Sie jede repräsentative Aufgabe mindestens 5- bis 10-mal in frischen, unabhängigen Versuchen laufen, bei hohem Risiko noch öfter. Weniger Läufe können einen wirklich stabilen Agenten nicht von einem glücklichen unterscheiden. Ziel ist, die Wahrscheinlichkeit zu schätzen, dass alle Läufe bestehen, und sie dann mit einer Schwelle zu vergleichen, die Sie vor dem Go-live festgelegt haben, etwa 95 Prozent.

Das hängt von den Kosten eines einzelnen Fehlers ab. Ein Entwurfsassistent mit geringem Risiko kann bei 90 Prozent Erfolg pro Lauf mit menschlicher Prüfung akzeptabel sein. Ein Agent, der in Ihr ERP bucht oder Geld überweist, braucht deutlich höhere Konsistenz plus einen Human-in-the-Loop-Checkpoint. Setzen Sie die Schwelle nach den Folgen eines Fehlers, nicht nach dem Demo-Wert.

Testumgebungen nutzen saubere, repräsentative Eingaben. Die Produktion liefert Sonderfälle, unsaubere Daten, wechselnden Kontext und seltene Kombinationen, die das Testset nie abgedeckt hat. Agenten driften zudem, wenn sich Ihre Daten und Tools darunter verändern. METR fand, dass die Aufgabenlänge, die ein Agent bei 80 Prozent Zuverlässigkeit bewältigt, nur etwa ein Fünftel dessen beträgt, was er bei 50 Prozent schafft. Die Lücke zwischen Demo und Verlässlichkeit ist also groß.

Agent Washing bedeutet, einen Chatbot oder ein RPA-Skript als autonomen Agenten umzuetikettieren, ohne die zugrunde liegende Fähigkeit. Gartner schätzt, dass von den Tausenden Anbietern, die agentische KI behaupten, nur rund 130 echt sind. Erkennen Sie es, indem Sie Pass^k-Werte auf Ihren eigenen Aufgaben verlangen, Belege für Tool-Call-Genauigkeit und einen Live-Lauf mit echten Daten statt einer gescripteten Demo.

Ein Company Brain gibt dem Agenten Ihre Prozesse, Daten und Regeln statt generischem Internetwissen. Das verengt den Raum möglicher Antworten, reduziert Halluzinationen und verankert den Agenten an Fakten, die er aus Ihren Systemen belegen kann. Zuverlässigkeit summiert sich dann, weil der Agent an Ihrer Realität gemessen und korrigiert wird, nicht an einem öffentlichen Leaderboard.

Ja, wenn es einen funktionierenden Feedback-Loop gibt. Jede Korrektur, jeder markierte Fehler und jedes freigegebene Ergebnis wird zum Lernsignal, das denselben Fehler beim nächsten Mal reduziert. Zuverlässigkeit ist keine feste Eigenschaft eines Modells. Sie ist das Ergebnis von engem Fokus, verankertem Wissen, menschlicher Prüfung bei den schweren Fällen und täglichem Feedback, das den Agenten an Ihre spezifischen Aufgaben anpasst.

Tool-Zuverlässigkeit (ruft der Agent jedes Mal das richtige System mit den richtigen Parametern auf), Latenz und Kosten pro abgeschlossener Aufgabe samt ihrer Varianz, Richtlinien-Compliance (bleibt er in seinen Berechtigungen und Freigaberegeln) und Fehlerverhalten (eskaliert er sauber oder scheitert er lautlos). Ein Agent, der genau, aber langsam, teuer oder nicht konform ist, ist noch nicht produktionsreif.

Behandeln Sie Zuverlässigkeit als fortlaufende Messung, nicht als Tor am Launch-Tag. Pflegen Sie ein Golden Set echter Aufgaben, lassen Sie es regelmäßig und nach jeder Modell- oder Tool-Änderung erneut laufen, achten Sie auf Drift in Erfolgsquote und Kosten und speisen Sie jede Korrektur aus der Produktion zurück in den Agenten. Monitoring plus Feedback hält einen zuverlässigen Agenten zuverlässig.

Anfangs selten. Das zuverlässige Muster ist Autonomie bei den routinemäßigen, hochsicheren Fällen und ein Human-in-the-Loop-Checkpoint bei den seltenen, risikoreichen. Sobald das Pass^k einer Aufgabenklasse Ihre Schwelle überschreitet und dort bleibt, erweitern Sie den autonomen Bereich. Vertrauen wird Aufgabenklasse für Aufgabenklasse verdient, nicht vorab gewährt.

Verwandte Artikel

Henri Jung, Co-Gründer von Superkind
Henri Jung

Co-Gründer von Superkind, wo er KMU und Unternehmen hilft, maßgeschneiderte KI-Agenten einzuführen, die wirklich zu ihrer Arbeitsweise passen. Henri treibt es an, die Lücke zwischen dem, was KI kann, und dem Wert, den sie in echten Unternehmen schafft, zu schließen. Er hat zu viele vielversprechende Pilotprojekte zwischen Demo und Produktion sterben sehen und glaubt, dass die Antwort darin liegt, Zuverlässigkeit ehrlich zu messen - Konsistenz auf den eigenen Aufgaben, nicht Werte auf dem Leaderboard eines anderen. Er ist überzeugt, dass der Mittelstand alles hat, was er braucht, um bei KI vorne zu sein - er braucht nur den richtigen Ansatz.

Bereit, einen zuverlässigen KI-Mitarbeiter einzusetzen?

Buchen Sie ein 30-minütiges Gespräch mit Henri. Wir wählen einen Routine-Workflow, lassen ihn wiederholt laufen und zeigen Ihnen die Konsistenzzahlen, bevor Sie sich auf irgendetwas festlegen.

Demo buchen →