Die 9 Kennzahlen, an denen Sie einen KI-Sprachagenten wirklich messen sollten
Sie haben einen KI-Sprachagenten eingeführt — und jetzt? Die Frage „läuft das gut?“ lässt sich nicht mit Bauchgefühl beantworten. Sie braucht Zahlen. Dieser Artikel zeigt, welche neun Kennzahlen aussagekräftig sind, wie sie zusammenhängen und welche scheinbar wichtigen Zahlen Sie getrost ignorieren können.
Warum die richtige Messung über Erfolg entscheidet
Ein KI-Sprachagent wird in den ersten Wochen schrittweise besser — aber nur, wenn man sieht, wo er hakt. Ohne Messung bleibt die Optimierung Raterei. Drei typische Fehler ohne saubere Kennzahlen:
Der Agent wird als „läuft“ abgehakt, obwohl er bei einem Drittel der Anrufe falsch eskaliert — niemand merkt es, weil niemand hinschaut.
Es wird am Falschen optimiert. Der Betreiber schraubt an der Stimme, während das eigentliche Problem die Latenz ist.
Der Wert lässt sich nicht belegen. Der Agent bringt etwas, aber ohne Zahlen kann niemand sagen wie viel — und beim nächsten Budget-Gespräch fehlt das Argument.
Gute Kennzahlen lösen alle drei Probleme. Sie machen sichtbar, was funktioniert, zeigen wo nachzujustieren ist und belegen den Wert in Euro. Wichtig: Es geht nicht um möglichst viele Zahlen, sondern um die richtigen neun.
Leistungs-Kennzahlen: arbeitet der Agent?
Die ersten drei Kennzahlen zeigen, ob der Agent seine Grundaufgabe erfüllt.
Kennzahl 1 — Abfangquote (auch: Containment-Rate). Der Anteil der Anrufe, die der Agent vollständig selbst erledigt, ohne dass ein Mensch eingreift. Das ist die wichtigste Leistungs-Kennzahl. Sie sollte sich über die ersten 2–3 Monate stabilisieren. Typische Werte: 60–80 % bei standardisierten Anrufen, 25–45 % bei beratungsintensiven. Eine fallende Abfangquote ist ein Alarmsignal — irgendetwas an Konfiguration oder Anruf-Mix hat sich verändert.
Kennzahl 2 — Aufgabenerledigung. Der Anteil der Anrufe, bei denen das Ziel des Anrufers tatsächlich erreicht wurde — Termin gebucht, Frage beantwortet, Anliegen erledigt. Wichtiger Unterschied zur Abfangquote: Ein Anruf kann „abgefangen“ sein (kein Mensch eingegriffen), aber trotzdem ohne Ergebnis enden, weil der Anrufer entnervt aufgelegt hat. Die Aufgabenerledigung misst echten Erfolg, nicht nur Nicht-Eskalation.
Kennzahl 3 — Erreichbarkeit / Annahmequote. Der Anteil der eingehenden Anrufe, die überhaupt angenommen wurden. Bei einem gut laufenden KI-Agenten sollte dieser Wert nahe 100 % liegen — das ist ja einer der Hauptvorteile. Fällt er ab, gibt es ein technisches Problem (Kapazitätsgrenze, Verbindungsfehler), das sofort Aufmerksamkeit braucht.
Qualitäts-Kennzahlen: arbeitet er gut?
Leistung allein reicht nicht — ein Agent kann viele Anrufe „erledigen“ und trotzdem Anrufer verärgern. Die nächsten drei Kennzahlen messen die Qualität.
Kennzahl 4 — Anrufer-Zufriedenheit (CSAT). Wie zufrieden sind die Anrufer mit dem Gespräch? Erhoben über eine kurze Abfrage am Gesprächsende („Wie zufrieden waren Sie, von 1 bis 5?“) oder über eine Nachbefragung. Die Zufriedenheit ist die wichtigste Qualitäts-Kennzahl. Eine hohe Abfangquote bei sinkender Zufriedenheit bedeutet: Der Agent behält Anrufe, die er besser abgeben sollte.
Kennzahl 5 — Eskalations-Qualität. Nicht nur wie oft eskaliert wird, sondern wie gut. Per Stichprobe geprüft: Wurde an die richtige Person übergeben? Kam der Kontext vollständig an? Musste der Anrufer trotzdem wiederholen? Schlechte Eskalations-Qualität ist ein häufiger versteckter Zufriedenheits-Killer.
Kennzahl 6 — Durchschnittliche Gesprächsdauer. Bei einem KI-Agenten ist die ideale Dauer ein Mittelwert — nicht zu lang (der Agent schweift ab oder versteht schlecht), nicht zu kurz (der Agent würgt Gespräche ab). Auffällig kurze Anrufe können auf frustrierte Abbrüche hindeuten, auffällig lange auf Verständnisprobleme. Die Gesprächsdauer ist immer im Kontext der anderen Kennzahlen zu lesen.
Wirtschaftlichkeits-Kennzahlen: lohnt es sich?
Die letzten drei Kennzahlen übersetzen die Leistung in Geld — die Sprache, in der über den Agenten entschieden wird.
Kennzahl 7 — Kosten pro Anruf. Die Vollkosten des KI-Anrufs (Plattform-Lizenz + Minutenpreis + anteilige Optimierung) geteilt durch die Anzahl der Anrufe. Diese Zahl gehört direkt neben die Vollkosten eines menschlich bearbeiteten Anrufs gestellt. Der Vergleich ist das stärkste Wirtschaftlichkeits-Argument.
Kennzahl 8 — Eingesparte Mitarbeiterzeit. Wie viele Mitarbeiterstunden hat der Agent freigespielt? Errechnet aus den selbst erledigten Anrufen mal der durchschnittlichen menschlichen Bearbeitungszeit. Diese Stunden sind nicht „weg“ — sie wandern in höherwertige Arbeit. Die Kennzahl zeigt, wie viel Kapazität der Agent schafft.
Kennzahl 9 — Zusätzlich erfasste Anfragen / Umsatzbeitrag. Der oft vergessene Posten: Anrufe, die ohne den Agenten gar nicht bearbeitet worden wären — verpasste Anrufe außerhalb der Bürozeiten, Anrufer, die sonst aufgelegt hätten. Diese zusätzlich erfassten Anfragen sind echter Neugeschäfts-Beitrag. Bei Branchen mit hohem Auftragswert ist das oft der größte Wertbeitrag überhaupt — und der, den die reine Kostenrechnung übersieht.
Wie die Kennzahlen zusammenhängen
Die neun Kennzahlen sind kein Wunschzettel zum Abhaken — sie hängen zusammen, und genau die Zusammenhänge sind aufschlussreich:
Hohe Abfangquote + niedrige Zufriedenheit = Warnsignal. Der Agent behält zu viele Anrufe. Lösung: Eskalations-Schwelle senken.
Hohe Abfangquote + hohe Zufriedenheit + sinkende Kosten pro Anruf = der Idealfall. Hier funktioniert alles zusammen.
Hohe Aufgabenerledigung, aber hohe Gesprächsdauer = der Agent löst die Aufgaben, braucht aber zu lang. Lösung: Gesprächsführung straffen, Antwortlänge begrenzen.
Niedrige Eskalations-Qualität bei guter Zufriedenheit = trügerisch. Die Zufriedenheitsabfrage erreicht vielleicht nur die zufriedenen Anrufer. Eskalations-Qualität per Stichprobe ehrlich prüfen.
Die Kunst der Kennzahlen-Auswertung liegt nicht im Ablesen einzelner Zahlen, sondern im Lesen der Muster. Eine einzelne Kennzahl für sich genommen kann täuschen — neun zusammen ergeben ein ehrliches Bild.
Kennzahlen, die Sie ignorieren können
Genauso wichtig wie die richtigen Kennzahlen ist, sich nicht von Schein-Kennzahlen ablenken zu lassen:
Reine Anrufzahl ohne Kontext. „Der Agent hat 5.000 Anrufe bearbeitet“ klingt gut, sagt aber nichts über Erfolg. 5.000 Anrufe mit niedriger Aufgabenerledigung sind schlechter als 3.000 mit hoher.
„Wörter pro Minute“ oder ähnliche Mikro-Metriken. Technisch messbar, aber praktisch bedeutungslos für die Geschäftsfrage „funktioniert der Agent?“.
Vergleich mit Richtwert-Angaben anderer Anbieter. Die „95 % Zufriedenheit“-Zahl aus einer fremden Verkaufsfolie ist kein sinnvoller Maßstab — die Anruf-Mixe sind nicht vergleichbar. Messen Sie gegen Ihre eigene Ausgangslage, nicht gegen fremde Hochglanz-Zahlen.
Einzelne spektakuläre Negativ-Anrufe. Ein einzelner schlecht gelaufener Anruf ist keine Kennzahl. Er ist ein Datenpunkt für die qualitative Auswertung — aber die Entscheidung über den Agenten fällt anhand der Muster über hunderte Anrufe, nicht anhand des einen, der schiefging.
Ein einfaches Kennzahlen-Dashboard
Man braucht kein aufwendiges Analyse-System. Ein wöchentlicher Blick auf neun Zahlen reicht. Eine sinnvolle Struktur:
Wöchentlich anschauen: Abfangquote, Aufgabenerledigung, Zufriedenheit, Eskalations-Rate. Diese vier zeigen schnell, ob etwas aus dem Ruder läuft.
Monatlich anschauen: Kosten pro Anruf, eingesparte Mitarbeiterzeit, zusätzlich erfasste Anfragen, Gesprächsdauer, Erreichbarkeit. Diese fünf bewegen sich langsamer und brauchen den Monats-Blick.
Pro Quartal: Den Gesamttrend bewerten. Stabilisiert sich der Agent? Wird der Wertbeitrag größer? Wo lohnt sich Investition in weitere Optimierung?
Die meisten KI-Plattformen 2026 liefern diese Zahlen in einem eingebauten Dashboard. Wo eine Zahl fehlt — typischerweise „zusätzlich erfasste Anfragen“ und „eingesparte Mitarbeiterzeit“ — lässt sie sich aus den vorhandenen Daten leicht selbst errechnen. Wichtig ist die feste Routine: ein fester Termin pro Woche, an dem jemand die vier wöchentlichen Kennzahlen anschaut. Ohne Routine verkümmert jedes Dashboard.
Compliance beim Messen
Beim Messen entsteht ein DSGVO-relevanter Punkt: Welche Daten werden zur Auswertung gespeichert?
Zusammengefasste Kennzahlen sind unkritisch. Abfangquote, Zufriedenheits-Durchschnitt, Kosten pro Anruf — das sind statistische Aggregate ohne Personenbezug. Hier gibt es kein Problem.
Einzelgespräch-Auswertung braucht Sorgfalt. Wer einzelne Anrufe qualitativ prüft (Eskalations-Qualität, Negativ-Anrufe), arbeitet mit personenbezogenen Daten. Wichtig: Die Auswertung erfolgt auf Basis der strukturierten Text-Transkripte, die der Agent ohnehin erzeugt — nicht auf Basis von Audio-Mitschnitten. Letztere würden in Österreich die § 120 StGB-Problematik auslösen. Die übliche Konfiguration (kein Audio-Mitschnitt, nur strukturierte Textdaten) macht die Kennzahlen-Auswertung sauber möglich.
Mehr Tiefe im DSGVO-Spezial-Beitrag.
Häufige Fragen
Was ist der Unterschied zwischen Abfangquote und Aufgabenerledigung?
Wie erhebe ich die Anrufer-Zufriedenheit bei Telefonanrufen?
Ab wann sind die Kennzahlen aussagekräftig?
Welche Kennzahl ist die wichtigste?
Brauche ich ein teures Analyse-Tool?
Wie vergleiche ich die Kennzahlen ehrlich mit der Zeit vor dem Agenten?
Sehen Sie ein echtes Kennzahlen-Dashboard
Buchen Sie eine 20-minütige Live-Demo. Wir zeigen Ihnen ein Beispiel-Dashboard und realistische Richtwert-Bereiche für Ihre Branche.
Quellen: Branchenübliche Kennzahlen-Standards für Sprach-KI-Systeme 2025–2026, Kontaktzentrum-Kennzahlen-Rahmenwerke, Praxis-Erfahrungswerte. Vollständige Quellenliste in unserer Wissensdatenbank.