Wofür wir stehen
  • EU-Recht eingebaut
  • Menschliche Arbeitsplätze erhalten
  • Keine Tonaufzeichnung
  • Datenbank in Wien
  • Klartext nur bei Ihnen
  • Entwickelt in Österreich
StartRatgeberTechnik-Leitfaden

Wie funktioniert ein KI-Sprachagent? Die Technik hinter dem Telefonat — verständlich erklärt

11 Minuten Lesezeit20. Mai 2026von Lisa-Team Confidelius
Die Zahlen vorab Ein KI-Sprachagent besteht aus vier Bausteinen — Spracherkennung, Sprachmodell, Sprachausgabe und Telefonie-Anbindung. Diese vier müssen in einer Echtzeit-Kette zusammenspielen, und zwar so schnell, dass zwischen dem Ende Ihres Satzes und dem Beginn der Antwort weniger als 800 Millisekunden vergehen. Alles darüber fühlt sich wie ein Aussetzer an.

Sie überlegen, einen KI-Sprachagenten einzusetzen, und wollen verstehen, was da eigentlich passiert, wenn jemand anruft. Gute Entscheidung — wer die Technik grob versteht, kann Anbieter besser vergleichen, realistische Erwartungen setzen und die richtigen Fragen stellen. Dieser Artikel führt Sie durch die vier Bausteine, die Echtzeit-Kette dahinter und die Stellschrauben, die über gute und schlechte Sprachagenten entscheiden.

Der Gesamtüberblick: vier Bausteine, eine Kette

Wenn ein Anrufer mit einem KI-Sprachagenten spricht, durchläuft jeder einzelne Gesprächsbeitrag eine Kette aus vier Stationen:

  1. Speech-to-Text (STT) wandelt das Gesprochene in Text um
  2. Das Large Language Model (LLM) versteht den Text, entscheidet was zu tun ist, formuliert die Antwort
  3. Text-to-Speech (TTS) wandelt die Antwort zurück in gesprochene Sprache
  4. Die Telefonie-Schicht transportiert das Ganze über die echte Telefonleitung

Diese Kette läuft nicht einmal pro Anruf, sondern bei jedem einzelnen Sprecherwechsel. Wenn ein Anruf zwanzig Mal hin und her geht, durchläuft das System die Kette zwanzig Mal — jedes Mal in unter einer Sekunde. Das ist die eigentliche technische Leistung: nicht die einzelnen Bausteine, sondern ihr Echtzeit-Zusammenspiel.

Baustein 1: Speech-to-Text — Zuhören

Speech-to-Text, oft als STT oder ASR (Automatic Speech Recognition) abgekürzt, ist das Ohr des Systems. Es wandelt die Schallwellen des Anrufers in geschriebenen Text um — Wort für Wort, in Echtzeit, noch während der Anrufer spricht.

Moderne STT-Modelle 2026 — Deepgram, OpenAI Whisper, Cartesia und andere — leisten dabei drei Dinge, die ältere Systeme nicht konnten:

Streaming statt Batch. Das Modell wartet nicht, bis der Anrufer fertig gesprochen hat, sondern transkribiert mit, während gesprochen wird. Das spart entscheidende Millisekunden.

Robustheit bei realen Bedingungen. Dialekt, Hintergrundgeräusch, schlechte Mobilverbindung — moderne Modelle erreichen 2026 unter Realbedingungen Wortfehler-Raten von 3-7 %, auch bei österreichischem oder bayerischem Einschlag.

Endpoint-Erkennung. Das System muss erkennen, wann der Anrufer fertig ist mit Sprechen — sonst fällt es ihm entweder ins Wort oder lässt ihn unangenehm lange warten. Diese Erkennung ist überraschend schwer und ein Hauptunterschied zwischen guten und schlechten Agenten.

Das Ergebnis von Baustein 1 ist ein Text-String — zum Beispiel „ich hätte gern einen Termin nächste Woche dienstag“.

Baustein 2: Das Sprachmodell — Verstehen und Entscheiden

Das Large Language Model ist das Gehirn. Es bekommt den Text aus Baustein 1 und muss vier Dinge tun:

Verstehen. Was will der Anrufer? „Termin nächste Woche Dienstag“ — das ist eine Terminanfrage mit grobem Zeitfenster.

Kontext halten. Das LLM kennt nicht nur den letzten Satz, sondern das ganze bisherige Gespräch plus die System-Anweisungen (Persona, Aufgaben, Wissensbasis). Wenn der Anrufer vorher seinen Namen genannt hat, weiß das Modell das noch.

Entscheiden, ob ein Tool gebraucht wird. Für „Termin Dienstag“ muss das Modell den Kalender abfragen — das ist ein Tool-Aufruf (mehr dazu unten). Für „Wie sind Ihre Öffnungszeiten?“ reicht die Wissensbasis, kein Tool nötig.

Antwort formulieren. Aus all dem formt das Modell den nächsten Satz: „Gerne — am Dienstag hätte ich um 10 Uhr oder um 14 Uhr frei. Was passt Ihnen besser?“

Die führenden Modelle 2026 sind GPT-4o-realtime, Claude 4.7 und Gemini 2.5. Für einfachere Aufgaben werden oft kleinere, schnellere Modelle eingesetzt — das spart Latenz und Kosten. Ein gut gebauter Sprachagent wählt das Modell passend zur Aufgabenkomplexität, statt immer das größte zu nehmen.

Baustein 3: Text-to-Speech — Antworten

Text-to-Speech, TTS, ist die Stimme des Systems. Es wandelt den Antworttext aus Baustein 2 zurück in hörbare, gesprochene Sprache.

Hier hat sich seit 2023 am meisten getan. Moderne TTS-Modelle — ElevenLabs, Cartesia, OpenAI-TTS — produzieren 2026 Stimmen, die in Blindtests von echten Menschen kaum noch zu unterscheiden sind. Sie haben natürliche Betonung, sinnvolle Pausen, sogar ein hörbares Einatmen an den richtigen Stellen.

Drei Qualitätsmerkmale entscheiden:

Natürlichkeit. Keine roboterhafte Monotonie, sondern Betonung, die zum Inhalt passt. Eine Frage klingt wie eine Frage.

Geschwindigkeit. Das TTS muss die erste Silbe sehr schnell ausgeben — idealerweise unter 300 Millisekunden nach Erhalt des Textes. Auch hier gilt: Streaming, also schon sprechen während der Rest noch generiert wird.

Sprach- und Dialekt-Fähigkeit. Für den DACH-Markt wichtig: sauberes Hochdeutsch, idealerweise mit der Option auf österreichische oder schweizerische Färbung, und 30+ weitere Sprachen für internationale Anrufer.

Baustein 4: Die Telefonie-Schicht — die Verbindung

Die ersten drei Bausteine wären nutzlos ohne die Verbindung zur echten Telefonwelt. Die Telefonie-Schicht macht genau das: Sie verbindet die KI mit dem öffentlichen Telefonnetz.

Technisch passiert das über einen von zwei Wegen:

Telefonie-Anbieter wie Twilio oder Vonage. Diese stellen virtuelle Rufnummern und die Anbindung ans Telefonnetz bereit. Der Sprachagent bekommt die Audiodaten des Anrufs als Datenstrom und sendet seine Antwort zurück.

SIP-Trunk an Ihre bestehende Telefonanlage. Wenn Sie schon eine Telefonanlage haben (Asterisk, eine Cloud-PBX, ein klassisches System), kann der Sprachagent per SIP-Protokoll direkt daran angebunden werden. Vorteil: Ihre bestehende Rufnummer bleibt, Anrufer müssen nichts Neues lernen.

Die Telefonie-Schicht regelt auch die Weiterleitung: Welche Anrufe gehen an die KI, welche direkt an Menschen, was passiert beim Weiterleiten. Bei eingehenden Anrufen klingelt es bei der KI; bei ausgehenden Anrufen wählt die KI.

Das Latenz-Budget: warum 800 Millisekunden zählen

Jetzt der wichtigste Teil — und der Grund, warum manche Sprachagenten sich natürlich anfühlen und andere nicht.

Wenn ein Mensch dem anderen am Telefon antwortet, vergeht zwischen dem Ende der einen und dem Beginn der anderen Äußerung typischerweise 200 bis 600 Millisekunden. Das nehmen wir als „normal“ wahr. Wird die Pause länger als etwa 800 Millisekunden, beginnen wir sie als unangenehm zu empfinden — „Ist die Verbindung weg?“, „Hat er mich gehört?“.

Genau dieses Budget muss der Sprachagent einhalten. Und in diese 800 Millisekunden muss die komplette Vier-Baustein-Kette passen:

  • STT muss erkennen, dass der Anrufer fertig ist, und den Text fertigstellen
  • Das LLM muss verstehen, ggf. ein Tool aufrufen, die Antwort formulieren
  • TTS muss die erste Silbe generieren
  • Die Telefonie-Schicht transportiert alles hin und her

Bei guten Systemen 2026 liegt die spürbare Latenz bei 600 bis 900 Millisekunden — also gerade noch im natürlichen Bereich. Erreicht wird das durch konsequentes Streaming an jeder Station (kein Baustein wartet auf den vollständigen Abschluss des vorherigen) und durch passende Modellwahl.

Wenn ein Sprachagent sich „zäh“ oder „roboterhaft“ anfühlt, liegt es fast immer an der Latenz — nicht an der Stimme. Deshalb ist die Latenz das wichtigste Kriterium beim Anbieter-Vergleich. Lassen Sie sich in jeder Demo die echte Antwortzeit zeigen.

Hören Sie den Latenz-Unterschied selbst. Lisa nimmt einen echten Anruf entgegen, Sie beurteilen, ob sich das Gespräch natürlich anfühlt.
Demo buchen

Tools: wie der Agent echte Aufgaben erledigt

Reden allein reicht nicht — ein nützlicher Sprachagent muss handeln. Termin buchen, Kalender prüfen, ins CRM schreiben, eine Datenbank abfragen. Das geschieht über sogenannte Tools (oder Function Calls).

Ein Tool ist eine definierte Aktion, die das LLM auslösen kann. Beispiele:

  • `kalender_pruefen(datum)` — gibt freie Slots zurück
  • `termin_buchen(slot, name, anliegen)` — legt den Termin an
  • `kunde_suchen(telefonnummer)` — findet den Anrufer im CRM
  • `an_mensch_uebergeben(grund)` — eskaliert das Gespräch

Wenn das LLM in Baustein 2 erkennt, dass eine Aktion nötig ist, ruft es das passende Tool auf, wartet auf das Ergebnis und baut es in die Antwort ein. Für den Anrufer ist das unsichtbar — er hört nur „einen Moment, ich prüfe das“ und kurz darauf das Ergebnis.

Die Tools sind der Unterschied zwischen einem Sprachagenten, der nur Auskunft gibt, und einem, der Aufgaben tatsächlich erledigt. Beim Anbieter-Vergleich lohnt die Frage: Welche Systeme lassen sich anbinden, wie aufwendig ist eine eigene Integration?

Was einen guten von einem schlechten Agenten unterscheidet

Die vier Bausteine hat jeder Anbieter. Der Unterschied liegt im Detail:

Endpoint-Erkennung. Ein guter Agent fällt dem Anrufer nicht ins Wort und lässt ihn nicht hängen. Er erkennt zuverlässig, wann der Anrufer fertig ist — auch bei Denkpausen.

Unterbrechbarkeit (Barge-in). Wenn der Anrufer den Agenten unterbricht, muss der Agent sofort aufhören zu sprechen und zuhören. Schlechte Agenten reden stur weiter.

Latenz unter Last. Manche Systeme sind in der Demo schnell, werden aber langsam, wenn viele Anrufe gleichzeitig laufen. Nach dem Verhalten bei Spitzenlast fragen.

Gesprächs-Robustheit. Was passiert, wenn der Anrufer etwas Unerwartetes sagt? Ein guter Agent fragt freundlich nach, ein schlechter bricht ab oder gerät in Schleifen.

Saubere Eskalation. Wenn der Agent an einen Menschen übergibt, muss die Gesprächs-Zusammenfassung mitwandern. Mehr dazu in unserem Eskalations-Spezial-Post.

Wer diese fünf Punkte in der Demo prüft, erkennt Qualität schnell — unabhängig davon, wie gut die Marketing-Folien aussehen.

Häufige Fragen

Braucht ein KI-Sprachagent eine Internetverbindung?
Ja. Die Bausteine STT, LLM und TTS laufen in der Regel als Cloud-Dienste, der Sprachagent braucht also eine stabile Internetverbindung. Die Telefonie selbst läuft über das Telefonnetz, aber die KI-Verarbeitung über das Internet. Bei kritischen Anwendungen sollte ein Failover für den Fall eines Internet-Ausfalls eingeplant sein.
Welches LLM ist das beste für einen Sprachagenten?
Es gibt nicht „das beste“ — es kommt auf die Aufgabe an. Für komplexe, freie Gespräche sind die großen Modelle (GPT-4o-realtime, Claude 4.7, Gemini 2.5) stark. Für einfache, eng definierte Aufgaben reichen kleinere Modelle, die schneller und günstiger sind. Ein gut gebauter Agent wählt passend.
Wie natürlich klingt eine KI-Stimme 2026 wirklich?
Sehr natürlich. In Blindtests sind moderne TTS-Stimmen von echten Menschen kaum zu unterscheiden. Was den Unterschied verrät, ist eher die Latenz und der Gesprächsfluss als die Stimme selbst. Trotzdem schreibt der EU AI Act ab August 2026 vor, dass der Anrufer über die KI-Natur informiert wird — die Stimme darf nicht täuschen.
Kann der Agent mehrere Sprachen?
Ja. Moderne STT- und TTS-Modelle decken 30+ Sprachen ab, und das LLM ist ohnehin mehrsprachig. Der Agent kann die Sprache des Anrufers oft automatisch erkennen und umschalten — ein großer Vorteil gegenüber klassischen Telefonsystemen.
Wie schnell ist „schnell genug“?
Die spürbare Antwortlatenz sollte unter 800 Millisekunden liegen, idealerweise im Bereich 600-900 ms inklusive Netzwerk. Darüber wird die Pause spürbar unangenehm. Die Latenz ist das wichtigste technische Kriterium — lassen Sie sie sich in jeder Demo zeigen.
Läuft die ganze Technik bei mir vor Ort?
In der Regel nicht — STT, LLM und TTS laufen als Cloud-Dienste. Wichtig für die DSGVO: Achten Sie auf EU-Serverstandort der Dienste und einen Auftragsverarbeitungsvertrag mit allen Anbietern. Reine On-Premise-Sprachagenten gibt es, sind aber 2026 noch Nische und deutlich aufwendiger.

Erleben Sie die Technik in Aktion

Buchen Sie eine 20-minütige Live-Demo. Lisa nimmt einen Anruf entgegen — Sie beurteilen Latenz, Stimme und Gesprächsfluss mit dem Wissen aus diesem Artikel.

Quellen für die Angaben in diesem Artikel: STT/TTS-Anbieter-Benchmarks 2025-2026 (Deepgram, ElevenLabs, Cartesia), LLM-Realtime-Latenz-Messungen, Sprachagent-Architektur-Dokumentationen. Vollständige Quellenliste finden Sie in unserer KI-Sprachagent-Wissensdatenbank.