Voice Agents sind KI-gesteuerte Sprach-Assistenten, die ein Telefonat oder einen Sprach-Dialog in Echtzeit führen. Typische Einsatzformen sind Telefon-Assistent, App-interner Sprach-Chatbot und Nachfolger klassischer Telefon-Menüs (IVR, Interactive Voice Response). Sie kombinieren drei Bausteine: Spracherkennung (Speech-to-Text, ASR), ein Sprachmodell, das die Antwort formuliert und externe Systeme abfragen kann, und Sprachausgabe (Text-to-Speech, TTS). Ein Steuer-Layer regelt, wer wann spricht (Turn-Taking) und ob der Nutzer den Agent unterbrechen darf (Barge-In).
Was sind Voice Agents?
Ein Voice Agent führt ein Telefonat oder einen Sprach-Dialog selbstständig: Er hört zu, formuliert eine Antwort, spricht sie aus und steuert dabei den Gesprächsfluss. Wer wann spricht, wann unterbrochen wird und wann an einen Menschen übergeben wird, entscheidet die Betriebs-Umgebung (Runtime) des Agents. Der Begriff hat sich seit den ersten Echtzeit-Sprach-APIs der Modell-Anbieter (Realtime API) Ende 2024 von einer einzelnen Modell-Funktion zu einer eigenen Architektur-Kategorie entwickelt.
Die klassische Architektur besteht aus drei Bausteinen: Speech-to-Text (auch ASR genannt, z. B. Deepgram, AssemblyAI, Whisper) transkribiert die Nutzer-Äußerung. Ein Sprachmodell verarbeitet den Text, prüft per Werkzeug-Aufruf (Tool Use) externe Systeme wie CRM, Termindatenbank oder Wissensbasis und formuliert die Antwort. Text-to-Speech (z. B. ElevenLabs, Cartesia, Deepgram Aura) gibt sie als Audio zurück. Über allem liegt ein Turn-Taking-Layer, der Barge-In (Unterbrechen durch den Nutzer), Pausenerkennung und Übergabe an einen menschlichen Agenten regelt.
Seit 2024/2025 existiert eine zweite Bauform: Speech-to-Speech-Modelle wie OpenAI Realtime API und Google Gemini Live fassen ASR, Sprachmodell und TTS zu einer einzigen End-to-End-Sprach-Modalität zusammen. Beide Bauformen brauchen eine Telefonie-Anbindung, meist WebRTC für Web- und App-Kanäle, SIP für klassische Telefonie und Contact-Center-Integration.
Voice Agents existieren als eigene Kategorie, weil Sprach-Dialoge Anforderungen stellen, die Text-Assistenten nicht kennen: Sub-Sekunden-Latenz auf jeder Nutzer-Äußerung, korrektes Turn-Taking, robuste Erkennung bei schlechter Audio-Qualität und eine Eskalationslogik, die im Live-Gespräch trägt. Ein Chatbot, der ein Mikrofon vorgesetzt bekommt, erfüllt diese Anforderungen nicht.
Abgrenzung zu Frameworks, Voice Stack, Chatbots, Contact-Center-Bots und IVR
Fünf verwandte Begriffe werden im Alltag mit Voice Agents vermischt. Sie liegen auf unterschiedlichen Ebenen.
| Begriff | Rolle | Ebene |
|---|---|---|
| Voice Agent | Die betriebene Anwendung, die den Dialog führt | Anwendung |
| Voice Agent Framework | Bau-Werkzeug zur Orchestrierung eines Voice Agents (Pipecat, LiveKit Agents) | Werkzeug |
| Voice Stack | Liste der Komponenten (STT, TTS, LLM, Turn-Taking, WebRTC/SIP) | Bausteine |
| Chatbot | Text-Dialog ohne Echtzeit- und Turn-Taking-Zwang | Modalität |
| Contact-Center-Bot | In Routing, Queue und CRM einer Plattform (Genesys, NICE) integriert | Integration |
| IVR | Regelbasierte Menü-Bäume mit DTMF oder Sprachbefehl-Grammatik | Vorläufer |
Die Werkzeug/Anwendung-Unterscheidung zu Voice Agent Frameworks ist die häufigste Verwechslung. Ein Voice Agent ist der Dialog, der geführt wird; ein Voice Agent Framework ist die Bau-Ebene, auf der ein solcher Agent orchestriert wird. Pipecat, LiveKit Agents und das OpenAI Agents SDK sind Frameworks; der Support-Assistent, der über Pipecat gebaut wurde und im Betrieb Anrufe entgegennimmt, ist der Voice Agent.
Ein Voice Stack ist die Bausteine-Sicht: Welche STT-Engine, welches Sprachmodell, welche TTS-Engine, welche Telefonie-Anbindung. Ein Voice Agent ist das Ergebnis, das aus diesen Bausteinen zusammengesetzt wird. Eine Diskussion über den Voice Stack ist eine Komponenten-Diskussion, eine Diskussion über den Voice Agent ist eine Anwendungs- und Betriebs-Diskussion.
Chatbots teilen mit Voice Agents die Dialog-Logik und den Werkzeug-Aufruf, laufen aber im Text-Kanal ohne Echtzeit-Druck. Contact-Center-Bots sind Voice Agents oder Chatbots, die tief in die Routing-, Queue- und CRM-Logik einer Contact-Center-Plattform eingebettet sind. IVR-Systeme (Interactive Voice Response) sind der regelbasierte Vorläufer: Menü-Baum, DTMF-Eingabe oder starre Sprachbefehl-Grammatik. Voice Agents lösen IVR ab, weil sie offenen Dialog mit LLM-Reasoning und dynamischem Werkzeug-Aufruf führen.
Beispiel: Voice Agent für Terminvereinbarung in einer Facharzt-Praxis
Ein Anruf trifft über eine SIP-Anbindung auf die Voice-Runtime. Die STT-Engine (Deepgram) transkribiert die Nutzer-Äußerung („Ich brauche einen Termin für nächste Woche, möglichst am Vormittag") in Text. Das Sprachmodell erhält den Text zusammen mit den registrierten Werkzeugen: check_availability, book_appointment, escalate_to_reception. Es entscheidet, check_availability mit den Argumenten date_range: "nächste Woche" und time_preference: "morning" aufzurufen. Die Runtime führt den Aufruf gegen das Praxis-Termin-System aus und schickt das Ergebnis („Dienstag 09:30, Donnerstag 10:15") zurück ins Modell. Das Modell formuliert die Antwort, die TTS-Engine (Cartesia) gibt sie als Audio zurück, und der Turn-Taking-Layer wartet auf die Nutzer-Reaktion.
Der Nutzer wählt Dienstag. Das Modell ruft book_appointment auf, erhält eine Bestätigung und formuliert die Abschlussantwort. Bei einer Unsicherheit (unklarer Name, Sonderfall wie Notfall) wechselt der Agent per escalate_to_reception auf einen menschlichen Kollegen, übergibt Zusammenfassung und Nutzer-Kontext und legt auf. Typische Einsatzfelder folgen demselben Muster: IVR-Ersatz im Kunden-Support mit autonomer Klärung von Standard-Anliegen (Rechnung, Vertragsstatus), Vertriebs-Terminierung als SDR-Automation, Healthcare-Triage, In-Store-Kiosks und interne Assistenten am Arbeitsplatz.
Voice Agents im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
Architektur-Entscheidung Stack, Framework oder SaaS-Plattform
Voice StackBausteine STT, TTS, LLM, Turn-Taking, WebRTC/SIP
Voice Use-CasesCustomer Support, IVR-Ablösung, Sales, Telehealth
Voice Agent Frameworks (Glossar)Bau-Werkzeuge Pipecat, LiveKit Agents, OpenAI Agents SDK
AI Agents (Glossar)übergeordnete Agenten-Familie ohne Sprach-Modalität
Tool Use (Glossar)Werkzeug-Aufruf durch das Sprachmodell
Audio Models (Glossar)Modell-Ebene für Sprache und Audio
Agentic AI (Glossar)Operating-Modell über allen Agenten-Typen