Ein Voice Stack ist die Liste der Bausteine, aus denen ein sprechender Assistent (Voice-Agent) zusammengesetzt wird. Fünf Kern-Bausteine gehören dazu: Telefonie-Anschluss (nimmt den Anruf entgegen), Speech-to-Text (Sprache-zu-Text, wandelt gesprochene Worte in Text), Sprachmodell (formuliert die Antwort und ruft bei Bedarf Fach-Systeme wie ein Termin-Programm auf), Text-to-Speech (Text-zu-Sprache, spricht die Antwort wieder aus) und Turn-Taking (Gesprächs-Steuerung, entscheidet wer wann spricht). Der Begriff trennt diese Bausteine-Sicht von der fertigen Anwendung.
Was ist ein Voice Stack?
Ein Voice Stack ist die Baustein-Sicht auf einen sprechenden Assistenten (Voice-Agent). Der Begriff bündelt die technischen Schichten, aus denen ein Telefon- oder Web-Gespräch mit einem Sprach-Assistenten in Echtzeit entsteht, und trennt die Auswahl der einzelnen Komponenten von der fertigen Anwendung. Wer eine Stack-Diskussion führt, entscheidet über einzelne Anbieter, Zeitbudgets für die Antwort (Latenz) und die Frage, wo die Bausteine laufen (Cloud oder eigene Server), nicht darüber, was der Assistent inhaltlich sagt.
Die klassische kaskadierte Bauform hat fünf Schichten. Der Telephony- und Media-Layer nimmt den Anruf oder die Web-Session entgegen und liefert einen Audio-Stream; typische Provider sind Twilio für SIP-Telefonie und LiveKit für WebRTC-Rooms. Die Speech-to-Text-Schicht (ASR) transkribiert den Stream in Text; Deepgram, AssemblyAI und Whisper (OpenAI) sind die dominanten Anbieter. Die LLM-Dialog-Engine verarbeitet den Text, prüft per Werkzeug-Aufruf externe Systeme (CRM, Termindatenbank, Wissensbasis) und formuliert die Antwort. Die Text-to-Speech-Schicht (TTS) synthetisiert die Antwort als Audio; ElevenLabs, Cartesia und OpenAI TTS decken den Markt ab. Über allem liegt ein Turn-Taking-Layer mit Voice-Activity-Detection, End-of-Turn-Detection und Barge-In-Handling, der das Gesprächs-Timing steuert. Die Latency-Budget-Steuerung verteilt das Zeitbudget vom Sprech-Ende bis zum Antwort-Start (typisch 500–1200 Millisekunden) auf die Schichten.
Seit 2024/2025 existiert eine zweite Bauform: Speech-to-Speech-Modelle wie OpenAI Realtime API und Google Gemini Live fassen STT, LLM und TTS zu einer End-to-End-Sprach-Modalität zusammen. Der Voice Stack behält dann Telephony/Media-Layer und Turn-Taking als eigene Schichten, ersetzt aber die drei mittleren durch einen einzigen Modell-Aufruf. Beide Bauformen kennen optionale Bausteine: Voice Cloning für individuelle TTS-Stimmen, Emotion- und Style-Steuerung, sowie Guardrail-Schichten für Prompt-Injection und PII-Filterung.
Der Begriff existiert, weil Auswahl-Entscheidungen im Sprach-Bereich provider-übergreifend fallen. Ein Team, das einen Support-Assistenten baut, wählt STT-, LLM- und TTS-Provider unabhängig voneinander aus, misst pro Schicht Latenz und Kosten und tauscht Bausteine ohne Umbau der übrigen Kette. Die Stack-Sicht macht diese Auswahl explizit.
Abgrenzung zu Voice Agents, Frameworks, Speech Recognition und Contact-Center-Stack
Vier verwandte Begriffe werden im Alltag mit Voice Stack vermischt. Sie liegen auf unterschiedlichen Ebenen.
| Begriff | Rolle | Ebene |
|---|---|---|
| Voice Stack | Bausteine (Telephony, STT, LLM, TTS, Turn-Taking) | Komponenten-Sicht |
| Voice Agents | Die betriebene Anwendung, die aus dem Stack entsteht | Anwendungs-Ebene |
| Voice Agent Framework | Bau-Werkzeug, das den Stack orchestriert (Pipecat, LiveKit Agents) | Entwicklungs-SDK |
| Speech Recognition (ASR) | Einzelne Schicht im Stack: Transkription von Audio zu Text | Einzel-Baustein |
| Contact-Center-Stack | Routing, Queue, CRM, Agent-Desktop, Reporting für Callcenter | Betriebs-Plattform |
Ein Voice Agent ist das laufende Produkt, das aus dem Voice Stack zusammengesetzt wird. Der Stack ist die Bausteine-Sicht, der Agent die Anwendungs-Sicht. Eine Diskussion über den Voice Stack fragt „welcher STT-Provider, welches LLM, welche TTS-Engine"; eine Diskussion über den Voice Agent fragt „welche Dialoge führt er, welche Tools braucht er, wie eskaliert er". Beide Sichten adressieren dasselbe System auf unterschiedlichen Ebenen.
Voice Agent Frameworks sind die Orchestrierungs-Werkzeuge über dem Stack. Pipecat, LiveKit Agents und das OpenAI Agents SDK binden die Stack-Bausteine zu einer Echtzeit-Audio-Pipeline zusammen und liefern Turn-Taking, Barge-In-Handling und Provider-Adapter als wiederverwendbare Abstraktionen. Ein Framework nutzt einen Voice Stack, ist aber nicht mit ihm identisch: Der Stack ist die Liste der Komponenten, das Framework die Bau-Ebene, die sie verbindet.
Speech Recognition ist genau eine Schicht im Stack. Der Begriff (auch ASR oder STT genannt) beschreibt nur die Transkription von Audio zu Text. Ein Voice Stack umfasst zusätzlich die LLM-Dialog-Engine, die TTS-Ausgabe, das Turn-Taking und die Telephony-Anbindung. Wer über Speech Recognition spricht, meint einen Baustein; wer über den Voice Stack spricht, meint die gesamte Kette.
Der Contact-Center-Stack liegt eine Ebene höher und ist breiter angelegt. Er umfasst Routing, Queue-Management, CRM-Integration, Agent-Desktop und Reporting einer Contact-Center-Plattform (Genesys, NICE, Amazon Connect). Ein Voice Stack liefert nur die Dialog-Schicht und lässt sich in einen Contact-Center-Stack als weitere Ressource einbinden, wobei die Contact-Center-Ebene darüber bleibt. Beide Stacks überlappen im Telephony-Layer, adressieren sonst unterschiedliche Aufgaben.
Beispiel: Voice Stack für einen Terminvereinbarungs-Assistenten
Ein Voice Stack für einen Termin-Assistenten in einer Fachklinik hat fünf Schichten. Twilio nimmt den Anruf über eine SIP-Anbindung entgegen und routet den Audio-Stream in eine LiveKit-Session. Deepgram transkribiert die Nutzer-Äußerung („Ich brauche einen Termin für nächste Woche, möglichst am Vormittag") in Echtzeit in Text. Ein Sprachmodell (Claude oder GPT) erhält den Text und die deklarierten Tools (check_availability, book_appointment, escalate_to_reception) und entscheidet über den Werkzeug-Aufruf. Die Runtime führt den Call gegen das Praxis-Termin-System aus und schickt das Ergebnis („Dienstag 09:30, Donnerstag 10:15") zurück ins Modell. Cartesia synthetisiert die Antwort als Audio, das über die LiveKit-Session zurück an den Anrufer geht. Ein Turn-Taking-Layer mit Voice-Activity-Detection entscheidet, wann der Nutzer zu Ende gesprochen hat, und stoppt die TTS-Wiedergabe, wenn der Nutzer sie unterbricht.
Die Latency-Budget-Steuerung verteilt das Zeitbudget: STT trägt 150–300 Millisekunden bei, das LLM 200–500 Millisekunden, TTS 150–300 Millisekunden für den First-Byte, der Netzwerk-Overhead 50–100 Millisekunden. Ziel-Latenz vom Sprech-Ende bis zum Start der Antwort: unter 800 Millisekunden. Der Stack lässt sich ohne Umbau tauschen: AssemblyAI statt Deepgram, ElevenLabs statt Cartesia, ein Speech-to-Speech-Modell statt der drei mittleren Schichten. Die Ablauf-Logik im Framework bleibt gleich.
Voice Stack im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
die Anwendung, die aus dem Stack gebaut wird
Voice Agent Frameworks (Glossar)Orchestrierungs-Werkzeuge über dem Stack
Audio Models (Glossar)STT-, TTS- und Speech-to-Speech-Modelle als Bausteine
Foundation Models (Glossar)LLM-Ebene unter der Dialog-Engine
Tool Use (Glossar)Werkzeug-Aufruf durch das Sprachmodell im Stack
Agentic AI (Glossar)übergeordnetes Operating-Modell
AI Agents (Cluster)Agenten-Typen inklusive Voice-Agenten als eigene Klasse
Tool Use (Cluster)Reliability-Patterns und Provider-Vergleich für den Werkzeug-Aufruf