Zum Inhalt springen

Conversational AI

Conversational AI bezeichnet Systeme für natürlichsprachige Dialoge in Text und Sprache. Definition, Bausteine, Abgrenzung zu Chatbots, Agents und LLMs.

Conversational AI (dialogfähige Künstliche Intelligenz) bezeichnet Software-Systeme, die in geschriebener oder gesprochener Sprache mit Menschen kommunizieren und sich dabei über mehrere Fragen und Antworten hinweg an das Gespräch erinnern. Der Begriff umfasst die vier Bausteine Sprachverstehen, Gesprächsführung, Antwortformulierung und Kanal-Anbindung rund um ein Sprachmodell (das Modell, das die Antworten produziert).

Was ist Conversational AI?

Conversational AI ist eine Klasse von Software-Anwendungen. Sie beschreibt Systeme, die eine Nutzereingabe verstehen, den Gesprächsverlauf mitschreiben und darauf eine passende Antwort formulieren. Die zentrale Eigenschaft liegt im Dialog-Charakter: das System reagiert nicht nur auf die letzte Eingabe, sondern behält frühere Aussagen im Gespräch (Turns, also einzelne Frage-Antwort-Wechsel) im Blick und kann darauf zurückgreifen.

Vier funktionale Bausteine tragen den Begriff. Erstens die Sprachverarbeitung (Natural Language Understanding), die aus einer Äußerung Absicht, Entitäten und Sentiment ableitet. Zweitens das Dialogmanagement, das den aktuellen Zustand hält, offene Slots verfolgt und den nächsten Schritt bestimmt. Drittens die Antwortgenerierung (Natural Language Generation), die aus Zustand und Wissen eine sprachliche Antwort formuliert. Viertens eine Kanal- und Integrations-Schicht, die den Dialog an Text-Frontends (Chat, Messaging), Sprach-Frontends (Speech-to-Text, Text-to-Speech, Telefonie über SIP und WebRTC) und Backend-Systeme (CRM, Ticket-System, Wissensbasis) anbindet.

Der Begriff hat drei technologische Wellen. Die erste Welle war regelbasiert und begann mit [ELIZA (Weizenbaum, 1966)](https://dl.acm.org/doi/10.1145/365153.365168): Entscheidungsbäume, Pattern-Matching, feste Intent-Listen. Die zweite Welle setzte auf statistische NLP mit Intent-Classifiern und Slot-Filling; Plattformen wie Dialogflow, Rasa, Amazon Lex und IBM Watson Assistant prägen diese Generation bis heute im Unternehmens-Einsatz. Die dritte Welle nutzt seit 2022/2023 große Sprachmodelle als Reasoning-Kern, oft ergänzt um [Retrieval-Augmented Generation](https://arxiv.org/abs/2005.11401) für unternehmensspezifisches Wissen und Function Calling für Aktionen in Fachsystemen.

Der Einsatzraum teilt sich in zwei Kanal-Familien. Textbasierte Systeme laufen auf Web-Chat, Messaging (WhatsApp, Teams, Slack) oder in E-Mail-Bearbeitungssystemen. Sprachbasierte Systeme erweitern den Text-Kern um Speech-to-Text am Eingang und Text-to-Speech am Ausgang; sie sitzen in Contact-Centern, IVR-Systemen und Sprachassistenten. Der Voice-Stack (STT, LLM, TTS, WebRTC/SIP) ist die Signatur-Architektur der 2025er-Voice-Agent-Welle.

Abgrenzung zu Chatbots, AI Agents, LLMs und Voice Assistants

Der Begriff wird im Markt oft synonym mit angrenzenden Konzepten verwendet. Die relevanten Trennlinien:

BegriffRolleVerhältnis zu Conversational AI
Regelbasierter ChatbotEntscheidungsbaum mit festen Intents und AntwortenHistorische Vorstufe; enger Sonderfall ohne Sprachmodell
AI AgentHandlungseinheit mit Werkzeug-Loop und Kontrollfluss durch das ModellHandlungsschicht; Conversational AI ist die Dialogschicht
Large Language ModelStatistisches Sprachmodell (Reasoning-Kern)Baustein; Conversational AI ist die Anwendung darum herum
Voice AssistantSprach-Modality über einen Dialog-KernTeilmenge mit Voice-Frontend

Regelbasierte Chatbots und Conversational AI werden im Marketing oft gleichgesetzt. Die Trennlinie liegt in der Generalisierung: ein regelbasierter Chatbot antwortet auf vorab definierte Intents nach festen Regeln, ein Conversational-AI-System interpretiert Formulierungen, die nie im Trainings- oder Regel-Set standen. Die Übergänge sind fließend, weil moderne Plattformen beides mischen.

AI Agents und Conversational AI überlappen sich in vielen produktiven Anwendungen. Die Trennlinie liegt in der Perspektive: Conversational AI beschreibt die Interaktion (Dialog, Turn-Taking, Kanäle), AI Agents beschreiben die Handlung (Werkzeug-Aufrufe, Kontrollfluss zur Laufzeit). Ein Conversational-AI-System ohne Werkzeug-Anbindung bleibt ein reaktiver Assistent. Ein Agent ohne Dialog-Frontend läuft als Hintergrund-Prozess. Produktive Systeme kombinieren beide Rollen.

Ein LLM ist eine Komponente auf der Modell-Ebene. Wer das Sprachmodell mit dem Produkt gleichsetzt, unterschätzt den Aufwand für Dialog-State, Sicherheits-Guardrails, Kanal-Integration und Fachsystem-Anbindung. Voice Assistants sind eine Teilmenge von Conversational AI mit Sprach-Ein- und Sprach-Ausgabe.

Beispiel: Customer-Service-Assistent im Contact-Center

Ein Contact-Center-Assistent zeigt die Bausteine im schmalen Zuschnitt. Eingehende Anrufe landen bei einem Voice-Agent, der die Absicht klärt und einfache Anliegen selbst löst.

Ablauf: Der Anruf trifft über SIP im Voice-Gateway ein. Speech-to-Text erzeugt den Text des Gesprächsbeginns. Das Sprachmodell klassifiziert die Absicht (Terminverschiebung, Rechnungsfrage, Statusabfrage), stellt Rückfragen zur Identifikation und ruft die passenden Backend-Werkzeuge auf: CRM-Lookup für die Kundennummer, Termin-API für die Verschiebung, Wissensbasis-Retrieval für die Rechnungsfrage. Der Dialogzustand hält die geklärten Slots (Kunde, Anliegen, offene Rückfragen). Die Antwort formt das Modell in gesprochener Sprache, Text-to-Speech gibt sie über die Telefonleitung aus. Bei komplexen Anliegen übergibt das System an einen Menschen und übergibt den bereits geklärten Kontext.

Die vier Bausteine sind konkret: ein Sprachmodell als Reasoning-Kern, eine Tool-Registry mit vier bis sechs Funktionen (Kundendaten, Terminverwaltung, Wissensbasis, Übergabe-Route), ein Dialogzustand mit den offenen Slots, eine Kanal-Schicht aus STT, TTS und SIP. Der Nutzen entsteht aus der Kombination: das Sprachmodell allein könnte die Frage nicht beantworten, ohne Kundendaten und Wissensbasis; die Wissensbasis allein hätte keine natürliche Sprach-Oberfläche. Governance-Themen wie Guardrails gegen Halluzination, Aufzeichnung nach DSGVO und Eskalations-Regeln sind produktiv nicht optional.

Conversational AI im eigenen Unternehmen umsetzen?

Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.

Gespräch vereinbaren