Zum Inhalt springen

Audio Models

Audio Models sind trainierte Modelle für Sprach- und Audio-Signale: ASR, TTS, Klang-Erkennung, Musik. Definition, Familien-Landkarte und Abgrenzung.

Audio Models sind trainierte KI-Modelle, die mit Ton arbeiten: Sie verwandeln gesprochene Sprache in Text (Transkript), erzeugen aus Text wieder Sprache (synthetische Stimme), erkennen Sprecher oder Geräusche und komponieren Musik. Die Kategorie reicht von klassischen Sprach-Erkennern bis zu großen, auf riesigen Ton-Datenmengen vortrainierten Basis-Modellen (Foundation Models).

Was ist ein Audio Model?

Ein Audio Model ist ein Programm, das aus Beispielen gelernt hat, mit Ton umzugehen. Als Eingabe bekommt es ein Audio-Signal (also die Aufnahme selbst oder eine bildhafte Darstellung des Klangs, ein sogenanntes Spektrogramm). Als Ausgabe liefert es je nach Aufgabe einen von vier Dingen: einen Text (Transkript), eine Kategorie (welcher Sprecher, welches Geräusch), einen Zahlenvektor (eine kompakte Beschreibung des Klangs, in der KI „Embedding" genannt) oder wieder Ton (eine erzeugte Stimme, ein Musikstück). Wie das Signal intern durch das Modell fließt, gibt die Architektur vor. Die dahinterstehenden Bauweisen (Wave2Vec, Conformer, Diffusion-Transformer) sind unterschiedliche Standard-Konstruktionen dafür.

Drei Grund-Aufgaben prägen die Kategorie. Verstehen umfasst Automatic Speech Recognition (ASR) für die Umwandlung von Sprache in Text, Speaker Recognition und Diarization für die Zuordnung zu Sprechern sowie Audio Event Detection für die Erkennung von Klangereignissen. Erzeugen deckt Text-to-Speech (TTS), Voice Cloning, Music Generation und synthetische Klangeffekte ab. Transformieren beschreibt Voice Conversion, Denoising, Source Separation (Trennung überlagerter Signale) und Sprach-zu-Sprach-Übersetzung ohne Text-Umweg.

Der Übergang von aufgaben-spezifischen Modellen zu Audio-Foundation-Modellen hat die Kategorie neu geordnet. Ältere Systeme wurden pro Sprache und Domäne trainiert (Kaldi-basierte ASR mit Hidden-Markov-Modellen, konkatenative TTS-Vocoder). Aktuelle Foundation Models wie Whisper (OpenAI, 2022) für ASR, AudioLM und MusicLM (Google, 2023) für Audio-Generierung oder SeamlessM4T (Meta, 2023) für multilinguale Sprach-Verarbeitung nutzen selbstüberwachtes Vortraining auf hunderttausenden Stunden Audio-Material. Ein einzelnes Modell deckt viele Sprachen und Aufgaben ab und ersetzt vormals getrennte Pipelines.

Audio Models werden zunehmend als Modalität in Multimodal Foundation Models eingebettet, etwa in Gemini, GPT-4o oder Qwen-Audio. Die technische Grenze zwischen einem reinen Audio Model und einem multimodalen Modell mit Audio-Kanal verschwimmt, die begriffliche bleibt: die Kategorie beschreibt, welche Modalität das Modell primär verarbeitet, unabhängig von weiteren Modalitäten.

Abgrenzung zu Speech Model, LLM, Multimodal Model und DSP

Der Sprachgebrauch vermischt mehrere Ebenen. Die relevanten Trennlinien:

BegriffFokusVerhältnis zu Audio Model
Speech Model / Voice ModelGesprochene Sprache bzw. menschliche Stimme (ASR, TTS, Speaker, Cloning)Teilmenge; Audio Model ist der Oberbegriff und schließt Musik-, Umgebungs- und Klangereignis-Modelle ein
Large Language ModelText-Token als Eingabe und AusgabeAndere Modalität; ein ASR-Modell erzeugt Text, ist aber kein LLM
Multimodal ModelMehrere Modalitäten in einem Modell (Text, Bild, Audio)Ein reines Audio Model arbeitet nur auf Audio; ein multimodales Modell mit Audio-Kanal fällt in beide Kategorien
Signal Processing (DSP)Regelbasierte Filter, Fourier-Transformation, Codec-VerarbeitungOhne gelernte Parameter; DSP dient als Vorverarbeitungs-Schicht (Spektrogramm, Feature-Extraktion)
ASR-Engine / TTS-EngineLauffähiges System mit API, Streaming, Skalierung (AWS Polly, Google Speech-to-Text)Betriebs-Paket um ein Audio Model herum; das Modell selbst ist der trainierte Kern

Speech und Voice Model sind engere Teilmengen. Speech Models arbeiten auf gesprochener Sprache, Voice Models fokussieren die menschliche Stimme mit ihren Klang-Merkmalen. Audio Models ist der Sammelbegriff und deckt zusätzlich Musik-Generierung, Umgebungsgeräusch-Klassifikation und industrielle Klang-Analyse ab.

Ein Large Language Model arbeitet auf Text-Token. Ein Audio Model, das Sprache versteht, erzeugt Text als Ausgabe, ist aber kein LLM. Multimodale Modelle mit Audio-Input wie GPT-4o Realtime enthalten LLM-Komponenten; die Kategorisierung folgt der Eingangs-Modalität und dem primären Trainings-Ziel.

Klassisches Signal Processing bleibt unter der lernbasierten Ebene präsent: eine Kurzzeit-Fourier-Transformation wandelt die Wellenform in ein Spektrogramm, das dann als Eingabe für das gelernte Modell dient. Ein Audio Model nutzt DSP als Vorverarbeitung, ersetzt es aber nicht.

Beispiel: Sprach-Kanal in einem Contact-Center

Ein sprach-fähiger Kunden-Kanal in einem Contact-Center zeigt, wie mehrere Audio Models in einer Anwendung zusammenspielen. Ein ASR-Modell (etwa Whisper-Large-v3 als Foundation-Model-Endpoint) transkribiert das eingehende Gespräch in Echtzeit. Ein Speaker-Diarization-Modell trennt die Sprach-Segmente von Agent und Anrufer. Ein Sprach-Emotions-Klassifikator markiert kritische Passagen für Qualitäts-Stichproben. Ein TTS-Modell (ElevenLabs oder ein Open-Source-Modell wie XTTS) erzeugt die Bot-Antworten für den automatisierten Vor-Filter, bevor komplexere Anliegen an einen Menschen übergeben werden.

Vier verschiedene Audio Models arbeiten in einem zusammenhängenden Kanal, mit unterschiedlichen Trainings-Datenquellen, Metriken und Compliance-Anforderungen. Stimmdaten gelten unter der DSGVO als personenbezogene Daten und unter dem EU-AI-Act in Teilen als biometrische Kategorie. Aufbewahrung, Zweckbindung und Einwilligung gehören zum Betriebs-Modell und beeinflussen die Modell-Auswahl mit. Auf einer Lakehouse-Plattform werden die Modelle als [Model-Serving-Endpoint](/insights/databricks/artificial-intelligence/model-serving/) bereitgestellt oder als Foundation-Model-API konsumiert; die transkribierten Textströme fließen in Delta-Tabellen und werden dort für Analytics und Retrieval weiter verwendet.

Audio Models im eigenen Unternehmen umsetzen?

Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.

Gespräch vereinbaren