Compound AI Systems (zusammengesetzte KI-Systeme) sind KI-Anwendungen, die eine Aufgabe nicht mit einem einzelnen KI-Modell lösen, sondern mehrere Bausteine zusammenspielen lassen. Typische Bausteine sind ein Sprachmodell (ein KI-Modell wie ChatGPT, das Texte versteht und schreibt), eine Suche in eigenen Dokumenten (Retrieval), externe Werkzeuge (etwa API-Aufrufe an eine Datenbank) und feste Programm-Schritte, die den Ablauf steuern. Den Begriff hat 2024 das [Berkeley AI Research Lab](https://bair.berkeley.edu/blog/2024/02/18/compound-ai-systems/) (BAIR, KI-Forschungsgruppe der University of California, Berkeley) geprägt, um zu beschreiben, wie produktive KI-Anwendungen heute tatsächlich gebaut werden, statt sich auf ein einziges immer größeres Modell zu verlassen.
Was ist ein Compound AI System?
Ein Compound AI System ist eine Anwendung, deren Antwort aus dem Zusammenspiel mehrerer Bausteine entsteht, nicht aus einem einzelnen Aufruf an ein KI-Modell. Laut BAIR gehören dazu mehrere Aufrufe desselben oder verschiedener Sprachmodelle, eine Retrieval-Komponente (Suche über eigene Dokumente oder Datenbanken), Werkzeug-Aufrufe (Zugriffe auf externe Systeme wie APIs, Datenbanken oder Code-Ausführung), klassische Machine-Learning-Modelle (statistische Modelle wie Klassifikatoren oder Regressionen) sowie fest programmierte Schritte, die den Ablauf steuern. Eine Orchestrierung koordiniert diese Bausteine, hält Zwischenergebnisse fest und fängt Fehler ab.
Der Begriff geht auf den Blogpost „The Shift from Models to Compound AI Systems" von Zaharia, Khattab, Potts et al. (Februar 2024, Berkeley AI Research Lab) zurück. Die zentrale Beobachtung: Führende KI-Ergebnisse kommen zunehmend aus zusammengesetzten Systemen wie AlphaCode 2, AlphaGeometry oder produktiven Retrieval-Assistenten, nicht aus dem bloßen Aufskalieren eines einzelnen Modells. Databricks, IBM und Stanford haben den Frame anschließend übernommen; die deutsche Übersetzung „zusammengesetzte KI-Systeme" ist über die [deutsche Databricks-Dokumentation](https://www.databricks.com/de/blog/what-are-compound-ai-systems) verbreitet, der englische Begriff bleibt im Fachdiskurs Standard.
Der Begriff existiert, um die Systemsicht von der Modellsicht zu trennen. „Ein besseres Sprachmodell" ist eine Modell-Frage. „Ein besseres RAG-System" oder „ein besserer Coding-Agent" ist eine System-Frage mit eigenen Design-, Evaluations- und Betriebs-Anforderungen: Wie werden Bausteine ausgewählt und verkettet? Wie wird die Ende-zu-Ende-Qualität gemessen? Wo entstehen Kosten und Latenz? Wo liegen Fehlermodi? Compound AI Systems sind laut BAIR modular, programmatisch steuerbar und in vielen Fällen günstiger und robuster als ein gleichwertiges monolithisches Modell.
Abgrenzung zu Agentic AI, RAG und Single-Model-Ansätzen
Der Begriff wird oft mit angrenzenden Konzepten vermischt. Die relevanten Unterschiede:
| Begriff | Rolle | Verhältnis zu Compound AI Systems |
|---|---|---|
| Monolithisches LLM | Einzelner Modell-Aufruf ohne Zusatz-Bausteine | Gegenpol; Compound AI ist die Kompositions-Alternative |
| RAG | Muster aus Retriever + Generator | Häufigster Typ eines Compound AI Systems |
| AI Agents | Einzelbaustein (Agent mit Rolle, Werkzeugen, Prompt) | Bau-Elemente, aus denen Multi-Agent-Compound-Systeme entstehen |
| Agentic AI | Systemklasse mit Handlungs- und Werkzeug-Autonomie | Teilmenge; jedes agentische System ist Compound, umgekehrt nicht |
Der Gegensatz zum monolithischen LLM ist die zentrale Achse des Begriffs. Ein Chatbot mit einem einzigen Modell-Aufruf pro Anfrage ist kein Compound AI System. Sobald ein Retriever davor gesetzt, eine Guardrail dahinter geschaltet oder ein zweiter Modell-Aufruf zur Antwort-Verifikation eingezogen wird, entsteht ein Compound System.
RAG (Retrieval-Augmented Generation) ist der historisch erste und heute häufigste Typ. Die BAIR-Definition subsumiert RAG als Basis-Muster, ordnet aber komplexere Kompositionen wie AlphaCode 2 oder mehrstufige Verifikations-Pipelines derselben Kategorie zu. Compound AI ist der Oberbegriff, RAG der bekannteste Vertreter.
Agentic AI ist enger gefasst und beschreibt die Systemklasse mit Handlungs- und Werkzeug-Autonomie, in der ein oder mehrere Agenten selbst über den nächsten Schritt entscheiden. Jedes Agentic-AI-System ist ein Compound AI System; die Umkehrung gilt nicht, weil ein deterministisch verkettetes RAG-Pipeline ohne Agenten-Entscheidung ebenfalls Compound ist. AI Agents sind die einzelnen Bausteine (ein Agent mit Prompt, Rolle und Werkzeugen). Frameworks und Orchestrierungs-Schichten wie [DSPy](https://dspy.ai/), LangGraph oder LlamaIndex liefern die Programmier-Ebene, auf der aus Bausteinen ein Compound System wird.
Beispiel: interner Wissensassistent
Ein typisches Compound AI System im Enterprise-Kontext ist ein interner Wissensassistent auf Basis eigener Dokumente. Die Bausteine im schmalen Zuschnitt: ein Embedding-Modell zur Vektorisierung der Anfrage, ein Vector-Store-Retriever für die Kandidaten-Dokumente, ein Reranker-Modell zur Sortierung der Treffer, ein Sprachmodell zur Antwort-Generierung, ein Guardrail-Modell zur Prüfung auf PII- oder Compliance-Verstöße und ein deterministischer Formatter für das Ausgabe-Layout. Sechs Bausteine, orchestriert über ein Framework, ergeben zusammen die Antwort auf eine Anfrage.
AlphaCode 2 (DeepMind, 2023) ist das im BAIR-Post erwähnte Referenz-Beispiel aus der Forschung: Sampling von Kandidaten-Programmen aus einem Sprachmodell, deterministisches Filtern gegen Testfälle, Clustering ähnlicher Lösungen, Ranking über ein zweites Modell. Die Systemqualität entsteht durch das Zusammenspiel der Bausteine; ein einzelner Modell-Aufruf liefert dieses Ergebnis so nicht.
Für den produktiven Betrieb hat die Compound-Sicht Konsequenzen: Evaluation, Tracing, Kosten und Latenz werden pro Baustein und Ende-zu-Ende gemessen. Die Optimierung greift am System an (Reranker austauschen, Retriever-Chunks anpassen, kleineres Modell für die Extraktion einsetzen) und geht damit über das zentrale Sprachmodell hinaus. Aus diesem Grund setzen Plattformen wie [Mosaic AI](https://www.databricks.com/product/machine-learning/mosaic-ai) auf Compound-AI-Werkzeuge (Agent Framework, Vector Search, Evaluation) statt auf ein einzelnes Modell.
Compound AI Systems im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
Strategie- und Architektur-Rahmen für agentische Systeme
AI Agents im ÜberblickAgenten-Typen als Bausteine im Compound System
Agentic AI StrategyEntscheidungen vor dem Bau einer agentischen Plattform
Agentic AISystemklasse mit Handlungs-Autonomie
AI AgentsEinzelbaustein-Definition
RAGhäufigster Compound-AI-Typ: Retriever + Generator
Agentic RAGRAG mit Agenten-Entscheidungen
Agent OrchestrationSteuerungsschicht über mehrere Bausteine
Agent FrameworksProgrammier-Ebene für Compound-Kompositionen