Mosaic AI ist die Produktlinie von Databricks für maschinelles Lernen und generative KI (KI-Anwendungen, die Text, Bilder oder Code erzeugen). Sie bündelt die Bausteine, mit denen Unternehmen Modelle innerhalb der Databricks-Plattform trainieren, verwalten, bereitstellen und in Anwendungen einbetten, ohne dafür eine separate ML-Umgebung aufzubauen.
Was ist Mosaic AI?
Mosaic AI ist der Markenname für die ML- und GenAI-Sparte innerhalb der Databricks-Datenplattform. Vergleichbar ist das Verhältnis mit „Databricks SQL" für Analytics oder „Lakeflow" für Datenpipelines: der Plattform-Kern (das Lakehouse mit Datenspeicher und Unity Catalog als zentraler Berechtigungs- und Katalog-Schicht) bleibt derselbe, während Mosaic AI die Bausteine für das Trainieren und Betreiben von Modellen bereitstellt. Die Sparte beantwortet die Frage, welche Databricks-Bausteine in einem ML- oder GenAI-Projekt zusammenspielen.
Der Name geht auf die Übernahme von MosaicML durch Databricks im Juli 2023 (rund 1,3 Mrd. USD) zurück. MosaicML war Spezialist für effizientes Training großer Modelle (Composer-Framework, Streaming-Datasets). Databricks überführte die Technologie 2023 und 2024 in eine eigene Produktlinie und benannte die bestehende ML- und GenAI-Suite in „Mosaic AI" um ([Databricks Pressemitteilung 2023](https://www.databricks.com/company/newsroom/press-releases/databricks-signs-definitive-agreement-acquire-mosaicml)).
Zum Stand 2026 umfasst Mosaic AI fünf Kern-Komponenten. Mosaic AI Training ist der verwaltete Trainings-Service für Fine-Tuning und Continued Pre-Training von Foundation-Modellen auf verwalteten GPUs. Mosaic AI Model Registry verwaltet Modell-Versionen als reguläre Objekte in Unity Catalog mit Aliases wie @champion und @challenger. Mosaic AI Vector Search stellt einen verwalteten Vektor-Index auf Delta-Tabellen bereit, der Retrieval-Augmented-Generation (RAG) und semantische Suche speist. Mosaic AI Agent Framework liefert SDK und Runtime zum Bau und Evaluieren von RAG- und Agenten-Anwendungen. Mosaic AI Gateway bündelt Zugriffe auf Foundation Models hinter einem zentralen Proxy mit Rate-Limits, Cost-Tracking, PII-Filter und Modell-Routing ([Databricks Produktseite Mosaic AI](https://www.databricks.com/product/machine-learning/mosaic-ai)).
Das Fundament sind Open-Source-Bausteine: MLflow als Kern-Bibliothek für Tracking und Registry, Delta Lake als Speicher-Format, Spark und Photon als Compute-Engine. Foundation Models laufen wahlweise als Managed Endpoint (Foundation Model APIs auf Databricks) oder über das Gateway gegen externe Anbieter wie OpenAI, Anthropic und Google. Fine-Tuning bleibt an Open-Weight-Modelle wie Llama, Mistral und DBRX gebunden; proprietäre Modelle lassen sich nur über die Tuning-Angebote des jeweiligen Anbieters anpassen. Abgerechnet wird über Databricks Units (DBU) je Komponente, Trainings- und Inferenz-Kosten laufen getrennt.
Abgrenzung zu Databricks, MLflow, Hugging Face und SageMaker
Mosaic AI wird häufig mit der Plattform darunter, mit der Open-Source-Bibliothek unter der Haube oder mit Konkurrenz-ML-Plattformen der Cloud-Anbieter gleichgesetzt. Fünf Begriffe stehen typischerweise im Umfeld.
| Begriff | Ebene | Verhältnis zu Mosaic AI |
|---|---|---|
| Databricks | Plattform-Dach | Oberkategorie. Databricks ist die Datenplattform als Ganzes (Engineering, BI, ML, Governance); Mosaic AI ist die ML- und GenAI-Sparte darauf. |
| Open-Source MLflow | Bibliothek darunter | Technische Grundlage. Managed MLflow und die Model Registry basieren auf MLflow-APIs; MLflow läuft überall, Mosaic AI ist die verwaltete Ausprägung in Databricks. |
| Hugging Face Ecosystem | Offener Modell-Hub | Repository für Modelle und Datensätze plus Bibliotheken (Transformers). Ergänzt Mosaic AI (HF-Modelle im Training laden), ersetzt es nicht. |
| Amazon SageMaker / Vertex AI | Cloud-Anbieter-ML | Konkurrierende ML-Plattformen ohne Lakehouse-Bindung. Arbeiten mit Cloud-Storage-Buckets oder eigenen Feature-Stores anstelle von Unity Catalog. |
| Foundation Model APIs | Komponente | Der Pay-per-Token-Zugriff auf gehostete Modelle im Gateway. Eine Komponente von Mosaic AI, nicht die Sparte als Ganzes. |
Der häufigste Verwechslungspunkt liegt zwischen Databricks und Mosaic AI. Wer „Databricks" sagt, meint die Plattform mit Datenspeicher, Rechten und Compute; wer „Mosaic AI" sagt, meint die Modell-Bausteine oben drauf. Die Sparte ist an die Plattform gebunden: Ohne Databricks-Konto und Unity Catalog gibt es kein Mosaic AI, ohne Daten im Lakehouse verliert die Sparte ihren Kern-Vorteil (integrierte Governance und Lineage von der Rohdaten-Tabelle bis zur Modell-Antwort).
Open-Source MLflow liegt als Baustein unter Mosaic AI. Die Model Registry in Unity Catalog nutzt die MLflow-APIs, das Experiment-Tracking läuft über Managed MLflow, die Modell-Serialisierung folgt dem MLflow-Format. Wer sein Setup migrationsoffen halten will, arbeitet mit MLflow-Formaten und tauscht den Betriebs-Kontext (Databricks vs. eigener MLflow-Server vs. andere Managed-Anbieter) aus.
Hugging Face und Mosaic AI bedienen unterschiedliche Ebenen. Hugging Face ist ein öffentliches Repository für Modelle und Datensätze plus die Bibliotheken, mit denen sich diese Modelle laden und feintunen lassen. Mosaic AI ist eine integrierte Produktlinie in einer Datenplattform mit Governance, Compute und produktiver Bereitstellung. Beide werden häufig kombiniert: ein Llama-3-Modell aus dem Hugging Face Hub landet als Basis-Artefakt in Mosaic AI Training und nach dem Lauf in der Model Registry.
SageMaker (AWS) und Vertex AI (Google Cloud) sind die konkurrierenden ML-Plattformen der jeweiligen Cloud-Anbieter. Sie stellen ähnliche Bausteine bereit (Training, Feature Store, Endpoints), sind aber nicht an ein Lakehouse gekoppelt. Daten liegen typischerweise in S3, Google Cloud Storage oder proprietären Feature-Stores. Mosaic AI hingegen ist tief an Unity Catalog und Delta Lake gebunden. Für Organisationen, deren Datenmasse ohnehin im Databricks-Lakehouse liegt, entfällt damit der Aufwand, Daten in eine separate ML-Umgebung zu spiegeln.
Beispiel: Support-Assistent auf firmeneigenen Ticket-Daten
Ein Team baut einen internen Support-Assistenten, der Anfragen auf Basis der eigenen Ticket-Historie beantwortet. Die geprüften Ticket-Antworten liegen als Delta-Tabelle in Unity Catalog. Mosaic AI Vector Search erzeugt einen synchron gepflegten Vektor-Index auf dieser Tabelle. Ändert sich der Quell-Datensatz, aktualisiert sich der Index automatisch, ohne dass ein separater Batch-Job dazwischen läuft.
Für die Antwortqualität wird ein Llama-3-Modell mit Mosaic AI Training auf rund 12.000 geprüften Antwortpaaren fine-getuned. Managed MLflow protokolliert Hyperparameter, Loss-Kurven und Eval-Ergebnisse. Der fertige LoRA-Adapter landet in der Mosaic AI Model Registry unter prd.support_assistant.answer_model und bekommt den Alias @champion. Die Anwendung selbst wird mit Mosaic AI Agent Framework gebaut: das Framework nimmt die Nutzerfrage entgegen, holt die Top-Treffer aus dem Vektor-Index, formuliert den Prompt und ruft das Modell über Mosaic AI Gateway. Das Gateway führt Rate-Limits, protokolliert Kosten und filtert personenbezogene Daten aus der Anfrage.
Architektonisch positioniert sich Mosaic AI als Ebene zwischen Speicher- und Governance-Schicht unten (Delta Lake, Unity Catalog) und Anwendungs-Ebene oben (Databricks Apps, Genie, eigene Frontends). Wer Governance, Lineage und Datenkatalog ohnehin auf Databricks führt, bekommt mit Mosaic AI die dazu passende ML- und GenAI-Sparte ohne zusätzliche Vertrags- und Betriebsstrecke. Wie sich die Komponenten in einer produktiven KI-Umgebung zusammenfügen, zeigt der Überblick zu [Mosaic AI auf Databricks](/insights/databricks/mosaic-ai/).
Mosaic AI im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
Brand-Pillar mit Komponenten-Karte und Lizenz-/Pricing-Logik
Künstliche Intelligenz auf DatabricksAI-Hub mit den Mosaic-AI-Bausteinen im Lakehouse-Kontext
Mosaic AI Training auf DatabricksTrainings-Baustein für Fine-Tuning und Continued Pre-Training
Mosaic AI Model Registry auf DatabricksUnity-Catalog-basierte Modell-Registry
Mosaic AI TrainingTrainings-Service als Glossar-Nachbar
Mosaic AI Model RegistryRegistry-Komponente als Glossar-Nachbar
Managed MLflowMLflow-Basis unter Tracking und Registry
Foundation ModelsModell-Klasse, die Mosaic AI trainiert und ausliefert
Vector SearchRetrieval-Baustein für RAG-Anwendungen
AI GatewayProxy-Schicht mit Rate-Limits und Cost-Tracking
Agent FrameworksRuntime-Kategorie, in die das Mosaic AI Agent Framework fällt
Model ServingEndpoint-Schicht, die Registry-Versionen bereitstellt