Zum Inhalt springen

Data Pipeline

Eine Data Pipeline verkettet Ingestion, Transformation und Load zu einem Datenfluss. Abgrenzung gegen ETL/ELT, Data Flow und Workflow im Überblick.

Eine Data Pipeline ist eine feste Kette von Verarbeitungsschritten, die Daten aus Quellsystemen (z. B. Datenbanken, Dateien, Ereignis-Streams) einliest, unterwegs umformt (bereinigt, angereichert, geprüft) und in ein Zielsystem (Data Warehouse, Data Lakehouse, Analyse-Tabelle) ablegt. Der Begriff beschreibt den kompletten Weg der Daten von der Quelle bis zum Ziel, unabhängig davon, ob sie in geplanten Blöcken (Batch), laufend als Ereignis-Strom (Streaming) oder als Änderungs-Ereignisse aus einer Datenbank (Change Data Capture, kurz CDC) fließen.

Was ist eine Data Pipeline?

Eine Data Pipeline ist die technische Umsetzung eines Datenflusses: eine geordnete Folge von Schritten, in der das Ergebnis eines Schritts der Eingang des nächsten ist. Typische Schritte sind das Auslesen der Quelle, eine Schema-Prüfung (Passen die Spalten und Datentypen?), das Entfernen von Duplikaten, die Umformung (z. B. Zusammenführen von Tabellen, Aggregieren zu Kennzahlen), Qualitätsprüfungen (z. B. Pflichtfelder, Wertebereiche) und das Ablegen in eine Ziel-Tabelle. Der Begriff geht auf die Pipeline-Metapher aus der Informatik zurück: hintereinander geschaltete Verarbeitungs-Stationen, die ein Element von der einen zur nächsten weiterreichen.

Data Pipelines existieren in vier Ausführungsmodi. Batch-Pipelines laufen planmäßig, oft nächtlich, und verarbeiten abgegrenzte Zeiträume in einem Durchgang. Micro-Batch-Pipelines wie Structured Streaming auf Databricks verarbeiten kleine Zeitfenster in Minuten- oder Sekunden-Intervallen und liefern Latenz-Reduktion bei ähnlicher Fehlerbehandlung wie im Batch. Reine Streaming-Pipelines verarbeiten Ereignisse kontinuierlich, sobald sie eintreffen. Change-Data-Capture-Pipelines lesen Row-Änderungen aus dem Transaktions-Log der Quelle und geben sie ereignisorientiert weiter.

Die Bausteine einer produktiven Pipeline umfassen Konnektoren (Quell- und Ziel-Adapter), eine Ausführungs-Engine (Spark, Flink, dbt), Orchestrierung (Airflow, Lakeflow Jobs, Prefect), einen State- und Metadaten-Store (Delta Log, Unity Catalog) sowie Monitoring für Läufe, Latenz, Fehlerraten und Data-Quality-Metriken. Reife-Kriterien einer produktiven Pipeline sind Idempotenz (mehrfache Ausführung liefert dasselbe Ergebnis), Wiederanlaufbarkeit nach Fehler, Backfill-Fähigkeit für historische Zeiträume, durchgängige Lineage sowie eine klare Owner-Zuständigkeit pro Pipeline.

Der Begriff existiert, weil er den durchgängigen Datenfluss von den einzelnen Mustern darin trennt. Eine Pipeline kann ETL-, ELT- und CDC-Abschnitte verketten, ohne dass ein einzelnes Muster den Pipeline-Begriff ersetzt. In modernen Referenz-Architekturen wie dem Bronze-Silver-Gold-Modell entstehen aus mehreren verketteten Pipelines schichtweise konsumierbare Datenbestände.

Abgrenzung gegen ETL/ELT, Data Flow und Workflow

Der Pipeline-Begriff wird häufig mit einem seiner Bestandteile oder einer benachbarten Ebene verwechselt. Die folgende Tabelle sortiert die vier häufigsten Verwechslungen.

BegriffVerhältnis zur Data PipelineKernunterschied
ETL / ELTMuster innerhalb einer PipelineETL beschreibt die Reihenfolge Extract-Transform-Load (Transformation vor dem Load, klassisch Warehouse), ELT die Reihenfolge Extract-Load-Transform (Transformation im Zielsystem, Lakehouse-typisch). Eine Pipeline kann ETL-, ELT- oder gemischte Abschnitte enthalten.
Data FlowEinzelner Transformations-BausteinData Flow bezeichnet einen einzelnen Transformations-Baustein innerhalb einer Pipeline, meist grafisch modelliert (SAP Datasphere Data Builder, Azure Data Factory Data Flow). Eine Pipeline verkettet mehrere Flows und ergänzt Orchestrierung, Zeitplanung und Fehlerbehandlung.
WorkflowOrchestrierungs-SichtEin Workflow (Airflow-DAG, Lakeflow Job, Azure Data Factory Pipeline-Objekt) beschreibt Abhängigkeiten zwischen Tasks und deren Ausführungs-Reihenfolge. Er steuert die Data Pipeline, ist aber nicht identisch mit ihr: derselbe Workflow kann mehrere Pipelines starten, dieselbe Pipeline kann von unterschiedlichen Workflows getriggert werden.
Data IngestionTeilmenge einer PipelineData Ingestion deckt Extract und Load ohne Transformation ab (Auto Loader, Fivetran, Kafka Connect). Eine Pipeline umfasst Ingestion plus die folgenden Verarbeitungsschritte bis zum konsumierbaren Bestand.

Zwei Trennlinien sind für Architektur-Entscheidungen zentral. Erstens die Ebene: Ein Workflow-Objekt ist die Orchestrierungs-Sicht, die Data Pipeline ist der Datenfluss selbst, ein Data Flow ist ein Einzelschritt darin. Zweitens der Geltungsbereich gegenüber Data Integration: Data Integration ist der Dach-Begriff für Verfahren zur Zusammenführung von Datenbeständen (ETL/ELT, CDC, Zero-ETL, Virtualization, iPaaS), eine Data Pipeline ist die konkrete Umsetzung eines oder mehrerer dieser Verfahren als lauffähiger Datenfluss.

Beispiel: Bronze-Silver-Gold-Pipeline im Lakehouse

Ein Handelsunternehmen betreibt eine dreistufige Data Pipeline im Databricks Lakehouse. Auto Loader schreibt CSV-Bestell-Exporte aus Azure Data Lake Storage inkrementell als Delta-Tabelle in den Bronze-Layer und übernimmt damit den Ingestion-Schritt. Ein Structured-Streaming-Job dedupliziert die Bestellungen anhand einer Auftrags-ID, prüft das Schema gegen einen Data Contract und schreibt die bereinigten Datensätze in den Silver-Layer; dieser Abschnitt ist Transformation plus Data-Quality-Prüfung. Ein zweiter Transformationsschritt joint die Silver-Bestellungen mit einer per Change Data Capture gepflegten Kundendimension aus SAP S/4HANA und aggregiert Tages-Kennzahlen in den Gold-Layer.

Ein Lakeflow Job orchestriert die drei Schritte, überwacht Latenz und Data-Quality-Metriken und triggert Backfills nach Schema-Änderungen in der Quelle. Der gesamte Fluss ist die Data Pipeline. ETL, ELT, Ingestion und CDC treten darin als Muster auf, ersetzen den Pipeline-Begriff aber nicht. Der Workflow steuert die Pipeline, ohne selbst der Datenfluss zu sein. Bronze, Silver und Gold sind die Layer, die die Pipeline schrittweise auffüllt.

Data Pipeline im eigenen Unternehmen umsetzen?

Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.

Gespräch vereinbaren