Data Transformation ist die Umformung von Rohdaten in ein Format, das ein Zielsystem oder eine Auswertung nutzen kann. Der Begriff steht für das „T" in ETL und ELT (Extract, Transform, Load, die drei Schritte, in denen Daten aus Quellsystemen ins Zielsystem wandern). Typische Bausteine sind Bereinigen (Cleaning), Anreichern (Enrichment, also Ergänzen um Referenzdaten wie eine Kundendimension), Verdichten (Aggregation, etwa Tagessummen) und Umformen der Struktur (Format-Konvertierung, Verknüpfen von Tabellen und Umformen von Zeilen und Spalten).
Was ist Data Transformation?
Data Transformation ist ein gerichteter Vorgang: Aus einem Ausgangs-Datensatz mit bekanntem Aufbau wird über Regeln oder Programmlogik ein Ziel-Datensatz mit anderem Aufbau. Die Transformation kann fachliche Regeln umsetzen (Währungen umrechnen, Storno-Positionen ausfiltern, Kundendaten ergänzen), technische Regeln (Dateiformate wie CSV in effizientere Formate wie Parquet konvertieren, Zeitzonen vereinheitlichen) oder die Struktur ändern (Tabellen umformen, verschachtelte JSON-Datenobjekte in einzelne Zeilen aufspalten).
Die typischen Operationen zerfallen in vier Gruppen. Cleaning behandelt Null-Werte, entfernt Duplikate und korrigiert Ausreißer. Enrichment reichert Datensätze über Lookup-Joins mit Referenzdaten an oder ergänzt fehlende Attribute aus einer zweiten Quelle. Aggregation verdichtet über Sum, Count, Min, Max oder Window-Funktionen. Formatierung und Strukturänderung konvertieren Dateiformate, ändern Datentypen und formen die Datensatz-Geometrie um (Pivot, Unpivot, Explode).
Ausführungstechnisch existieren zwei Stile. Deklarativ beschreibt SQL, ein dbt-Modell oder eine Databricks Declarative Pipeline nur das Zielergebnis; die Engine plant die Ausführung. Imperativ programmiert PySpark, Scala Spark oder Pandas den konkreten Ablauf Zeile für Zeile. Beide Stile laufen entweder im Batch (Neuberechnung eines Zeitraums am Stück) oder inkrementell im Streaming (fortlaufende Verarbeitung neuer Ereignisse).
In der Referenz-Architektur des Medaillon-Modells findet Data Transformation an zwei Stellen statt. Zwischen Bronze und Silver konformisiert sie Rohdaten in ein stabiles, technisch bereinigtes Zwischenformat. Zwischen Silver und Gold setzt sie Business-Logik um und aggregiert Silver-Tabellen zu konsumierbaren Kennzahlen für Analytics, Reporting und KI-Modelle.
Der Begriff existiert, weil er die wertschöpfende Umformung von der reinen Datenbewegung trennt. Idempotenz, Testbarkeit, Data-Quality-Prüfungen und fachliche Verantwortung binden sich an die Transformationsschicht, nicht an die umgebende Pipeline oder das Ingestion-System.
Abgrenzung gegen Pipeline, ETL/ELT, Modeling und Cleansing
Data Transformation wird häufig mit umgebenden oder überlappenden Begriffen verwechselt. Die folgende Tabelle sortiert die vier häufigsten Verwechslungen.
| Begriff | Verhältnis zur Data Transformation | Kernunterschied |
|---|---|---|
| Data Pipeline | Umgebender Datenfluss | Eine Data Pipeline verkettet Ingestion, Transformation und Load zu einem Ende-zu-Ende-Fluss. Data Transformation ist einer ihrer Bausteine. |
| ETL / ELT | Reihenfolge-Muster | ETL führt die Transformation vor dem Load durch (klassisch Warehouse), ELT im Zielsystem nach dem Load (Lakehouse-typisch). Data Transformation ist der Umformungs-Vorgang selbst, unabhängig von der Reihenfolge. |
| Data Modeling | Design-Ebene | Data Modeling entwirft das Ziel-Schema (Dimensionen, Fakten, Grain, Beziehungen). Data Transformation setzt die Regeln um, die Rohdaten in dieses Schema überführen. |
| Data Cleansing | Teilmenge | Data Cleansing beschränkt sich auf die Bereinigung von Null-Werten, Duplikaten und Format-Fehlern. Data Transformation umfasst zusätzlich Enrichment, Aggregation und strukturelle Umformung. |
Zwei Trennlinien sind für Architektur-Entscheidungen zentral. Erstens die Ebene: Ein Data-Pipeline-Objekt ist der umgebende Fluss inklusive Ingestion und Load, Data Transformation ist der Umformungs-Schritt darin, Data Modeling ist der Entwurf des Ziel-Schemas ohne Ausführung. Zweitens die Reichweite: Data Cleansing repariert bestehende Datensätze, Data Transformation formt sie zusätzlich um und reichert sie an.
Der Bezug zu Data Integration verläuft breiter. Data Integration ist der Dach-Begriff für die Zusammenführung verteilter Datenbestände (ETL/ELT, CDC, Zero-ETL, Virtualization, iPaaS). Data Transformation ist ein Bestandteil davon, existiert aber auch außerhalb von Integrations-Szenarien: eine reine In-Place-Umformung einer einzelnen Tabelle ist Transformation ohne Integration.
Beispiel: Silver-Layer-Transformation im Databricks Lakehouse
Ein Handelsunternehmen betreibt eine Silver-Layer-Transformation im Databricks Lakehouse. Rohbestellungen liegen als Delta-Tabelle im Bronze-Layer, ingestiert per Auto Loader aus Azure Data Lake Storage. Die Transformation liest die Bronze-Tabelle, dedupliziert die Bestellungen nach Auftrags-ID (Cleaning), joint gegen die per Change Data Capture gepflegte Kundendimension (Enrichment), filtert Stornopositionen und Test-Datensätze aus (strukturelle Umformung) und schreibt das Ergebnis mit stabilen Datentypen in eine Silver-Tabelle.
Die Transformation ist als SQL-Modell in Databricks Declarative Pipelines definiert, versioniert über Databricks Asset Bundles und mit Expectations für Not-Null-Constraints und Auftrags-ID-Eindeutigkeit hinterlegt. Ein nachgelagerter Gold-Transformation-Schritt aggregiert die Silver-Bestellungen zu Tageskennzahlen für BI-Konsumenten. Die umgebende Data Pipeline orchestriert Ingestion, beide Transformations-Stufen und den finalen Load; die Transformation selbst ist der Umformungs-Baustein zwischen Bronze und Silver.
Data Transformation im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
Cluster-Kontext für Ingest, Transformation und Orchestrierung im Lakehouse
ETL vs. ELTReihenfolge-Muster, in dem die Transformation läuft
Databricks Declarative Pipelinesdeklarative Laufzeit für Transformations-Modelle
Data Ingestion auf Databricksvorgelagerter Extract-und-Load-Schritt
Data Pipelineumgebender Ende-zu-Ende-Fluss
Data Flowgrafisch modellierter Transformations-Baustein
Data IntegrationDach-Begriff über den Integrations-Verfahren
Data IngestionExtract-und-Load ohne Umformung
Data ModelingEntwurf des Ziel-Schemas
Data Processingübergeordnete Verarbeitungs-Kategorie
Data QualityPrüf-Regeln, oft als Teil der Transformation umgesetzt
Apache Sparkverbreitete Engine für Transformations-Workloads