ML Engineering Agents sind agentische KI-Assistenten in Databricks, die typische Aufgaben aus dem Machine-Learning-Alltag teilautomatisiert per Chat oder in einer selbstlaufenden Schleife erledigen: das Aufbereiten von Trainingsdaten, das Starten von Trainings-Läufen, das Ausrollen fertiger Modelle und das Nachziehen laufender Pipelines. Databricks hat sie 2025 als Teil des Mosaic-AI-Angebots vorgestellt; im Hintergrund arbeiten der Databricks Assistant (Code-Kontext), Genie (Daten-Kontext) und MLflow (Experiment- und Modell-Historie).
Was sind ML Engineering Agents?
ML Engineering Agents sind spezialisierte KI-Assistenten für ein einziges Aufgabengebiet: den Lebenszyklus eines Machine-Learning-Modells auf der Databricks-Plattform. „Agentisch" heißt hier: Der Assistent antwortet nicht nur auf eine Frage, er bekommt ein Ziel (zum Beispiel „bereite einen Baseline-Klassifikator für diese Tabelle vor"), zerlegt es in Zwischenschritte, führt sie selbstständig aus und prüft das Ergebnis. Die einzelnen Schritte greifen dabei auf die Plattform-APIs zu, mit denen ein Team sonst manuell arbeiten würde.
Die Agenten decken die klassischen Aufgaben-Klassen des ML-Engineerings ab. Zur Datenvorbereitung leiten sie Features aus Delta-Tabellen ab, etwa Aggregationen, Zeitfenster oder Kategorie-Enkodierungen. Zur Trainings-Konfiguration wählen sie Modell-Familie, Metriken und Hyperparameter-Räume und starten die Läufe über die Databricks-ML-APIs. Zum Experiment-Tuning vergleichen sie Läufe in MLflow, verwerfen schwache Kandidaten und iterieren. Zum Deployment legen sie Model-Serving-Endpoints an, konfigurieren Traffic-Split und Authentifizierung. Zur Pipeline-Wartung überwachen sie laufende Endpoints, reagieren auf Drift-Signale und stoßen Retraining-Läufe an.
Der Begriff existiert, weil diese Aufgaben traditionell manuell und skript-basiert waren. Ein ML-Team schrieb Notebooks für die Feature-Ableitung, YAML für die Trainings-Konfiguration und Terraform oder Databricks Asset Bundles für das Deployment. Der wiederkehrende Anteil dieser Arbeit (die Muster, die sich zwischen zwei Klassifikationsaufgaben nur in Feldern und Metriken unterscheiden) lässt sich in einen Agenten packen, der die Muster kennt und die Plattform-APIs bedient. Die Databricks-Ankündigung 2025 stellte die ML Engineering Agents in diese Position: aufgesetzt auf Mosaic AI, integriert in die vorhandenen Bausteine Databricks Assistant, Genie und MLflow.
Zwei Interaktionsformen sind vorgesehen. Im Chat-Modus stellt der Nutzer eine Aufgabe und der Agent schlägt Code oder Konfiguration vor, die vor Ausführung freigegeben wird. Im Auto-Loop-Modus plant der Agent selbstständig eine Kette aus mehreren Schritten, führt sie aus, prüft die Ergebnisse gegen die vorgegebenen Kriterien und plant den nächsten Schritt. Der Auto-Loop-Modus ist die eigentliche agentische Ausprägung; der Chat-Modus ist der Übergang von einem Code-Assistenten zu einem Agenten.
Abgrenzung zu AutoML, Databricks Assistant, AI Agents und Genie Code
Der Begriff ML Engineering Agents wird in der Praxis mit angrenzenden Databricks-Produkten und allgemeinen Agenten-Begriffen vermischt. Die Bezeichnungen benennen unterschiedliche Rollen im ML- und Plattform-Stack.
| Begriff | Rolle | Ebene |
|---|---|---|
| ML Engineering Agents | Agentische Assistenz für den kompletten ML-Lifecycle auf Databricks | Plattform-Agent |
| AutoML | Automatisierte Modell-Auswahl über einen definierten Suchraum | Trainings-Verfahren |
| Databricks Assistant | Code-Assistent im Notebook, Cell- und Prompt-basiert | Code-Assistenz |
| AI Agents (allgemein) | Sammelbegriff für agentische Systeme aller Domänen | Kategorie |
| Genie Code | Agentische Code-Erzeugung im BI-/App-Kontext | Domänen-Agent (BI) |
AutoML automatisiert einen einzelnen Schritt im ML-Prozess: die Modell-Auswahl. Ein AutoML-Lauf nimmt einen Datensatz und eine Zielgröße entgegen, probiert verschiedene Modell-Familien mit Hyperparameter-Suche und liefert einen Ranking-Report samt fertigem Notebook. Er läuft einmalig, ohne Planungs-Loop, und deckt weder Feature-Engineering-Design noch Deployment-Setup noch die Pipeline-Wartung ab. ML Engineering Agents nutzen AutoML als Baustein für einen möglichen Trainings-Schritt, gehen aber breiter über den Lifecycle und arbeiten iterativ.
Der Databricks Assistant ist der Chat-basierte Code-Assistent in Databricks-Notebooks. Er nimmt eine Anfrage entgegen und antwortet mit Code, Fix-Vorschlägen oder Erklärungen. Es gibt keine mehrstufige Planung, keinen Zugriff auf Werkzeuge außerhalb der aktuellen Zelle und keine Ergebnis-Prüfung. Der ML Engineering Agent baut auf dem Assistant für die Code-Erzeugung auf, ergänzt aber Planung, Werkzeug-Aufrufe und Zustandsverwaltung zu einem Agenten.
AI Agents ist der Sammelbegriff für alle agentischen Systeme: Customer-Support-Agenten, Recherche-Agenten, Coding-Agenten, BI-Agenten. ML Engineering Agents sind ein enger Sub-Typ dieser Kategorie, mit Zielsystem Databricks-Plattform und Domäne ML-Lifecycle. Die allgemeinen Konzepte (Tool-Use, Planning, Reflection, Multi-Step-Loop) gelten unverändert, die Werkzeug-Bibliothek ist plattform-spezifisch.
Genie Code ist der agentische Code-Erzeuger im BI- und App-Kontext von Databricks. Der Fokus liegt auf Genie-Space-Erweiterungen, Datenbank-Abfragen und dem Bau von Databricks Apps. Er bedient die BI-Ebene der Plattform. Der ML-Lifecycle bleibt außerhalb seines Zuständigkeitsbereichs. Wo Genie Code eine SQL-Abfrage oder eine App-Komponente generiert, generiert ein ML Engineering Agent eine Feature-Ableitung, einen Trainings-Lauf oder eine Endpoint-Konfiguration.
Beispiel: Retraining-Loop bei Drift
Ein ML-Team betreibt einen Klassifikator für Kunden-Churn auf einem Databricks-Model-Serving-Endpoint. Die zugrundeliegenden Trainingsdaten liegen als Delta-Tabelle in Unity Catalog, die Historie der Trainings-Läufe in Managed MLflow, das Deployment im Model Registry. Ein ML Engineering Agent im Auto-Loop-Modus überwacht den Endpoint über die Lakehouse-Monitoring-APIs.
Erreicht der Drift-Indikator einen konfigurierten Schwellenwert, plant der Agent den nächsten Retraining-Zyklus: Auswahl der neuen Datenpartition (letzte 90 Tage plus Vergleichsfenster), Ableitung der bekannten Features nach dem gespeicherten Rezept, Start eines neuen Trainings-Laufs mit der bisher besten Hyperparameter-Kombination als Startpunkt und paralleler AutoML-Suche für einen möglichen Kandidaten. Die Läufe protokolliert Managed MLflow. Der Agent vergleicht die neue Modell-Version mit dem produktiven Modell auf einem Hold-out-Datensatz, promoviert die bessere Version im Model Registry und aktualisiert den Endpoint mit einem gradual Traffic-Split. Den Vorgang dokumentiert der Agent als MLflow-Run-Kommentar und als Governance-Eintrag. Die menschliche Freigabe bleibt an definierten Punkten erhalten (Promotion und Endpoint-Switch) oder wird vollständig automatisiert, je nach Reifegrad und Risiko-Profil des Modells.
Architektonisch positionieren sich ML Engineering Agents damit als Automations-Schicht über den bestehenden MLOps-Bausteinen. Sie ersetzen weder MLflow noch das Model Serving noch den Feature Store; sie bedienen diese Komponenten schneller und konsistenter, als es ein manueller Prozess über mehrere Notebooks und Runbooks tut. Wie sich Trainings-, Registrierungs- und Deployment-Bausteine auf Databricks konkret zu einer durchgängigen ML-Pipeline zusammenfügen, zeigt der Überblick zu [Managed MLflow auf Databricks](/insights/databricks/artificial-intelligence/managed-mlflow/).
ML Engineering Agents im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
Hub für Mosaic-AI-Komponenten, in dem ML Engineering Agents die Automations-Schicht sind
Managed MLflow auf DatabricksExperiment- und Modell-Registry, die ein ML Engineering Agent als Backend nutzt
Mosaic AI Trainingverwaltete Trainings-Umgebung, in der die Läufe eines ML Engineering Agents ausgeführt werden
AutoMLautomatisierte Modell-Auswahl als ein Werkzeug im Agent-Repertoire, nicht dessen Ersatz
Agentic AIübergeordnetes Konzept der agentischen Ausführung, auf dem ML Engineering Agents aufsetzen
AI Agentsallgemeiner Agenten-Begriff, dessen enger Sub-Typ die ML Engineering Agents sind
Agent FrameworksBau-Ebene für allgemeine Agenten, abgegrenzt zum plattform-integrierten Databricks-Agenten
Foundation ModelsModell-Basis, auf der die Agent-Steuerung selbst läuft
MLOpsBetriebs-Disziplin, deren manuelle Aufgaben ML Engineering Agents automatisieren