Image Models sind trainierte KI-Modelle, die Bilder verarbeiten oder erzeugen. Sie nehmen entweder einen Text oder ein Bild als Eingabe und geben ein Bild aus (Bildgenerierung), oder sie analysieren ein Bild und liefern eine Beschreibung dazu (etwa welches Objekt zu sehen ist). Bekannte Vertreter für die Bildgenerierung sind Diffusion-Modelle (schrittweise Bildaufbereitung aus Rauschen) wie Stable Diffusion, DALL-E, Midjourney oder Nano Banana. Für die Bildanalyse werden Convolutional Neural Networks (CNN, faltende neuronale Netze) und Vision Transformer (bildverarbeitende KI-Netze auf Basis der gleichen Technik wie ChatGPT) eingesetzt.
Was ist ein Image Model?
Ein Image Model ist eine trainierte KI-Funktion, die Bilder als Eingabe oder Ausgabe verarbeitet. Bilder werden dem Modell entweder als klassisches Pixel-Raster übergeben, als komprimierte Zahlen-Darstellung (Latent-Tensor, eine platzsparende Zwischenform) oder als Folge kleiner Bild-Kacheln (Patches). Zur Laufzeit macht das Modell eines von beidem: Es erzeugt ein neues Bild (etwa Bildgenerierung, Retusche, Hochskalieren oder Ergänzen fehlender Bildteile, englisch Inpainting) oder es liefert eine strukturierte Aussage zu einem Bild (etwa die Klasse „Katze", ein Rechteck um ein Objekt als Bounding Box oder eine Maske, die genau die Objekt-Pixel markiert). Die Modell-Parameter werden im Training aus großen Bild-Sammlungen gelernt, häufig zusammen mit den passenden Text-Beschreibungen, damit das Modell später auf Text-Prompts reagieren kann.
Zwei große Zweige prägen die Kategorie. Generative Image Models erzeugen neue Bilder aus Text- oder Bild-Prompts. Aktueller Stand sind Latent-Diffusion-Modelle wie Stable Diffusion (Stability AI, 2022), DALL-E 3 (OpenAI, 2023), Midjourney, Imagen (Google) sowie Nano Banana als Gemini-Image-Modell (Google, 2024/2025). Die ältere Familie GAN (Generative Adversarial Networks) mit Vertretern wie StyleGAN spielt heute eine kleinere Rolle. Diskriminative Image Models klassifizieren oder analysieren Bilder: Convolutional Neural Networks wie ResNet oder EfficientNet, Vision Transformer wie ViT und Swin, Objekterkennungs-Modelle wie YOLO oder DETR und Segmentierungs-Modelle wie SAM (Segment Anything, Meta 2023) oder U-Net.
Der Architektur-Wechsel von reinen CNN-Netzen zu Diffusion und Vision Transformer prägt den heutigen Stand. Diffusion-Modelle lernen, ein aus Gauß-Rauschen bestehendes Bild schrittweise zu einem sinnvollen Bild zu entrauschen, konditioniert auf einen Text-Embedding-Vektor aus einem Sprachmodell wie CLIP oder T5. Latent-Diffusion arbeitet dabei nicht im Pixel-Raum, sondern in einem komprimierten Latent-Raum (Variational Autoencoder), was Trainings- und Inferenz-Kosten deutlich senkt. Vision Transformer behandeln Bilder als Sequenz von Patches und wenden dieselben Attention-Mechanismen an, die auch in Sprachmodellen dominieren, angewandt auf Bild-Token.
Image Models werden zunehmend als Modalität in multimodale Foundation Models eingebettet: GPT-4o, Gemini 2.5 und Claude Opus verstehen Bilder und erzeugen sie teilweise selbst. Die begriffliche Grenze bleibt trotzdem sinnvoll. Die Kategorie beschreibt Modelle, deren primäre Modalität Bild ist, unabhängig davon, ob weitere Modalitäten unterstützt werden. Reine Text-to-Image-Modelle wie Stable Diffusion oder Midjourney bleiben eine eigene Klasse; multimodale Modelle mit Bild-Kanal fallen begrifflich in beide Kategorien.
Abgrenzung zu Computer Vision, Multimodal Model, Foundation Model und Generative AI
Die verwandten Begriffe werden häufig synonym verwendet, meinen aber unterschiedliche Ausschnitte:
| Begriff | Fokus | Verhältnis zu Image Model |
|---|---|---|
| Computer Vision | Disziplin und Verfahren-Set für maschinelle Bildinterpretation (Klassifikation, Objekterkennung, Segmentierung, OCR) | Image Models sind die Modell-Klasse innerhalb dieser Disziplin; zusätzlich schließt Image Models die generativen Modelle (Text-to-Image) mit ein, die klassisch nicht als Kern-Computer-Vision gelten |
| Multimodal Model | Modell mit mehreren Modalitäten in einem System (Text, Bild, Audio) | Ein reines Image Model arbeitet nur auf Bild-Ein- oder -Ausgabe; ein multimodales Modell mit Bild-Kanal fällt in beide Kategorien |
| Foundation Model | Vortrainiertes Modell mit breiter Datenmenge und breitem Aufgabenspektrum (Oberklasse) | Ein Image Foundation Model wie SAM, DINOv2 oder Stable Diffusion ist ein Image Model, das die Foundation-Model-Kriterien erfüllt; klassische, aufgaben-spezifisch trainierte CNNs sind Image Models, aber keine Foundation Models |
| Generative AI | Sammelbegriff für erzeugende Modelle über alle Modalitäten (Text, Bild, Audio, Video, Code) | Generative Image Models sind eine Teilmenge; die diskriminative Hälfte (Klassifikation, Segmentierung) fällt nicht unter Generative AI |
| Vision-Language Model (VLM) | Modell, das Bild und Text gemeinsam einbettet oder verarbeitet (CLIP, BLIP, LLaVA) | Technisch multimodal, wird aber oft als Encoder oder Reranker in Image-Model-Pipelines eingesetzt; ein CLIP-Bild-Encoder ist ein Image Model, das gesamte CLIP-System multimodal |
Computer Vision beschreibt das Feld, Image Models die Bausteine darin. Ein Objekterkennungs-System für die Regalanalyse ist ein Computer-Vision-System, das intern ein oder mehrere Image Models ausführt. Der Begriff Image Models schließt zusätzlich generative Bild-Modelle ein, die außerhalb der klassischen Computer-Vision-Aufgabenliste liegen.
Multimodale Modelle wie Gemini oder GPT-4o kombinieren mehrere Modalitäten in einem Modell. Die Sitemap zählt sie primär als Multimodal Models, auch wenn sie Bild-Verarbeitung leisten. Ein Foundation Model ist eine Eigenschaft (breit vortrainiert, aufgaben-agnostisch), die orthogonal zur Modalität steht: Es gibt Image Foundation Models, Language Foundation Models und multimodale Foundation Models.
Beispiel: Produkt-Katalog-Automatisierung im E-Commerce
Ein Handelsunternehmen automatisiert die Bild-Pipeline für seinen Produktkatalog und setzt dabei mehrere Image Models in einem Prozess ein. Ein Segmentierungs-Modell wie SAM erzeugt aus dem Rohfoto eine präzise Freistellungsmaske und trennt das Produkt automatisch vom Hintergrund. Ein Diffusion-Modell wie Stable Diffusion XL oder Nano Banana erzeugt aus dieser Freistellung und einem Text-Prompt neue Marketing-Bilder in verschiedenen Szenen (Studio, Lifestyle, saisonale Umgebung). Ein Vision-Transformer-Modell wie SigLIP oder DINOv2 klassifiziert eingehende Produktbilder in Kategorien und extrahiert visuelle Attribute wie Farbe, Muster und Form für die Suche.
Drei verschiedene Image-Model-Typen arbeiten in einem Katalog-Prozess zusammen: ein diskriminatives Segmentierungs-Modell, ein generatives Diffusion-Modell und ein Klassifikations-Modell mit Vision-Transformer-Architektur. Je Modell gelten eigene Trainingsdaten, eigene Metriken (FID- und CLIP-Score für Generierung, Top-1-Accuracy für Klassifikation, IoU für Segmentierung) und eigene Compliance-Anforderungen. Urheberrecht spielt bei den Trainingsdaten der Generatoren eine Rolle; Artikel 50 des EU-AI-Acts verlangt für KI-generierte oder -manipulierte Bilder eine maschinenlesbare Kennzeichnung.
Auf einer Lakehouse-Plattform werden Image Models als [Model-Serving-Endpoint](/insights/databricks/artificial-intelligence/model-serving/) mit GPU-Instanzen bereitgestellt, generative Modelle als [Foundation-Model-API](/insights/databricks/artificial-intelligence/foundation-model-apis/) konsumiert (Anbindung an externe Provider wie OpenAI, Stability oder Google) oder als eigenes Open-Source-Deployment (Stable Diffusion, SAM auf GPU-Serving). Eingabe- und Ausgabe-Bilder liegen in Volumes unter Unity Catalog, Metadaten und Prompt-Historie in Delta-Tabellen. Die Steuerung erfolgt aus dem gleichen Job-Kontext wie die restlichen ML-Workloads.
Image Models im eigenen Unternehmen umsetzen?
Wir zeigen, wie sich das in deiner Systemlandschaft konkret abbilden lässt.
Modell-Familien, Bereitstellung und Governance im Lakehouse-Kontext
Generative AI auf DatabricksErzeugende Modelle für Text, Bild und Audio in der Anwendung
Model Serving auf DatabricksImage-Modell als GPU-API-Endpunkt ausrollen
Foundation Model APIs auf DatabricksManaged Endpoints für vortrainierte Modelle wie Stable Diffusion oder SAM
AI ModelsDach-Term über alle Modell-Familien
Foundation ModelsOberklasse breit vortrainierter Modelle
Computer VisionDisziplin und Verfahren-Set für Bildinterpretation
Audio ModelsNachbar-Kategorie für Audio-Signale
Generative AISammelbegriff für erzeugende Modelle über alle Modalitäten
Attention MechanismKern-Baustein von Vision Transformer und Diffusion-Modellen