Computer Vision - wie Maschinen Bilder verstehen
Computer Vision ist das Teilgebiet der KI, das Maschinen das Sehen beibringt: Bilder klassifizieren, Objekte finden, ähnliche Aufnahmen vergleichen. Moderne, selbstüberwacht vortrainierte Bildmodelle liefern die Grundlage - für Katalogerkennung ebenso wie für die Feinunterscheidung nahezu identischer Objekte.
Computer Vision (maschinelles Sehen) ist das Teilgebiet der künstlichen Intelligenz, das sich damit beschäftigt, wie Maschinen visuelle Informationen aus Bildern und Videos gewinnen und interpretieren. Ziel ist es, aus rohen Pixeln eine Bedeutung abzuleiten - was ist zu sehen, wo befindet es sich, und wie verhält es sich zu anderem.
Moderne Computer Vision basiert fast durchgängig auf tiefen neuronalen Netzen. Sie haben handgebaute Merkmalsdetektoren abgelöst und erreichen bei vielen Aufgaben eine Zuverlässigkeit, die praktische Anwendungen erst möglich macht.
Drei Aufgabenklassen, die man auseinanderhalten muss
Der wichtigste Denkfehler ist, alle Bildaufgaben in einen Topf zu werfen. Tatsächlich sind es sehr unterschiedliche Probleme:
- Bildklassifikation: "Was ist auf dem Bild?" - eine feste Menge an Kategorien wird vergeben. Gut für grobe Einteilung, ungeeignet, sobald ständig neue Objekte hinzukommen.
- Ähnlichkeitssuche: "Welches bekannte Bild ähnelt diesem am meisten?" - statt Kategorien wird ein Embedding erzeugt und in einer Vektordatenbank nach den nächsten Nachbarn gesucht. Skaliert auf beliebig viele Objekte, ohne Neutraining.
- Feinunterscheidung: "Ist das genau dieses Objekt oder eine fast identische Variante?" - die schwierigste Klasse, weil sich die Kandidaten kaum unterscheiden.
Selbstüberwacht vortrainierte Backbones
Den größten Fortschritt der letzten Jahre bringen selbstüberwacht trainierte Bildmodelle. Sie lernen aus riesigen Bildmengen ohne manuelle Labels, indem sie Struktur in den Daten selbst ausnutzen. Modelle der DINOv2-Familie sind ein prominentes Beispiel: Sie liefern reichhaltige, allgemein nützliche Bildmerkmale, die als eingefrorenes Grundmodell (Backbone) für viele Aufgaben dienen.
Der praktische Wert: Man muss kein Bildmodell von Grund auf trainieren. Ein solcher Backbone liefert stabile Merkmale, auf die ein schlanker, aufgabenspezifischer Kopf gesetzt wird - siehe Fine-Tuning und Metric Learning.
Warum generische Modelle bei Feinunterscheidung an Grenzen stoßen
Ein generisches Bildmodell ist robust und domänen-agnostisch - genau das verhindert aber die scharfe Trennung fast identischer Varianten. Bei der Zuordnung fotografierter Sammlerobjekte in einem großen Katalog sättigen generische Ähnlichkeitswerte und liefern kein brauchbares Vertrauenssignal. Ein aufgabenspezifisch trainierter Kopf schafft hier die nötige Trennschärfe: In einem realen Projekt stieg die Trefferquote selbst auf im Training nie gesehenen Objektklassen deutlich an.
Typische Anwendungen
- Katalog- und Objekterkennung: Ein fotografiertes Objekt automatisch dem richtigen Katalogeintrag zuordnen.
- Visuelle Suche: Ähnliche Produkte oder Motive per Bild finden statt per Text.
- Qualitäts- und Dublettenprüfung: Nahezu gleiche Aufnahmen erkennen und zusammenführen.
Computer Vision bei Elasticbrains
Bei Elasticbrains bauen wir Bilderkennung auf selbstüberwachten Backbones auf und ergänzen sie um trainierte Köpfe, wo Feinunterscheidung gefragt ist - datenschutzfreundlich on premise. Wie wir Bildmodelle auf Ihre Objekte anpassen, zeigen wir auf unserer Leistungsseite KI-Modelle anpassen.
Weitere Glossarbegriffe
Künstliche Intelligenz (KI)
Teilgebiet der Informatik, das sich mit der Automatisierung intelligenten Verhaltens und dem maschinellen Lernen befasst.
Agentic Coding – KI-gestützte Softwareentwicklung mit autonomen Agenten
Agentic Coding ist der professionelle Ansatz der KI-gestützten Softwareentwicklung, bei dem autonome KI-Agenten eigenständig planen, implementieren und testen. Der Mensch steuert als Architekt und Reviewer. Durch CLAUDE.md, Context Engineering, Memory Files und MCP-Integration entsteht ein strukturierter Workflow, der reproduzierbare Ergebnisse und höhere Entwicklungsgeschwindigkeit ermöglicht – unterstützt von modernen KI-Coding-Assistenten wie Claude Code, Cursor oder Windsurf.
Vektordatenbank - Ähnlichkeitssuche in Millionen Objekten
Eine Vektordatenbank speichert Embeddings und findet in Sekunden die ähnlichsten Einträge zu einer Anfrage. Verfahren wie HNSW machen die Nächste-Nachbarn-Suche auch bei Millionen Objekten schnell. Sie ist das Rückgrat von semantischer Suche, Empfehlungen und RAG.