Embeddings - Vektoren als Bedeutungs-Fingerabdruck

Ein Embedding ist die Übersetzung von Text oder Bild in einen Vektor - eine Zahlenfolge, die Bedeutung als Position im Raum abbildet. Ähnliche Inhalte liegen nah beieinander, unähnliche weit entfernt. Embeddings sind die Grundlage für Ähnlichkeitssuche, Empfehlungen und RAG.

Kategorie:KI & Machine Learning

Ein Embedding ist die Übersetzung eines Inhalts - eines Wortes, eines Satzes, eines Bildes - in einen Vektor, also eine Folge von Zahlen. Dieser Vektor ist eine Art Bedeutungs-Fingerabdruck: Er bildet nicht die Buchstaben oder Pixel ab, sondern den Inhalt. Modelle lernen, ähnliche Dinge auf nahe beieinanderliegende Punkte abzubilden und unähnliche weit auseinander.

Damit wird Bedeutung rechenbar. Statt Texte oder Bilder direkt zu vergleichen, vergleicht man ihre Vektoren - und kann so in Sekunden feststellen, welche Inhalte inhaltlich verwandt sind.

Text-Embeddings und Bild-Embeddings

  • Text-Embeddings: Ein Sprachmodell wandelt Wörter, Sätze oder ganze Dokumente in Vektoren um. Zwei Formulierungen mit gleichem Sinn landen nah beieinander, auch wenn sie kein einziges Wort teilen.
  • Bild-Embeddings: Ein Bildmodell erzeugt aus einer Aufnahme einen Vektor, der Form, Struktur und Motiv erfasst. Zwei Fotos desselben Objekts liegen nah beieinander, unabhängig von Beleuchtung oder Ausschnitt.
  • Multimodale Embeddings: Manche Modelle bilden Text und Bild in denselben Raum ab, sodass man mit Text nach Bildern suchen kann.

Ähnlichkeit per Cosinus

Der gängigste Weg, zwei Embeddings zu vergleichen, ist die Cosinus-Ähnlichkeit: Sie misst den Winkel zwischen zwei Vektoren. Ein Wert nahe 1 bedeutet sehr ähnlich, ein Wert nahe 0 bedeutet unverwandt. Diese Zahl ist die Basis für Ähnlichkeitssuche, Empfehlungssysteme, Duplikaterkennung und Clustering.

Wo generische Embeddings an Grenzen stoßen

Generische Embedding-Modelle sind robust und breit einsetzbar - genau das wird zum Problem, wenn es um Feinunterscheidung nahezu identischer Objekte in einem großen Katalog geht. Dann sättigen die Ähnlichkeitswerte:

  • Selbst deutlich verschiedene Varianten erhalten durchweg sehr hohe, kaum unterscheidbare Werte - die Skala liefert kein brauchbares Vertrauenssignal mehr.
  • In einem realen Test bewertete eine generische Embedding-API sogar die falsche Zuordnung höher als die richtige.

Der Grund: Genau die Domänen-Agnostik, die ein generisches Modell robust macht, verhindert die scharfe Trennung fast identischer Varianten. Wer diese Trennschärfe braucht, kommt an angepassten Embeddings nicht vorbei - etwa durch Metric Learning oder Fine-Tuning eines aufgesetzten Kopfes.

Wie Embeddings gespeichert und durchsucht werden

Embeddings werden in einer Vektordatenbank abgelegt. Bei einer Anfrage wird die Suche selbst zum Embedding, und die Datenbank findet per Nächste-Nachbarn-Suche die ähnlichsten Einträge. Dieses Prinzip trägt auch RAG, wo relevante Dokumente für ein Sprachmodell zusammengesucht werden.

Typische Anwendungen

  • Semantische Suche: Finden nach Bedeutung statt nach exakten Stichwörtern.
  • Empfehlungen: Ähnliche Produkte, Artikel oder Objekte vorschlagen.
  • Zuordnung und Abgleich: Ein fotografiertes Objekt dem passenden Katalogeintrag zuordnen.
  • RAG: Relevantes Wissen für ein Sprachmodell bereitstellen.

Embeddings bei Elasticbrains

Bei Elasticbrains bauen wir Suche und Zuordnung auf Embeddings auf - und passen die zugrundeliegenden Modelle an, wenn generische Vektoren zu unscharf sind. Wie wir Embeddings für Ihre Daten scharf stellen, zeigen wir auf unserer Leistungsseite KI-Modelle anpassen.