Knowledge Distillation - Wissen ins kleine Modell überführen
Knowledge Distillation überführt das Können eines großen Lehrer-Modells in ein kleines Schüler-Modell. Das senkt Inferenzkosten bei ähnlicher Qualität.
Knowledge Distillation - auf Deutsch Modell-Destillation oder Wissensdestillation - ist ein Verfahren, mit dem das Können eines großen, leistungsfähigen Modells in ein deutlich kleineres überführt wird. Das große Modell übernimmt dabei die Rolle des Lehrers, das kleine die des Schülers. Der Schüler lernt nicht nur aus den richtigen Endantworten, sondern imitiert das Verhalten des Lehrers - und erreicht so auf seiner geringen Größe eine Qualität, die ein gleich kleines, allein trainiertes Modell selten erreicht.
Lehrer und Schüler
Der Ablauf folgt einer klaren Logik:
- Lehrer-Modell: Ein großes, oft teures Modell, das die Aufgabe bereits gut beherrscht, aber im Betrieb entsprechend viel kostet.
- Schüler-Modell: Ein kompaktes Modell, das lernt, die Ausgaben des Lehrers nachzubilden - nicht nur die finale Antwort, sondern auch dessen abgestufte Einschätzungen.
- Ergebnis: Ein kleines Modell, das für den konkreten Aufgabenbereich nahe an den Lehrer heranreicht, aber sparsamer läuft.
Warum destilliert wird: Kosten senken
Der Hauptgrund ist Wirtschaftlichkeit. Ein kleineres Modell verursacht geringere Inferenzkosten je Anfrage, antwortet schneller und lässt sich leichter im Eigenbetrieb hosten. Damit ist Knowledge Distillation ein Baustein der LLM-Kostenoptimierung: Man nutzt ein großes Modell einmalig, um einen günstigen Spezialisten zu erzeugen, statt im Dauerbetrieb für jede Anfrage das teure Modell zu bezahlen.
Abgrenzung zu Quantisierung
Distillation wird gern mit Quantisierung verwechselt, verfolgt aber einen anderen Weg. Quantisierung verkleinert ein bestehendes Modell, indem sie die Zahlengenauigkeit seiner Gewichte reduziert - das Modell bleibt dasselbe, nur kompakter gespeichert. Distillation dagegen erzeugt ein neues, eigenständiges Modell, das vom großen lernt. Beide Verfahren lassen sich kombinieren: erst destillieren, dann das Ergebnis quantisieren, um die Kosten weiter zu drücken.
Knowledge Distillation bei Elasticbrains
Wir prüfen, ob sich ein teures Modell für Ihren Anwendungsfall in einen günstigen Spezialisten destillieren lässt, und wägen es gegen Alternativen wie Quantisierung oder Model Routing ab. Wie daraus eine spürbar niedrigere KI-Rechnung wird, zeigen wir auf unserer Leistungsseite KI-Kosten-Optimierung.
Häufige Fragen
Was ist Knowledge Distillation?
Wozu dient Knowledge Distillation?
Was ist der Unterschied zwischen Distillation und Quantisierung?
Was sind Lehrer- und Schüler-Modell?
Weitere Glossarbegriffe
LLM-Observability
LLM-Observability überwacht LLM-Systeme: Kosten, Token-Verbrauch, Latenz, Qualität und Tracing. Kern ist die Kostenattribution - was treibt das Budget?
Künstliche Intelligenz (KI)
Teilgebiet der Informatik, das sich mit der Automatisierung intelligenten Verhaltens und dem maschinellen Lernen befasst.
RAG (Retrieval Augmented Generation) - Wissen statt Halluzination
RAG verbindet ein Sprachmodell mit einer Wissensquelle: passende Dokumente werden als Kontext mitgegeben - gegen Halluzinationen und veraltetes Wissen.
Bereit, das in die Praxis zu bringen?
Lassen Sie uns in einem kostenlosen Erstgespräch über Ihr Vorhaben sprechen - unverbindlich und konkret.