Inferenz (KI): die Anwendungsphase eines trainierten Modells
Inferenz ist die Phase, in der ein fertig trainiertes KI-Modell angewendet wird und Vorhersagen oder Antworten erzeugt - abgegrenzt vom Training.
Inferenz bezeichnet die Anwendung eines fertig trainierten KI-Modells: Das Modell nimmt eine Eingabe entgegen und erzeugt daraus eine Vorhersage oder Antwort. Sie ist von der vorgelagerten Trainingsphase zu unterscheiden, in der das Modell aus Daten überhaupt erst seine Parameter lernt. Bei einer LLM-Anwendung ist Inferenz der Moment, in dem aus einem Prompt Text entsteht - jedes Mal, wenn ein Nutzer eine Anfrage stellt.
Training vs. Inferenz
Beide Phasen sind rechenintensiv, aber grundverschieden in Häufigkeit und Kostenprofil:
- Training: Das Modell lernt aus großen Datenmengen und passt seine Gewichte an. Das geschieht einmalig (oder in Intervallen beim Nachtrainieren) und ist sehr rechenaufwendig.
- Inferenz: Das fertige Modell wird angewendet. Das geschieht bei jeder einzelnen Anfrage erneut - im Produktivbetrieb also potenziell millionenfach.
Warum Inferenz die laufenden Kosten treibt
Weil Inferenz sich mit jeder Nutzung wiederholt, während das Training einmalig anfällt, dominieren die laufenden Inferenzkosten über die Lebensdauer einer Anwendung meist die Gesamtrechnung. Jede Anfrage verbraucht Rechenzeit - entweder abgerechnet pro Token über eine Managed-API oder als eigene GPU-Inferenz im Selbstbetrieb. Genau deshalb setzt die Kostenoptimierung von KI-Anwendungen vor allem an der Inferenz an, nicht am Training.
Hebel zur effizienteren Inferenz
Damit Inferenz nicht unnötig teuer wird, gibt es mehrere technische Ansätze:
- Quantisierung: kleinere Zahlenformate für die Modellgewichte senken Speicherbedarf und Rechenaufwand pro Anfrage.
- Batch-Inferenz: mehrere Anfragen werden gebündelt verarbeitet, um die Hardware besser auszulasten.
- Modellwahl: für einfache Aufgaben genügt ein kleineres, günstigeres Modell - das verteilt Model Routing automatisch.
Inferenz optimieren bei Elasticbrains
Wir analysieren, wo in einer KI-Anwendung die Inferenz die Kosten treibt, und setzen die passenden Hebel - von der Modellwahl über Quantisierung bis zum Batching. Inferenz ist der Ausgangspunkt jeder LLM-Kostenoptimierung. Wie wir das im Gesamtbild angehen, zeigen wir auf unserer Leistungsseite KI-Kosten optimieren lassen.
Häufige Fragen
Was ist Inferenz bei KI?
Was ist der Unterschied zwischen Training und Inferenz?
Warum treibt Inferenz die laufenden Kosten?
Wie macht man Inferenz günstiger?
Weitere Glossarbegriffe
Quantisierung: KI-Modelle mit geringerer Zahlengenauigkeit betreiben
Quantisierung reduziert die Zahlengenauigkeit von Modellgewichten (z. B. FP16 auf INT8 oder INT4), um Speicher und Rechenaufwand bei der Inferenz zu senken.
AI Evals (KI-Evaluierung) - KI-Anwendungen systematisch testen
AI Evals testen KI- und LLM-Anwendungen gegen ein definiertes Testset mit klaren Kriterien - warum Ausprobieren nicht reicht, Offline- vs. Online-Evals.
Coding Agent - Autonome KI-Systeme für die Softwareentwicklung
Ein Coding Agent ist ein autonomes KI-System, das selbständig programmiert: Dateien liest, Code schreibt, Tests ausführt und Git-Operationen durchführt.