Inferenzkosten
Inferenzkosten sind die laufenden Kosten pro Anfrage, wenn ein trainiertes KI-Modell Antworten erzeugt - je nach Weg pro Token oder als eigene GPU-Kosten.
Inferenz bezeichnet die Anwendung eines fertig trainierten Modells zur Erzeugung einer Antwort - im Gegensatz zum Training, bei dem das Modell überhaupt erst entsteht. Inferenzkosten sind entsprechend die laufenden Kosten, die jede einzelne Anfrage im Betrieb verursacht. Während Trainingskosten einmalig anfallen, wiederholen sich Inferenzkosten mit jeder Nutzung und dominieren daher über die Lebensdauer einer LLM-Anwendung meist die Gesamtrechnung.
Zwei Grundmodelle
- API / Managed: Die Abrechnung erfolgt pro Token. Es ist keine eigene Infrastruktur nötig, dafür entstehen Stückkosten für jede Anfrage - je mehr Verkehr, desto höher die laufende Rechnung.
- Self-Hosting: Das Modell läuft auf eigener oder gemieteter GPU-/Compute-Infrastruktur. Die Kosten entstehen für die Hardware-Laufzeit, nicht pro Token. Bei hohem, gleichmäßigem Volumen können die Kosten pro Anfrage dadurch niedriger ausfallen als bei der API.
Hebel bei Self-Hosting
Wer selbst betreibt, senkt die Inferenzkosten vor allem über eine hohe GPU-Auslastung statt teurem Leerlauf. Konkrete Hebel:
- Batching / Continuous Batching: Mehrere Anfragen werden gebündelt und gemeinsam durch die GPU geschickt, statt jede einzeln zu verarbeiten.
- Quantisierung: Kleinere Zahlenformate (INT8, INT4) reduzieren Speicherbedarf und Rechenaufwand pro Anfrage.
- KV-Cache-Nutzung: Bereits berechnete Schlüssel-Wert-Paare werden wiederverwendet, statt sie neu zu berechnen.
- Auslastung: Hohe, gleichmäßige GPU-Auslastung senkt die Kosten pro Anfrage - Leerlauf ist die teuerste Betriebsart.
- Spot-Instanzen: Günstigere, unterbrechbare Cloud-Kapazität für Last, die Verzögerungen verkraftet.
API oder Self-Hosting - eine TCO-Frage
Die Entscheidung zwischen Managed-API und Eigenbetrieb ist eine Frage der Gesamtbetriebskosten (Total Cost of Ownership) und hängt von drei Größen ab: dem Anfragevolumen, der geforderten Latenz und dem Betriebsaufwand für Wartung, Skalierung und Bereitschaft. Erst ab einem bestimmten, gleichmäßigen Volumen lohnt sich der Eigenbetrieb - bei schwankender oder geringer Last bleibt die API meist günstiger, weil keine Hardware im Leerlauf mitbezahlt wird. Inferenzkosten sind ein zentraler Baustein der LLM-Kostenoptimierung; ergänzend verteilt Model Routing Anfragen auf unterschiedlich teure Modelle. Wie wir Inferenzkosten im Gesamtbild senken, zeigen wir auf unserer Leistungsseite KI-Kosten-Optimierung.
Weiterführende Ressourcen
- Glossar: LLM-Kostenoptimierung, Token-Kosten, Model Routing
- Leistung: KI-Kosten-Optimierung
Häufige Fragen
Was sind Inferenzkosten?
Was ist der Unterschied zu Trainingskosten?
API oder Self-Hosting - was ist günstiger?
Wie senkt man Inferenzkosten beim Self-Hosting?
Weitere Glossarbegriffe
KI-Halluzination - wenn ein Sprachmodell Fakten erfindet
Eine KI-Halluzination ist eine plausibel klingende, aber falsche Ausgabe eines Sprachmodells. Warum das passiert - und wie RAG und Guardrails gegensteuern.
ReAct-Agent (Reasoning + Acting) - Denken und Handeln verschränkt
ReAct verschränkt Reasoning und Acting: Ein KI-Agent denkt einen Schritt, ruft ein Werkzeug auf, wertet das Ergebnis aus und denkt weiter - in einer Schleife.
A2A-Protokoll - wie KI-Agenten miteinander zusammenarbeiten
Das A2A- oder Agent-to-Agent-Protokoll ist ein Standard, über den KI-Agenten miteinander kommunizieren und Aufgaben gemeinsam lösen - anders als MCP.
Bereit, das in die Praxis zu bringen?
Lassen Sie uns in einem kostenlosen Erstgespräch über Ihr Vorhaben sprechen - unverbindlich und konkret.