Token-Kosten
Sprachmodelle rechnen pro Token ab - der kleinsten Verarbeitungseinheit von Text. Token-Kosten entstehen getrennt für Input- und Output-Token, wobei Ausgabe-Token oft teurer sind. Wer versteht, wie Token-Overhead durch Kontext, System-Prompts und Agentenschritte entsteht, kann die Kosten gezielt senken.
Token-Kosten sind der zentrale Abrechnungsfaktor bei der Nutzung von Sprachmodellen. Ein Token ist die kleinste Verarbeitungseinheit von Text, mit der ein Modell arbeitet - grob ein Wortteil, manchmal ein ganzes kurzes Wort, ein Satzzeichen oder eine Silbe. Bevor ein Modell einen Text verarbeitet, zerlegt es ihn in solche Token; jeder davon geht in die Berechnung ein.
Anbieter von Sprachmodellen rechnen pro Token ab, meist getrennt nach zwei Arten: Input-Token (der gesamte Prompt inklusive Kontext, den das Modell liest) und Output-Token (die Antwort, die das Modell erzeugt). Output-Token sind bei vielen Modellen deutlich teurer als Input-Token, weil die Generierung aufwendiger ist als das Einlesen.
Token-Overhead: warum es fast nie bei der Nutzereingabe bleibt
Ein häufiges Missverständnis ist, dass nur der sichtbare Text der Nutzerfrage bezahlt wird. Tatsächlich erzeugen KI-Agenten und lange Kontexte ein Vielfaches an Token gegenüber der reinen Eingabe - und jedes einzelne wird abgerechnet. Zu diesem Token-Overhead gehören:
- System-Prompts: feste Anweisungen, die dem Modell bei jeder Anfrage erneut mitgegeben werden.
- Tool-Definitionen: Beschreibungen der Werkzeuge, die ein Agent aufrufen darf, oft mehrere hundert Token pro Werkzeug.
- Zwischenschritte: Agenten arbeiten iterativ - jeder Denk- und Aufrufschritt liest den bisherigen Verlauf erneut ein.
- Gesprächshistorie: frühere Nachrichten wandern in jeden neuen Aufruf mit, damit der Zusammenhang erhalten bleibt.
Wie viel davon möglich ist, begrenzt das Context Window - der maximale Umfang an Token, den ein Modell pro Anfrage verarbeiten kann. Je voller dieses Fenster genutzt wird, desto höher fallen die Input-Token-Kosten aus.
Hebel zur Senkung der Token-Kosten
- Kontext kompakt halten: nur wirklich benötigte Dokumente und Verlaufsteile mitgeben, statt den gesamten Verlauf zu wiederholen; lange Historien zusammenfassen statt vollständig einzuspeisen.
- Kürzere System-Prompts: Anweisungen prägnant formulieren - was bei jeder Anfrage mitläuft, zahlt sich vielfach aus.
- Output begrenzen: über einen Parameter wie
max_tokensdie Länge der Antwort deckeln, damit teure Ausgabe-Token nicht unnötig anfallen. - Wiederkehrende Teile per Prompt Caching wiederverwenden: stabile Blöcke wie System-Prompt oder Wissensbasis werden zwischengespeichert und beim nächsten Aufruf günstiger verrechnet.
Einordnung in die Kostenoptimierung
Token-Kosten sind der Baustein, über den fast jede andere Kostengröße definiert ist. Sie sind ein Kernthema der LLM-Kostenoptimierung, die Prompt-Aufbau, Modellwahl und Caching zusammen betrachtet. Die tatsächlichen Betriebskosten pro Anfrage fasst der Begriff Inferenzkosten - dort schlagen Token-Kosten unmittelbar durch. Wer sie strukturiert reduzieren will, findet auf unserer Leistungsseite KI-Kosten-Optimierung das passende Vorgehen.
Weiterführende Ressourcen
- Glossar: LLM-Kostenoptimierung, Prompt Caching, Context Window, Inferenzkosten
- Leistung: KI-Kosten-Optimierung
Weitere Glossarbegriffe
Prompt Engineering - Effektive Kommunikation mit KI
Prompt Engineering ist die Kunst, effektive Anweisungen für KI-Modelle zu formulieren, um optimale Ergebnisse zu erzielen. Techniken wie Zero-Shot, Few-Shot und Chain-of-Thought verbessern die Ausgabequalität systematisch. Die Disziplin - auch bekannt als Prompt Design oder KI-Anweisungs-Design - ist zentral für den Einsatz von LLMs in Texterstellung, Code-Generierung, Datenextraktion und Unternehmensanwendungen.
Kontextfenster (Context Window): Das Kurzzeitgedächtnis von KI-Modellen erklärt
Kontextfenster (Context Window): die maximale Token-Menge, die ein KI-Modell gleichzeitig verarbeiten kann. Wie viel Text ein LLM auf einmal sieht - erklärt.
Computer Vision - wie Maschinen Bilder verstehen
Computer Vision ist das Teilgebiet der KI, das Maschinen das Sehen beibringt: Bilder klassifizieren, Objekte finden, ähnliche Aufnahmen vergleichen. Moderne, selbstüberwacht vortrainierte Bildmodelle liefern die Grundlage - für Katalogerkennung ebenso wie für die Feinunterscheidung nahezu identischer Objekte.