Prompt Caching - LLM-Kosten für wiederkehrende Kontexte senken
Prompt Caching speichert gleichbleibende Prompt-Teile zwischen und verwendet sie über viele Anfragen wieder - gecachte Token sind deutlich günstiger.
Prompt Caching (auch Kontext-Caching) ist eine Technik, bei der gleichbleibende Teile eines Prompts über mehrere Anfragen hinweg zwischengespeichert und wiederverwendet werden - statt sie jedes Mal neu zu verarbeiten und zu bezahlen. Betroffen sind vor allem lange, stabile Bausteine: ein umfangreicher System-Prompt, feste Kontextdokumente oder wiederkehrende Beispiele.
Ohne Caching verarbeitet ein Sprachmodell bei jeder Anfrage den gesamten Eingabetext neu, auch die identischen Teile. Genau hier setzt Prompt Caching an: Der stabile Präfix wird einmal verarbeitet, sein interner Zustand gespeichert und bei der nächsten Anfrage direkt weiterverwendet. Das spart Rechenaufwand und senkt die Token-Kosten.
Bei den Anbietern sind zwischengespeicherte (gecachte) Kontext-Token deutlich günstiger abgerechnet als neu verarbeitete Eingabe-Token. Der Effekt wächst mit der Länge des wiederholten Präfixes und der Häufigkeit der Wiederverwendung.
Wie Prompt Caching funktioniert
- Stabiler Präfix: Der wiederkehrende Anfang des Prompts (System-Prompt, Wissensdokumente, Few-Shot-Beispiele, Agenten-Kontext) wird als cachefähiger Block markiert.
- Cache-Write: Beim ersten Durchlauf wird der Block verarbeitet und zwischengespeichert. Ein Cache-Write kann etwas teurer sein als eine normale Verarbeitung.
- Cache-Read: Bei folgenden Anfragen mit demselben Präfix wird der gespeicherte Zustand gelesen - günstiger und schneller.
- Amortisation: Der einmalige Aufpreis für den Cache-Write rechnet sich, sobald der Präfix mehrfach wiederverwendet wird.
Wann Prompt Caching greift
Der Hebel wirkt, wenn ein langer, stabiler Präfix sich über viele Anfragen wiederholt. Typische Situationen:
- Umfangreicher System-Prompt: Rollen, Regeln und Rahmenanweisungen, die bei jeder Anfrage identisch bleiben.
- Feste Kontextdokumente: Handbücher, Richtlinien oder Wissensbasen, die einer Konversation als Grundlage dienen.
- Few-Shot-Beispiele: Eine feste Sammlung von Musterfällen, die das Verhalten steuern.
- Agenten-Kontext: Werkzeugbeschreibungen und Verlauf, die ein Agent über viele Schritte hinweg mitführt.
Grenzen und Randbedingungen
Ein Cache hat eine begrenzte Lebensdauer (TTL): Wird der Präfix eine Weile nicht genutzt, verfällt der Eintrag und muss neu geschrieben werden. Der zwischengespeicherte Block muss zudem exakt identisch bleiben - schon kleine Änderungen am Präfix machen den Cache ungültig. Deshalb gehört das Stabile nach vorn, das Variable nach hinten. Anbieter wie Anthropic, OpenAI und Google unterstützen Prompt Caching; die konkrete Ausgestaltung (Preise, Mindestlängen, TTL) unterscheidet sich je nach Anbieter und ist mit dem verfügbaren Context Window abzuwägen.
Als Baustein einer durchdachten LLM-Kostenoptimierung ergänzt Prompt Caching andere Hebel und ist besonders bei wiederkehrenden Kontexten wirkungsvoll. Wie sich solche Maßnahmen im Zusammenspiel planen und umsetzen lassen, zeigen wir auf unserer Leistungsseite KI-Kosten-Optimierung - die Ausgaben für wiederholte Kontexte liegen dann oft nur bei einem Bruchteil der ungecachten Kosten.
Häufige Fragen
- Was ist Prompt Caching?
- Eine Technik, die gleichbleibende Teile eines Prompts zwischenspeichert und über mehrere Anfragen wiederverwendet, statt sie jedes Mal neu zu verarbeiten und zu bezahlen.
- Warum senkt Prompt Caching die Kosten?
- Gecachte Kontext-Token werden von den Anbietern deutlich günstiger abgerechnet als neu verarbeitete Eingabe-Token. Je länger und häufiger der wiederholte Präfix, desto größer die Ersparnis.
- Für welche Fälle eignet es sich?
- Für lange, stabile Präfixe, die sich über viele Anfragen wiederholen - etwa umfangreiche System-Prompts, feste Wissensdokumente, Few-Shot-Beispiele oder Agenten-Kontext.
Weiterführende Ressourcen
- Glossar: LLM-Kostenoptimierung, Token-Kosten, Context Window
- Leistung: KI-Kosten-Optimierung
Häufige Fragen
Was ist Prompt Caching?
Warum senkt Prompt Caching die Kosten?
Für welche Fälle eignet es sich?
Wie lange bleibt ein Cache gültig?
Weitere Glossarbegriffe
Metric Learning - Ähnlichkeit gezielt lernen
Metric Learning bringt einem Modell bei, Ähnlichkeit zu bewerten: gleiche Objekte liegen im Vektorraum nah, verschiedene weit entfernt - für Trennschärfe.
Agentic Engineering - Die neue Disziplin der KI-Softwareentwicklung
Agentic Engineering ist die Ingenieurdisziplin der Orchestrierung von KI-Agenten. Der Mensch agiert als Architekt und Quality Gate, KI-Agenten planen autonom.
CLAUDE.md - Project Instructions für KI-gestützte Entwicklung
CLAUDE.md ist eine Projektdatei, die automatisch in jede Claude Code Sitzung geladen wird und projektspezifische Regeln für KI-Assistenten definiert.
Bereit, das in die Praxis zu bringen?
Lassen Sie uns in einem kostenlosen Erstgespräch über Ihr Vorhaben sprechen - unverbindlich und konkret.