Tokenisierung - wie ein LLM Text in Token zerlegt
Tokenisierung zerlegt Text in Token - die kleinen Einheiten, mit denen ein LLM rechnet. Ein Token ist meist ein Wortteil, kein ganzes Wort.
Ein Sprachmodell verarbeitet keinen Text im menschlichen Sinne, sondern Zahlen. Bevor eine Eingabe ein LLM überhaupt erreicht, wird sie deshalb in Token zerlegt - diesen Schritt nennt man Tokenisierung. Ein Token ist die kleinste Einheit, mit der das Modell arbeitet: mal ein ganzes kurzes Wort, oft aber nur ein Wortteil, eine Silbe oder ein Satzzeichen. Als grobe Faustregel entspricht ein Token im Deutschen und Englischen ungefähr einem Dreiviertelwort - lange oder seltene Wörter werden in mehrere Token gesplittet.
Warum nicht einfach Wörter?
Würde ein Modell mit ganzen Wörtern arbeiten, bräuchte es für jede denkbare Wortform einen eigenen Eintrag - unmöglich bei Millionen Varianten, Tippfehlern und Fremdsprachen. Token-Verfahren zerlegen den Text stattdessen in einen begrenzten, wiederverwendbaren Vorrat an Bausteinen. So kann das Modell auch nie gesehene Wörter aus bekannten Teilen zusammensetzen.
- Häufige Wörter bleiben oft ein einziges Token.
- Seltene oder zusammengesetzte Wörter zerfallen in mehrere Token - deutsche Komposita wie "Donaudampfschifffahrt" ergeben besonders viele.
- Leerzeichen und Satzzeichen sind ebenfalls Teil der Token.
Konzept, nicht Kosten - die Abgrenzung
Wichtig ist die Unterscheidung: Dieser Begriff erklärt das Konzept - wie und warum Text in Token zerlegt wird. Was die Verarbeitung dieser Token dann im Betrieb kostet, behandelt ein eigener Begriff: Token-Kosten. Denn API-Anbieter rechnen pro Token ab - Ein- und Ausgabe zusammen. Wie viele Token ein Text ergibt, ist damit direkt kostenrelevant, und die Inferenzkosten hängen unmittelbar an dieser Zählung.
Wo Tokenisierung überall greift
Die Tokenzahl bestimmt nicht nur die Kosten, sondern auch, wie viel Text überhaupt in das Kontextfenster passt - denn dessen Grenze wird in Token gemessen, nicht in Zeichen. Auch die Länge einer Antwort und die Verarbeitungsgeschwindigkeit hängen an der Zahl der Token. Tokenisierung ist damit ein unscheinbarer, aber grundlegender Baustein jeder LLM-Anwendung.
Tokenisierung bei Elasticbrains
Wer Token versteht, kann Prompts, Kontext und Modellwahl bewusst so gestalten, dass eine Anwendung effizient und bezahlbar bleibt. Genau hier setzen wir an: Wir analysieren den Tokenverbrauch Ihrer Anwendung und senken die laufenden Kosten. Mehr dazu auf unserer Leistungsseite KI-Kosten-Optimierung.
Häufige Fragen
Was ist ein Token bei einem LLM?
Was ist Tokenisierung?
Was ist der Unterschied zwischen Tokenisierung und Token-Kosten?
Warum arbeiten Modelle mit Token statt mit ganzen Wörtern?
Weitere Glossarbegriffe
A2A-Protokoll - wie KI-Agenten miteinander zusammenarbeiten
Das A2A- oder Agent-to-Agent-Protokoll ist ein Standard, über den KI-Agenten miteinander kommunizieren und Aufgaben gemeinsam lösen - anders als MCP.
Kontextfenster (Context Window): Das Kurzzeitgedächtnis von KI-Modellen erklärt
Kontextfenster (Context Window): die maximale Token-Menge, die ein KI-Modell gleichzeitig verarbeiten kann. Wie viel Text ein LLM auf einmal sieht - erklärt.
LoRA & QLoRA - ressourcenschonendes Fine-Tuning
LoRA und QLoRA sind ressourcenschonende Fine-Tuning-Methoden. Statt alle Gewichte anzupassen, trainieren sie nur kleine Zusatzmatrizen - günstig und schnell.
Bereit, das in die Praxis zu bringen?
Lassen Sie uns in einem kostenlosen Erstgespräch über Ihr Vorhaben sprechen - unverbindlich und konkret.