Was kostet Deutsch?
KI-APIs rechnen pro Token ab — nicht pro Wort. Und deutscher Text zerfällt in mehr Token als bedeutungsgleicher englischer. Wir haben nachgemessen: Auf dem aktuellen OpenAI-Tokenizer kostet Deutsch rund +27.6%, auf dem älteren sogar +67.2%.
Bedeutungsgleicher deutscher Text zerfällt in +27.6% mehr Token als englischer (OpenAI o200k_base), auf dem älteren cl100k_base sogar +67.2%. Weil KI-APIs pro Token abrechnen, zahlen deutschsprachige Anwendungen diesen Aufschlag 1:1 als Mehrkosten. Am teuersten sind Finanzen-Texte (+55%); auf cl100k fast eine Verdopplung bei Marketing (+105.9%).
Was das für die Kosten bedeutet
Da APIs pro Token abrechnen, schlägt der Aufschlag 1:1 auf den Preis durch. Ein Prompt, der auf Englisch 1,00 € kostet, kostet mit demselben Inhalt auf Deutsch rund 1,28 € — allein durch die Tokenisierung, bei identischer Aussage. Wer viel auf Deutsch verarbeitet, zahlt dauerhaft mehr. Zu den Token-Preisen →
Warum Deutsch teurer ist
- — Komposita: „Rechtsschutzversicherung" ist ein Token-Wort, „legal expenses insurance" verteilt sich effizienter — deutsche Bandwurmwörter zerfallen in viele Subwort-Token.
- — Umlaute & ß: ä, ö, ü, ß sind in den Vokabularen seltener und werden häufiger in mehrere Token zerlegt.
- — Trainingsdaten: Die BPE-Vokabulare sind stark englischlastig — englische Wortstämme bekommen eigene Token, deutsche seltener.
- — Fortschritt: Der neuere o200k-Tokenizer hat Deutsch massiv verbessert (von +67.2% auf +27.6%). Das teuerste Register in unserer Messung war „Finanzen" (+55%).
Messung nach Register (o200k)
| Register | DE-Token | EN-Token | Aufschlag |
|---|---|---|---|
| Alltag | 24 | 20 | +20% |
| Software | 24 | 21 | +14.3% |
| Behörde | 30 | 20 | +50% |
| Nachrichten | 23 | 18 | +27.8% |
| E-Commerce | 30 | 23 | +30.4% |
| Gesundheit | 25 | 20 | +25% |
| Finanzen | 31 | 20 | +55% |
| Chat | 24 | 23 | +4.3% |
| Anleitung | 27 | 21 | +28.6% |
| Akademisch | 28 | 21 | +33.3% |
| Marketing | 24 | 17 | +41.2% |
| Support | 29 | 26 | +11.5% |
| Gesamt | 319 | 250 | +27.6% |
Methodik
Bedeutungsgleiche DE/EN-Textpaare über 12 Register, tokenisiert mit OpenAI o200k_base und cl100k_base. Aufschlag = (DE-Token / EN-Token − 1). Der Korpus umfasst 12 bedeutungsgleiche DE/EN-Textpaare quer über Alltag, Technik, Behörde, Nachrichten, Handel, Gesundheit, Finanzen und mehr. Gemessen mit OpenAI o200k_base und cl100k_base. Die Tokenizer von Anthropic und Google unterscheiden sich — Anthropic weist für seine neueren Modelle selbst einen anderen (token-intensiveren) Tokenizer aus. Der Deutsch-Aufschlag bleibt providerübergreifend bestehen, die genaue Höhe variiert.
Reproduzierbar: scripts/deutsch-token-check.mjs · Zitieren mit Quellenangabe „KI-Preis-Index".
Daten und Grafiken sind frei verwendbar unter CC BY 4.0 — mit Namensnennung und Link auf diese Seite:
KI-Preis-Index (Juli 2026): Deutsch-Token-Aufschlag. https://ki-preis-index.de/deutsch-token-aufschlagRedaktionen: Rohdaten und Rückfragen über die Kontaktangaben im Impressum.