Guide
Context Window: Warum lange Prompts scheitern
Ein Context Window ist ein hartes Token-Budget, keine unverbindliche Empfehlung — und der Fehlerfall bei Überschreitung ist nicht immer eine Fehlermeldung.
By Buğra SözeriPublished
Jedes gehostete große Sprachmodell hat eine feste Obergrenze, wie viele Token es in einem Aufruf lesen kann: das Context Window. Das klingt nach einer einfachen Grenze — bleiben Sie darunter, ist alles gut —, doch zwei Dinge daran bringen fast jeden ins Straucheln, der auf einer API aufbaut: was tatsächlich zur Zahl zählt, und was passiert, sobald man sie überschreitet. Sie können genau prüfen, wie ein gegebener Prompt bei jedem wichtigen Modell-Fenster ankommt, mit dem Context-Window-Visualizer.
Was zur Fensterzählung zählt
Alles, was das Modell liest, bevor es zu schreiben beginnt, zählt: der Systemprompt, jede vorherige Runde eines mehrstufigen Gesprächs, an das Modell übergebene Tool- und Funktionsschemata, abgerufene Dokumente in einer RAG-Pipeline, und die letzte Nutzernachricht. Nichts davon ist optional oder kostenlos — ein langer Systemprompt, der bei jedem Aufruf einer Chat-App wiederholt wird, ist eine häufige, leicht übersehene Quelle für Überlauf, weil er in der Oberfläche unsichtbar ist, aber bei jeder einzelnen Anfrage vollständig erneut gesendet wird.
Der Output wird separat abgerechnet und begrenzt, mit einer eigenen Obergrenze, die meist deutlich kleiner ist als das Context Window selbst. Ein Modell mit sehr großem Context Window kann pro Antwort trotzdem nur eine bescheidene Anzahl Token ausgeben — die beiden Zahlen beantworten unterschiedliche Fragen und sollten nicht verwechselt werden.
Was bei Überlauf tatsächlich passiert
Der Fehlerfall ist nicht bei allen Anbietern einheitlich, was mit ein Grund ist, warum er in Produktion leicht falsch gehandhabt wird:
- Harte Ablehnung. Die meisten direkten API-Aufrufe, die das dokumentierte Token-Limit überschreiten, geben eine explizite Fehlermeldung zurück, die die Token-Anzahl der Anfrage dem Limit des Modells gegenüberstellt. Das ist der sicherste Fehlerfall, weil er laut und sofort sichtbar ist.
- Stille Kürzung.Manche Client-Wrapper und Chat-Oberflächen entfernen stattdessen die ältesten Nachrichten aus dem Konversationsverlauf, damit der nächste Aufruf passt, ohne anzuzeigen, dass etwas entfernt wurde. Das Modell antwortet dann so, als hätte es den entfernten Kontext nie gesehen — was so aussehen kann, als würde das Modell Anweisungen oder Fakten “vergessen”, die tatsächlich still gekürzt wurden.
Keinen der beiden Fehlerfälle möchte man in der Produktion entdecken. Den Prompt vor dem Senden gegen das Fenster zu vermessen — oder diese Prüfung in die eigene Pipeline einzubauen — ist die zuverlässigere Gewohnheit, und genau das macht der Context-Window-Visualizer für einen eingefügten Prompt: Er zeigt den Füllstand pro Modell an und markiert rot, sobald Sie über rund 80 % Auslastung liegen.
Hineinpassen ist nicht dasselbe wie gut gelesen werden
Ein Prompt, der bequem in das Fenster passt, kann trotzdem schlechtere Antworten liefern als ein kürzerer. Unabhängige Long-Context-Forschung hat einen “Lost in the Middle”-Effekt dokumentiert: Modelle erinnern Informationen nahe Anfang oder Ende eines langen Prompts zuverlässiger als Informationen, die in der Mitte vergraben sind, selbst wenn der gesamte Prompt deutlich unter dem Token-Limit liegt. Das ist kein Fehler eines einzelnen Anbietermodells — er zeigt sich über Architekturen hinweg und ist eine Eigenschaft davon, wie Aufmerksamkeit bei sehr langen Sequenzen abnimmt.
Die praktische Folgerung: Behandeln Sie “Passt es hinein” und “Nutzt das Modell es wirklich gut” als zwei getrennte Fragen. Bei retrieval-lastigen Workloads übertrifft oft eine kleinere Menge gut gewählter Textabschnitte, platziert nahe den Rändern des Prompts, einen maximalen Dump, der zwar technisch hineinpasst, die wichtige Passage aber in der Mitte vergräbt.
Token ohne vollständigen Tokenizer abschätzen
Für eine schnelle Größenabschätzung reichen etwa 4 Zeichen pro Token bei englischem Fließtext und eher 3,5 bei dichtem Code als Planungsgrundlage — genau diese Faustregel nutzen sowohl der Token-Zähler als auch der Visualizer. Für eine Zahl, auf die Sie sich vor dem Livegang verlassen können — oder bevor Sie eine Kostenschätzung absegnen —, führen Sie denselben Text durch den eigenen Tokenizer des jeweiligen Anbieters, denn verschiedene Anbieter nutzen unterschiedliche Tokenisierungsverfahren, und die exakte Zählung unterscheidet sich zwischen ihnen selbst bei identischem Text. Sobald Sie die Token-Anzahl kennen, verwandelt sie der LLM-Kostenrechner in einen Preis pro Aufruf.
Frequently asked questions
- Was genau ist ein Context Window?
- Die maximale Anzahl an Input-Token, die ein Modell in einem einzigen Aufruf lesen kann — Systemprompt, Konversationsverlauf, Tool-Definitionen, abgerufene Dokumente und die letzte Nutzernachricht zählen alle dazu. Es ist getrennt vom Output-Limit, das begrenzt, wie viele Token das Modell in seiner Antwort erzeugen kann.
- Was passiert, wenn mein Prompt das Context Window überschreitet?
- Das hängt vom Anbieter ab. Die meisten APIs lehnen die Anfrage direkt mit einer Fehlermeldung ab, die Token-Anzahl und Limit nennt. Manche Client-Bibliotheken oder Chat-Oberflächen kürzen stattdessen still die ältesten Runden eines Gesprächs, um Platz zu schaffen — dabei können unbemerkt Anweisungen oder Kontext verloren gehen, die das Modell brauchte. Das ist oft schlimmer als eine Fehlermeldung, weil nichts anzeigt, dass es passiert ist.
- Garantiert die Nutzung von weniger als dem vollen Fenster ein gutes Ergebnis?
- Nein. In das Fenster zu passen bedeutet nur, dass das Modell technisch alles lesen kann — nicht, dass es alles gleich gut beachtet. Forschung zu Long-Context-Modellen dokumentiert einen „Lost in the Middle“-Effekt: Informationen in der Mitte eines langen Prompts werden weniger zuverlässig abgerufen als Informationen am Anfang oder Ende, selbst deutlich unterhalb des Token-Limits.
- Wie zähle ich Token, bevor ich eine Anfrage sende?
- Grob gilt: englischer Fließtext hat etwa 4 Zeichen pro Token, dichter Code eher 3,5 — genug für eine Größenabschätzung. Für eine exakte Zahl nutzen Sie den eigenen Tokenizer des Modellanbieters (OpenAIs tiktoken, Anthropics count-tokens-Endpunkt, Googles count_tokens) — verschiedene Anbieter nutzen unterschiedliche Tokenizer, daher ergibt derselbe Text bei verschiedenen Modellen unterschiedliche exakte Zählungen.
Sources & references
Authoritative references cited by this piece. Verified by Buğra Sözeri on the dates shown and re-checked at every deploy.
- OpenAI — Models reference — Veröffentlichte Context-Window- und Max-Output-Token-Limits je Modell(as of )
- Anthropic — Models overview — Context-Window- und Output-Limits der Claude-Modelle(as of )
- Liu et al. — Lost in the Middle: How Language Models Use Long Contexts — Peer-reviewte Quelle für den Effekt schlechterer Erinnerung in der Mitte langer Prompts(as of )
Related
Published September 25, 2026