Guide
Bağlam Penceresine Sığdırma Rehberi
Bağlam penceresi, gevşek bir öneri değil, katı bir token bütçesidir — ve onu aştığınızda ortaya çıkan hata her zaman bir hata mesajı olarak görünmez.
By Buğra SözeriPublished
Barındırılan her büyük dil modelinin, tek bir çağrıda kaç token okuyabileceğine dair sabit bir üst sınırı vardır: bağlam penceresi. Basit bir limit gibi görünür — altında kalın, sorun yok — ama onunla ilgili iki şey, bir API’nin üzerine bir şeyler inşa eden hemen herkesi tökezletir: sayıya gerçekte neyin dahil olduğu ve onu aştığınızda ne olduğu. Belirli bir promptun her büyük modelin penceresine tam olarak nasıl oturduğunu bağlam penceresi görselleştiricisiyle kontrol edebilirsiniz.
Pencereye neler dahildir
Modelin yazmaya başlamadan önce okuduğu her şey sayılır: sistem promptu, çok turlu bir konuşmadaki her önceki tur, modele geçirilen araç ve fonksiyon çağrısı şemaları, bir RAG hattındaki alınan belgeler ve en son kullanıcı mesajı. Bunların hiçbiri isteğe bağlı veya bedava değildir — bir sohbet uygulamasında her çağrıda tekrar gönderilen uzun bir sistem promptu, yaygın ve gözden kaçması kolay bir taşma kaynağıdır, çünkü arayüzde görünmez ama her tek istekte tam olarak yeniden gönderilir.
Çıkış ayrı olarak faturalandırılır ve sınırlandırılır; genellikle bağlam penceresinin kendisinden çok daha küçük kendi üst sınırına sahiptir. Çok büyük bir bağlam penceresi reklam eden bir model, yine de yanıt başına yalnızca mütevazı sayıda token üretebilir — iki rakam farklı soruları yanıtlar ve karıştırılmamalıdır.
Taşmada gerçekte ne olur
Hata modu sağlayıcılar arasında tek tip değildir; bu, üretimde yanlış anlaşılmasının kolay olmasının bir nedenidir:
- Sert red. Belgelenen token limitini aşan doğrudan API çağrılarının çoğu, isteğin token sayısını modelin limitine karşı belirten açık bir hata döndürür. Bu en güvenli hata modudur çünkü gürültülü ve anındadır.
- Sessiz kesme. Bazı istemci sarmalayıcıları ve sohbet arayüzleri, bir sonraki çağrının sığması için konuşma geçmişinden en eski mesajları düşürür; hiçbir şeyin kaldırıldığını göstermeden. Model daha sonra düşürülen bağlamı hiç görmemiş gibi yanıt verir — bu, modelin aslında sessizce kesilmiş talimatları veya gerçekleri “unutması” gibi görünebilir.
Bu iki hata modundan hiçbirini üretimde keşfetmek istemezsiniz. Promptu göndermeden önce pencereye karşı boyutlandırmak — veya kontrolü hattınıza yerleştirmek — daha güvenilir bir alışkanlıktır ve bağlam penceresi görselleştiricisinin yapıştırılan bir prompt için tam olarak yaptığı şey budur: model başına doluluk yüzdesini gösterir ve kullanım yaklaşık %80’i geçtiğinde kırmızıya döner.
Sığmak, iyi okunmakla aynı şey değildir
Pencereye rahatça sığan bir prompt, daha kısa bir promptdan daha kötü yanıtlar üretebilir. Bağımsız uzun bağlam araştırmaları “ortada kaybolma” etkisini belgelemiştir: modeller, tüm prompt token limitinin oldukça altında olsa bile, uzun bir promptun başına veya sonuna yakın yerleştirilen bilgiyi ortasına gömülü bilgiden daha güvenilir biçimde hatırlar. Bu tek bir satıcının modelinde bir hata değildir — mimariler arasında ortaya çıkar ve dikkatin çok uzun dizilerde nasıl bozulduğunun bir özelliğidir.
Pratik çıkarım: “sığıyor mu” ile “model gerçekten iyi kullanacak mı” sorularını ayrı iki soru olarak ele alın. Alım-ağırlıklı iş yükleri için, promptun kenarlarına yerleştirilmiş daha küçük, iyi seçilmiş bir yığın parça, teknik olarak sığan ama önemli pasajı ortada gömen maksimum bir dökümden genellikle daha iyi performans gösterir.
Tam bir tokenizer olmadan token tahmini
Hızlı boyutlandırma için, İngilizce düzyazıda token başına yaklaşık 4 karakter, yoğun kodda ise 3,5 karaktere yakın bir değer plan yapmak için yeterince yakındır — bu sezgisel kural token sayacının ve görselleştiricinin ikisinin de kullandığı yöntemdir. Yayına almadan önce — veya bir maliyet tahminini onaylamadan önce — güvenebileceğiniz bir rakam için aynı metni satıcının kendi tokenizer’ından geçirin, çünkü farklı satıcılar farklı tokenizasyon şemaları kullanır ve tam sayı aynı metin için bile aralarında farklılık gösterir. Token sayısını öğrendikten sonra, LLM maliyet hesaplayıcı bunu çağrı başına bir fiyata dönüştürür.
Frequently asked questions
- Bağlam penceresi tam olarak nedir?
- Bir modelin tek bir çağrıda okuyabileceği maksimum giriş token sayısıdır — sistem promptu, konuşma geçmişindeki her tur, modele geçirilen araç/fonksiyon şemaları, alınan belgeler ve en son kullanıcı mesajının tümü bu sayıya dahildir. Modelin yanıtında kaç token üretebileceğini sınırlayan çıkış limitinden ayrıdır.
- Promptum bağlam penceresini aşarsa ne olur?
- Sağlayıcıya bağlıdır. Çoğu API, token sayısını ve limiti belirten bir hatayla isteği doğrudan reddeder. Bazı istemci kütüphaneleri veya sohbet arayüzleri ise yer açmak için konuşmanın en eski turlarını sessizce keser; bu, modelin ihtiyaç duyduğu talimatları veya bağlamı sessizce düşürebilir — genellikle bir hatadan daha kötüdür, çünkü bunun olduğunu size hiçbir şey söylemez.
- Pencerenin tamamından azını kullanmak iyi bir çıktı garanti eder mi?
- Hayır. Pencereye sığmak yalnızca modelin teknik olarak her şeyi okuyabildiği anlamına gelir — hepsine eşit derecede iyi dikkat ettiği anlamına gelmez. Uzun bağlamlı modeller üzerine yapılan araştırmalar 'ortada kaybolma' etkisini belgelemiştir: uzun bir promptun ortasına yerleştirilen bilgi, token limitinin oldukça altında olsa bile, başta veya sonda yer alan bilgiye göre daha az güvenilir biçimde hatırlanır.
- İsteği göndermeden önce token'ları nasıl sayarım?
- Kabaca, İngilizce düzyazı token başına ~4 karakter, yoğun kod ise ~3,5 karakter civarındadır; bu, boyutlandırma kararları için yeterlidir. Tam bir sayı için satıcının kendi tokenizer'ını kullanın (OpenAI'ın tiktoken'ı, Anthropic'in count-tokens uç noktası, Google'ın count_tokens'ı) — farklı satıcılar farklı tokenizer kullanır, bu yüzden aynı metin modeller arasında farklı tam sayılar üretir.
Sources & references
Authoritative references cited by this piece. Verified by Buğra Sözeri on the dates shown and re-checked at every deploy.
- OpenAI — Models reference — Model başına yayınlanmış bağlam penceresi ve maksimum çıkış token limitleri(as of )
- Anthropic — Models overview — Claude modelleri için bağlam penceresi ve çıkış limitleri(as of )
- Liu et al. — Lost in the Middle: How Language Models Use Long Contexts — Uzun bağlamlı promptlarda ortada bozulan hatırlama etkisi için hakemli kaynak(as of )
Related
Published September 25, 2026