⚡ Önce özet
Moonshot Kimi K3-256K'yı duyurdu: tam K3 ile aynı yetenek, video girişi kırıldı, bağlam penceresi 256K'da tavanladı. İlk bakışta "kırpma sürüm" kokuyor — ama geliştirici topluluğu hesabı bastığında kanaat şaşırtıcı biçimde ortak: bu, yapılması gereken pragmatik hamleydi. Çünkü kodlamada asıl parayı yakan, bağlamın kendisi.
Kodlama işlerinin çoğunda model faturanın ana kalemi giriş veya çıkış değil, bağlamdır. Bağlamı 50 binden milyonlara çektiğin an, ortalama Token tüketimin bir basamak sıçrar — önbellek isabeti yeterince ucuz değilse, bu tam bir "Token suikastçısı"dır. Kimi bunu model konfigürasyon katmanında kapatıyor; senin adına o en pahalı düğmeyi önceden kapatmış oluyor.
💸 Uzun bağlam neden bu kadar pahalı
Defalarca doğrulanmış bir olgu: kodlama işlerinde, önbellek fiyatı aşağı çekilmediği sürece tüm oturumun ana gideri bağlam Token'larına yansır. Pencere ne kadar genişse, her turda gidip gelmek zorunda kaldığın o dağ da o kadar büyür.
Ama bu sözün bir şartı var — uzun bağlamın "katlanılabilir" olması yalnızca önbellek isabeti yeterince ucuzsa geçerli. Bugün piyasada önbellek fiyatını gerçekten indiren iki isim var: DeepSeek ve MiMo. Dolayısıyla milyonluk bağlamı "makul fiyatla" kullanabileceğin tek yer bu ikisi. Geri kalan herkesin uzun bağlam faturalandırması resmen ayıp; aklı başında tercih her zaman kısa bağlamdır.
Basit bir hesap: 1M bağlam ortalama ~500K'ya denk geliyor; 50K bağlama kıyasla fark tam 10 kat.
~100K'da kendi rızanla sıkıştırmayı alışkanlık edinenler, ortalama 50K'da gezer; 990K'a kadar birikip sistem otomatik sıkıştırsın diye bekleyenler, ortalama 500K'da geziyor. Aynı "uzun bağlam modeli"nde, ikincisi birinciden 10 kat pahalı. Yalnızca 256K'a bakıyorsan bile, bir oturum 200K'ya çıktığında gider, 50K tabanının 4 katına çıkıyor.
Bunların hepsi, yalnızca önbellek isabeti ucuzken geçersizleşiyor. Ne yazık ki çoğu ana akım modelin önbellek fiyatı da yüksek; dolayısıyla ana gider her zaman bağlam oluyor, uzun bağlam ise kullanımı kaçınılmaz olarak pahalılaştırıyor. Bağlamı aktif kısıtlamak, Agent yazılımının bağlam boyutunu kendi kendine denetlemesini sağlar — ve gideri ciddi biçimde düşürür.
🧠 Çoğu kimsenin "bağlam yönetimi" diye bir kavramı yok
Asıl sorun kullanıcı alışkanlığında. İnsanların hatırı sayılır bir kısmının "bağlamı aktif yönetme" diye bir bilinci yok; tamamen Harness'in (Agent yazılımı katmanı) otomatik sıkıştırmasına yaslanıyorlar — üstelik en pahalı modeli seçip tek bir sohbette 1M'a dolana kadar konuşmayı sürdürüyorlar.
Bu kullanım biçiminde "birkaç turda kota tükendi" sonucu neredeyse kaçınılmazdır. Kimi'nin Feishu grubunda "az kullanıyorum, birkaç turda bitti" diyerek sızlanan profiller, büyük ihtimalle tam da bu kullanımla ilişkili. Gruptaki resmi duyuruda "kullanım senaryolarının %90'ı 256K bağlamı aşmıyor" deniyor — yani tersinden okursan, hâlâ ~%10 "cömert" K3 ile uzun bağlam yakıyor.
Daha ilginci, K3 dokümanlarındaki şu cümle: "K3'e geçmeden önce yeni oturum açılması önerilir". Bu aslında nazik bir uyarıydı; ama çoğu adam hiç okumadı: 200K'yı çoktan aşmış eski bir oturumu K3'e geçirip, 1M sınırına kadar dayayıp sonra otomatik sıkıştırmayı beklediler — bu kullanımda hiçbir plan bunu kaldırır. O uyarı, daha çok önceden bir PR krizini kapama hamlesine benziyor.
Daha önce GPT 5.6 Sol, Codex'te varsayılan bağlam penceresini 272K'dan 372K'ya çıkarmıştı; anında bir yığın insan "Token çabuk bitiyor" diye yerdi. Tibo, Auto Compact'ın iki seviye arasındaki farkın o kadar büyük olmadığını anlatan bir gönderi bile attı — ama sonunda dayanamadılar, sessizce varsayılan limiti geri çektiler. Varsayılanı tavana çekmek, külfeti kârından fazla olan bir tasarımdır.
🔍 "%98 önbellek isabetim" aslında bir tehlike işareti
Toplulukta birileri sürekli önbellek isabet oranının %98, %99 olduğundan övünüyor; bunu "ben çok tasarruflu kullanıyorum" diye okuyor. Bu içgüdü büyük ihtimalle ters.
Harness katmanındaki önbellek isabet oranı, markalar arasında çok farklı değil. Oranın anormal derecede yüksek olması, genellikle tam da uzun bağlamı yoğun kullandığını gösterir — uzun bağlam ise en pahalı kısmın ta kendisi. Yani "yüksek isabet" başka bir açıdan, "en pahalı yerde en çok harcamışım" demek.
Neticede, her senaryo uzun bağlam istemez. Bağlamı aktif denetlemeyi öğrendiğin an, o pahalı modeller ancak "kullanılabilir" hâle geliyor; "tek sohbet, 1M'a dolana kadar" tarzı bir kullanımdan yanasan, DeepSeek ve MiMo dışında kalan tüm modeller bütçeni aşar.
🏷️ 256K sürüm daha ucuz olur mu? Muhtemelen hayır
Birçok kişi yeni model ID'sinin fiyatının da düşeceğini varsayıyor. Muhtemelen düşmez — fiyat yine aynı kalır. Resmi fiyat kat sayısı, asıl uzun bağlam girişi ve önbellek isabet giderinden geliyor; modelin kendisinin indirim yapmasından değil.
İkisinin ortalama hâline göre fark ~3 kat civarına açılıyor. Sadece çoğu kullanıcının tek bir oturumu 1M seviyesine ulaşmadığı için, resmi açıklama temkinli bir "tahmini 2 kat" lafını tercih ediyor.
256K sınırında ortalama bağlam uzunluğu ~150K; 1M sınırında ortalama ~600K — yalnızca önbellek fiyatı gideri 4 kat açılıyor. Bir Prompt altında ortalama ~8 mesaj turu, her tur 4K giriş, 600 Token çıkış varsayarsan, giriş-çıkış giderinin gerçek payı düşük kalıyor.
Yani fiyat/performansın iyileşmesi, "uzun bağlamı model konfigürasyon katmanında kısmak" işleminden geliyor; indirimden değil.
Tam da bu yüzden Kimi, uzun bağlamı konfigürasyon seviyesinde kıstığı ayrı bir sürüm çıkarıyor — ancak böyle kullanıcıların gerçek işlerinde fiyat/performans anlamlı biçimde düzelir.
📊 Testler ne diyor: kota tüketimi tam sürümün yaklaşık üçte biri
Yorumlarda kayda değer birkaç gerçek ölçüm ve soğuk bilgi var:
- Soğuk bilgi: Codex ve Cursor altlarında 1M model çalışıyor; ama pratikte kullanabildiğin bağlam yalnızca 200-300K.
- Kırpma sürümün bedeli: Aynı işi koşanlar, 256K sürümün tam sürüme kıyasla yaklaşık 1/3 kota yaktığını gördü — çünkü büyük bağlam, Token tüketimini kendiliğinden büyütüyor. Aynı tamamlanma standardında, aynı işin kota tüketimi ~%40'a iniyor.
- Uzun marathon işler: kimi cli'de bir-iki saat koşan uzun bir iş, haftalık kotada %5.53 yaktı; öncesi saatte %10+ civarıydı.
- Kalite etkileniyor mu: Evet, review sonrası biraz dönüp yamamak gerekiyor; tam sürümde neredeyse hiç dönülmüyor.
- Video ve 1M'ın hesaplama yükü: Video girişi ve 1M bağlam kesildiğinde, hesaplama gereksinimi en az yarıya iniyor.
199 paketindeki bir kullanıcı için kota zaten ciddi yetmiyor; kırpma sürüm sayesinde biraz daha rahat kullanmak mümkün oluyor. Ve kritik nokta — K3 MAX'ın 1M sürümü hâlâ kullanılabilir; ChatGPT gibi API üzerinden ödemeden 1M'a erişemiyorsun.
Yani düşük maliyetli bandın yanına bir seçenek daha kondu (resmi hesaplama yükünü de düşürdü), zararı yok, faydası çok.
🎯 Tek cümleyle
Çoğunluk için uzun bağlam, tam bir Token suikastçısı — DeepSeek ve MiMo gibi önbelleği çok düşük modeller hariç, hepsi sessizce bakiyeni deliyor.
Kimi K3-256K, konfigürasyon katmanında bir tavanla senin adına harcama disiplinini kuruyor. Hesaplama gücü hep sıkıntılı bir ekip için bu, saygıdeğer bir hamle. Gerçekte pahalı olan hiçbir zaman model değil; senin "sınırsız" sandığın o "istediğim kadar".
Bu yazı, Kimi K3-256K lansmanına ilişkin geliştirici topluluğu tartışmaları ve gerçek ölçüm verilerinden derlenmiştir; sayılar ve görüşler topluluk geri bildirimlerine aittir ve yalnızca referans amaçlıdır. Kesin faturalandırma için Moonshot'ın resmi açıklamalarını baz alın.