⚡ Apa yang berubah untuk anda

Moonshot (Kimi) baru sahaja mengeluarkan Kimi K3-256K: keupayaan sama dengan K3 penuh, input video dibuang, tetingkap konteks ditahan keras pada 256K. Pandangan pertama, nampak seperti versi dipangkas. Tapi bila komuniti pembangun kira betul-betul, kesimpulan mereka hampir sebulat suara — ini satu langkah yang pragmatik. Sebab dalam kerja coding, sumber kos paling besar bukan datang dari input atau output, tapi dari konteks yang panjang.

Satu ayat sahaja
Untuk kebanyakan tugasan coding, kos paling besar bukan input atau output — tapi konteks. Bila anda menarik tetingkap dari 50K ke aras jutaan, purata penggunaan Token anda melompat satu urutan magnitud. Melainkan harga cache sangat murah, inilah "pembunuh Token senyap". Kimi memutus saluran ini di peringkat konfigurasi — menutup suis paling mahal itu bagi pihak anda.

💸 Kenapa konteks panjang sangat mahal

Satu fakta yang terbukti berulang kali: dalam kerja coding, selagi harga cache belum turun, kebanyakan kos satu sesi tertumpu pada Token di bahagian konteks. Semakin lebar tetingkap yang anda buka, setiap permintaan seterusnya terpaksa menanggung gunungan yang semakin besar dan semakin berat.

Tapi ada syaratnya — konteks panjang hanya "agak mampu milik" kalau harga cache hit betul-betul murah. Buat masa ini, yang berjaya menurunkan harga cache ke tahap berpatutan hanya DeepSeek dan MiMo. Sebab itulah hanya kedua-dua nama ini mempunyai konteks jutaan Token yang "boleh diguna dengan serius". Yang lain, skema harga konteks panjang mereka sungguh di luar kewarasan, dan pilihan rasional anda sentiasa konteks pendek.

Kiraan ringkas: 1M konteks itu puratanya lebih kurang 500K, dan jika dibandingkan dengan sesi 50K, bezanya boleh capai 10 kali ganda.

Pemboleh ubah kunci: bila anda mula memampatkan
Tabiat memampatkan sekitar 100K membuatkan purata konteks anda sekitar 50K; manakala tabiat menimbun sehingga 990K barulah mahu memampatkan, puratanya menjadi 500K. Model "konteks panjang" yang sama, kos yang 10 kali ganda lebih mahal. Biarpun hanya melihat pada julat 256K: sekali sesi anda menyentuh 200K, kos itu sudah menjadi 4 kali ganda garis dasar 50K.

Seluruh kiraan di atas hanya gugur kalau harga cache hit betul-betul murah. Malangnya kebanyakan model utama juga menjual cache pada harga yang tidak murah, jadi bahagian kos terbesar tetap pada konteks — dan konteks panjang hampir pasti menaikkan bil anda. Dengan mengehadkan konteks secara aktif, perisian ejen (Harness) automatik menjaga saiz konteks supaya kecil, dan kos anda turun mendadak.

🧠 Kebanyakan pembangun tiada konsep "pengurusan konteks"

Akar masalahnya pada tabiat penggunaan. Ramai pembangun memang tiada kesedaran untuk "mengurus konteks secara aktif" — mereka bergantung sepenuhnya pada auto-mampatan di lapisan Harness (perisian ejen), dan kerap memilih model paling mahal, kemudian menggunakan satu sesi perbualan sehingga penuh 1M, barulah terkena mampatan automatik.

Dengan corak penggunaan sebegini, "beberapa pusingan sahaja dah habis" hampir pasti berlaku. Dalam kumpulan Feishu Kimi, aduan "kuota kecil, beberapa pusingan dah habis" yang menjadi bahan ejekan sangat berkait rapat dengan corak sebegini. Pengumuman rasmi dalam kumpulan itu sendiri menyebut "90% senario penggunaan tidak melebihi 256K konteks" — dibalikkan, masih ada lebih kurang 10% pengguna yang membakar kuota pada konteks super panjang.

Yang lebih menarik, dokumentasi K3 pernah menulis "dicadang membuka sesi baharu sebelum bertukar ke K3". Itu asalnya amaran mesra, tapi ramai yang tidak faham maksudnya. Mereka terus menukar sesi lama yang sudah menimbun 200K+ terus ke K3, kemudian menolak sampai had 1M barulah dimampatkan automatik — langganan apa-apa pakej pun tak akan tahan. Ayat amaran rasmi itu kalau difikirkan, lebih mirip benteng sebelum krisis PR meletup.

Pelajaran: GPT 5.6 Sol, default 272K dinaikkan ke 372K, lalu kacau
Masa itu GPT 5.6 Sol dalam Codex menaikkan Context Window default dari 272K ke 372K, terus dikeritik ramai dengan kata "Token tak tahan lama". Tibo sampai terpaksa siarkan penjelasan bahawa Auto Compact pada dua tahap itu bezanya tidak begitu drastik. Tapi akhirnya pasukan tak tahan, diam-diam kembalikan default ke asal. Default yang menimbun konteks sampai penuh — satu reka bentuk yang melecehkan, tapi tak dihargai.

🔍 "Cache hit saya 98%" sebenarnya isyarat bahaya

Selalu ada yang membanggakan cache hit setinggi 98% atau 99% dalam komuniti, lalu rasa diri sudah berjimat. Intuisi ini kemungkinan besar terbalik dari realiti.

Kadar hit cache di lapisan Harness antara perkhidmatan sebenarnya tak jauh berbeza. Nombor yang luar biasa tinggi justru menunjukkan anda sedang banyak guna konteks panjang — dan konteks panjang itulah bahagian paling mahal. Jadi "kadar hit tinggi" kalau ditafsirkan jadi: "saya paling banyak guna di tempat yang paling mahal".

Pada penghujungnya, bukan semua senario perlukan konteks panjang. Belajar mengurus konteks secara aktif adalah syarat supaya model-model mahal itu boleh diguna dengan berpatutan; kalau anda jenis yang "satu sesi jalan terus sampai penuh 1M barulah dimampatkan", maka selain DeepSeek dan MiMo, semua model lain kemungkinan akan melepasi belanjawan anda.

🏷️ Adakah versi 256K akan lebih murah? Hampir pasti tidak

Ramai yang meneka model ID baharu ini akan dapat harga lebih murah. Hampir pasti tidak — harganya tetap sama. Pendarab harga yang disebut rasmi datangnya terutamanya dari kos input konteks panjang dan cache hit, bukan dari diskaun model itu sendiri.

Kalau dibandingkan secara purata, perbezaan sebenar boleh sampai 3 kali ganda. Cuma kebanyakan sesi memang tak sampai 1M, jadi pihak rasmi memberikan nombor konservatif "anggaran 2 kali ganda".

Satu set anggapan data
Pada had 256K, panjang Context puratanya lebih kurang 150K; pada had 1M, puratanya sekitar 600K — dari segi harga cache sahaja bezanya dah 4 kali ganda. Satu Prompt puratanya ada lebih kurang 8 pusingan mesej, dengan anggapan input 4K dan output 600 Token setiap pusingan, jadi bahagian kos input dan output sebenarnya tak berapa mendominasi.

Jadi peningkatan nilai untuk wang datangnya dari tindakan "memutus konteks panjang di peringkat konfigurasi model", bukan dari penurunan harga.

Justru sebab inilah Kimi mengeluarkan satu versi berasingan — memutus konteks panjang terus dari peringkat konfigurasi, supaya nisbah kos-kepada-prestasi untuk tugasan pengguna benar-benar naik.

📊 Keputusan ujian: kuota berkurang lebih kurang satu pertiga versi penuh

Beberapa nombor sebenar dan fakta menarik dari ruangan komen:

  • Fakta menarik: Codex dan Cursor disambungkan pada model 1M, tapi konteks yang benar-benar boleh diguna cuma sekitar 2–3 ratus K.
  • Berapa rugi versi 256K: ada yang membuat ujian pada tugasan yang sama, versi 256K ini menghabiskan kuota lebih kurang 1/3 dari versi penuh — sebab konteks besar itu sendiri dah menambah penggunaan Token; kalau dikira dengan standard hasil yang setara, kuota yang diguna untuk tugasan yang sama lebih kurang 40% dari sebelumnya.
  • Tugasan panjang: tugasan yang berjalan satu hingga dua jam dalam kimi cli, penggunaan kuota mingguan cuma 5.53%; sedangkan sebelumnya hampir selalu melebihi 10% setiap jam.
  • Adakah kesannya terjejas: ya, selepas review perlu sedikit kerja pembaikian semula; versi penuh hampir tak perlukan pembaikian.
  • Video dan 1M dari segi compute: dengan membuang input video dan konteks 1M, keperluan compute turun sekurang-kurangnya separuh.

Buat pengguna pakej 199 yang kuotanya memang ketat, versi yang dipangkas ini memberi sedikit ruang untuk diguna dengan lebih lapang. Dan bahagian pentingnya — versi 1M dari K3 MAX masih boleh diguna, tak macam ChatGPT yang kalau nak guna 1M terpaksa melalui pembilanan API.

Hasilnya: di samping opsyen murah yang dah ada, sekarang ada satu pilihan lagi (sekaligus kurangkan beban compute di pihak rasmi). Buat pengguna, ini untung dari semua sudut.

🎯 Kesimpulan

Buat kebanyakan pengguna, konteks panjang itu adalah pembunuh Token — kecuali model macam DeepSeek dan MiMo yang cache-nya sangat murah, yang lain semua diam-diam menggerus baki saldo anda.

Kimi K3-256K meletakkan had di peringkat konfigurasi: mengawal gaya perbelanjaan anda dari punca. Buat pasukan yang compute-nya sentiasa ketat, ini satu langkah yang boleh dihormati. Benda yang betul-betul mahal bukan model itu — tapi "tak terhingga" yang selama ini anda sangka mampu milik.


Tulisan ini disusun berdasarkan perbincangan awam dan keputusan ujian komuniti pembangun terhadap keluaran Kimi K3-256K. Semua nombor dan pandangan diambil dari maklum balas komuniti dan hanya sebagai rujukan; untuk butiran pembilan rasmi, sila rujuk pengumuman Moonshot/Kimi.