⚡ Yhteenveto
Moonshot julkaisi Kimi K3-256K:n: sama äly kuin täysversio K3:ssa, videosyöte leikattu pois ja konteksti-ikkuna lukittu kiveen 256K:iin. Ensivilkaisulta näyttää typistetyltä versiolta. Mutta kun kehittäjäyhteisö laski laskun, tuomio oli lähes yksimielinen — tämä on praktinen veto. Pitkä konteksti on nimetystä se yksityiskohta, joka syö budjettisi ensimmäisenä.
Valtaosassa coding-tehtäviä laskun isoin lohko ei ole syöte eikä tuloste — se on konteksti. Kun vedät ikkunan 50K:sta miljoonaluokkaan, keskimääräinen tokenikulutus hyppää kokonaisen kymmenluokan yli. Ja jos välimuistiosuma ei ole lähes ilmaista, kyseessä on Tokeni-salamurhaaja. Kimi korkkasi kontekstin 256K:iin jo mallin asetuskerroksella — se sammutti puolestasi sen kalleimman kytkimen.
💸 Miksi pitkä konteksti maksaa näin paljon
Toistuva tosiasia: coding-tehtävissä, niin kauan kuin välimuistiosuman hintaa ei ole työnnetty alas, istunnon pääkustannus purkautuu konteksti-osan tokeneihin. Mitä isomman ikkunan avaat, sitä suurempaa vuorta siirrät jokaisella pyynnöllä edestakaisin — ja se vuori kasvaa joka kierroksella.
Tässä on kuitenkin ehto. Pitkä konteksti on "vähemmän kallis" vain silloin, kun välimuistiosuman hinta on riittävän matala. Tällä hetkellä ainoat kaksi toimijaa, jotka ovat aidosti painaneet välimuistihinnan alas, ovat DeepSeek ja MiMo — siis heidän miljoonan tokenin ikkunansa ovat ainoat, jotka käyvät läpi "varaa käyttää". Kaikkien muiden pitkän kontekstin laskutus on suorastaan absurdia, ja järkevä oletusvalinta on aina lyhyt konteksti.
Laskutoimitus on armoton. 1M konteksti pyörii käytännössä keskimäärin noin 500K:ssa, ja 50K kontekstiin verrattuna kustannusero on tasan 10-kertainen.
Jos olet tottunut tiivistämään aktiivisesti noin 100K kohdalla, keskimääräinen kontekstisi pysyy lähellä 50K:ta. Jos kasaat 990K:iin asti ja odotat järjestelmän automaattista tiivistystä, keskiarvo on 500K. Sama "pitkä konteksti" -malli, mutta jälkimmäinen tapa maksaa 10 kertaa edellistä. Vielä 256K-luokan sisällä: yksikin keskustelu, joka kiipeää 200K:iin, maksaa 4 kertaa 50K-peruslinjasi.
Kaikki tämä kääntyy päälaelleen vain silloin, kun välimuistiosuman hinta on aidosti halpa. Valitettavasti useimpien valtavirtamallien välimuistihinta on yhä korkea, joten pääkustannus jää aina kontekstiin — ja pitkä konteksti nostaa laskua väistämättä. Aktiivinen kontekstin rajoittaminen antaa harnessin (agenttiohjelmiston) hallita kontekstin kokoa automaattisesti ja leikata kuluja merkittävästi.
🧠 Useimmilta puuttuu "kontekstin hallinta" -refleksi
Syvempi ongelma on tavoissa. Melko monella ei ole minkäänlaista vaistoa hallita kontekstia aktiivisesti — kaikki filiirataan harnessin automaattiselle tiivistykselle. Pahempaa: valitaan kallein malli, ajetaan yksi ainoa keskustelu loppuun asti ja tiivistys laukeaa vasta kun raja paukkuu miljoonassa.
Tällä käyttöotteella "kiintiö palaa muutamassa kierroksessa" on melkein väistämätön lopputulos. Se ivailu, jota näkee Kimin Feishu-ryhmissä — "vähäinen käyttö, loppuu muutamassa kierroksessa" — liittyy lähes varmasti juuri tähän käyttötapaan. Ryhmän virallinen tiedote totesi, että "90 % käyttöskenaarioista ei ylitä 256K kontekstia" — takaperin luettuna: noin 10 % käyttäjistä polttaa K3:a pitkällä kontekstilla.
Sitten on se K3-dokumenttien hautautunut lause: "suosittelemme avaamaan uuden keskustelun ennen K3:een vaihtamista". Se oli tarkoitettu ystävälliseksi neuvoksi. Moni ei lukenut sitä lainkaan: he siirsivät jo 200K+ -kokoisen vanhan keskustelun K3:een, painoivat sen koko matkan 1M-rajaan asti ja laukaisivat automaattisen tiivistyksen vasta siellä. Mikään paketti ei kestä tuollaista käyttöä. Se dokumenttien huomautus vaikuttaa enemmän ennaltaehkäisevältä PR-pommilta.
Aiemmin GPT 5.6 Sol nosti Codexissa oletusarvoisen konteksti-ikkunan 272K:sta 372K:een, ja sai heti syytöksiä "tokeneiden kestämättömyydestä". Tibo joutui jopa julkaisemaan selityksen, että Auto Compactin ero kahden tason välillä ei oikeasti ole niin suuri — mutta paine piti, ja oletus rullattiin hiljaa takaisin. Oletusarvoisen kontekstin maksimoiminen on kiittämätön suunnittelu.
🔍 "Välimuistiosumani 98 %" on oikeasti varoitusmerkki
Näet yhteisössä väkeä kehumassa 98 tai 99 prosentin välimuistiosumaprosentillaan ja pitävän sitä todisteena säästeliäisyydestä. Vaistosi on lähes taatusti väärinpäin.
Harness-tasolla välimuistiosumaprosentti ei vaihtele paljoa toimittajien välillä. Poikkeuksellisen korkea prosentti tarkoittaa useimmiten yhtä asiaa: nojaat raskaasti pitkään kontekstiin — ja pitkä konteksti on se kallis osa. "Korkea osumaprosentti", luettuna toisesta kulmasta, on lyhennysmerkintä lauseelle "kulutan eniten juuri siellä, missä se on kalleinta".
Lopulta kaikki skenaariot eivät tarvitse pitkää kontekstia. Opi hallitsemaan kontekstia aktiivisesti, niin vasta silloin kalliit mallit ovat edes käyttökelpoisia. Jos olet tyyppi joka ajaa yhden keskustelun pohjalla ja odottaa 1M automaattista tiivistystä, niin DeepSeekin ja MiMon ulkopuolella jokainen muu malli rikkoo todennäköisesti budjettisi.
🏷️ Laskeeko 256K-versio hintaa? Todennäköisesti ei
Moni arvelee, että tämä uusi malli-ID tulisi halvemmalla. Todennäköisesti ei — hinta pysyy samana. Virallinen hintakerroin johdetaan pääasiassa pitkän kontekstin syötteestä ja välimuistiosuman kustannuksesta, ei siitä, että malli olisi halventunut.
Keskiarvoilla mitattuna ero venää noin 3-kertaiseksi. Koska useimmat keskustelut eivät oikeasti yllä miljoonaan saakka, virallinen linja tarjoaa konservatiivisen "arvioitu 2-kertainen" -muotoilun.
256K-katon alla keskimääräinen kontekstin pituus pyörii noin 150K:ssa; 1M-katon alla keskiarvo on lähempänä 600K:ta — pelkkä välimuistihinta aukaisee 4-kertaisen kuilun. Yksi prompti pyörii keskimäärin noin 8 viestikierrosta; oletetaan 4K syötettä ja 600 tokenia tulostetta per kierros, ja todellisen syöte-tuloste-osuuden osuus laskusta jää varsin pieneksi.
Siis kustannustehokkuuden nousu syntyy itse teosta "katkaista pitkä konteksti mallin asetuskerrokselta" — ei mistään hinnanalennuksesta.
Juuri siksi Kimi vaivautuu julkaisemaan erillisen malliversion ja leikkaamaan pitkän kontekstin jo asetuskerrokselta. Se on ainoa veto, joka aidosti nostaa käyttäjän todellisten tehtävien hinta-laatusuhdetta.
📊 Käytännössä: noin kolmannes täysversion kiintiöstä
Muutama testitulos ja havainto kommenttiketjuista:
- Huomio: Codex ja Cursor kytketään molemmat 1M-malleihin, mutta konteksti jota voit oikeasti käyttää jää 2–300K:iin.
- Kuinka paljon karsittu versio menettää: Eräs käyttäjä ajoi saman tehtävän, ja 256K-versio kulutti noin 1/3 täysversion kiintiöstä — koska iso konteksti itsessään pullistaa tokenikulutusta. Mitattuna saman laatutasolla, sama tehtävä maksoi noin 40 % aiemmasta.
- Pitkät ajot: 1–2 tunnin pitkä ajokerta kimi cli:ssä kulutti 5,53 % viikkokiintiöstä; aiemmin mentiin käytännössä 10 %+ per tunti.
- Vaikuttaako laatuun: Kyllä — koodikatselmoinnin jälkeen joudut tekemään hieman uusintatyötä, kun täysversio ei juuri tarvitse uusintatyötä.
- Laskenta videosta ja 1M:stä: videosyötteen ja 1M-ikkunan pudottaminen leikkaa laskentatarpeen vähintään puoleen.
199 yuanin paketin käyttäjälle kiintiö on jo valmiiksi aivan liian pieni — karsittu versio antaa hengittää hieman. Ja se olennainen: K3 MAXin 1M-versio on edelleen käytettävissä, toisin kuin ChatGPT:ssä, jossa 1M on lukittu API-laskutuksen taakse.
Eli halvan hintaportaan rinnalle on saatu vielä yksi vaihtoehto (sivutuotteena se leikkaa myös Moonshotin omaa laskentataakkaa). Pelkkiä hyötyjä, ei haittoja.
🎯 Lopputulema
Suurimmalle osalle pitkä konteksti on Tokeni-salamurhaaja — DeepSeekin ja MiMon kaltaisten, äärimmäisen matalan välimuistihinnan mallien ulkopuolella kaikki muut tyhjentävät saldoasi hiljaa.
Kimi K3-256K asettaa config-tason kattona ja hoitaa kulujen hallinnan käyttäjän puolesta. Tiimille, jonka laskentakapasiteetti on jatkuvasti kireällä, tämä on asiallinen veto. Aidosti kallista ei ole koskaan ollut malli — se on se "ääretön", jonka luulit varaa käyttää.
Tämä artikkeli pohjautuu Kimi K3-256K-julkaisua ympäröivään julkiseen kehittäjäyhteisön keskusteluun ja käytännön testeihin. Luvut ja kannat ovat yhteisön palautetta ja antavat vain suuntaa; tarkka laskutus määräytyy Moonshotin virallisten lähteiden mukaan.