⚡ Resumen rápido
Moonshot acaba de soltar Kimi K3-256K: mismas tripas que el K3 completo, sin entrada de vídeo y con la ventana de contexto capada a 256K. Sobre el papel parece un modelo recortado. Pero en cuanto la comunidad de desarrolladores se sentó con la calculadora, el veredicto fue casi unánime: es la jugada más sensata que podían hacer. Y la razón es que el contexto largo es, hoy por hoy, el mayor asesino de presupuesto escondido en tu factura.
En la inmensa mayoría de tareas de código, el coste no lo dictan ni la entrada ni la salida: lo dicta el contexto. Si empujas tu ventana de 50K hacia el millón, el consumo medio de tokens se multiplica por un orden de magnitud entero. Y a menos que la caché sea casi gratis, eso es un asesino de tokens en toda regla. Al capar el contexto desde la configuración, Kimi te apaga el interruptor más caro de la habitación.
💸 Por qué el contexto largo te sale tan caro
Hay un hecho que la gente vuelve a aprender a base de tragos amargos: en tareas de código, mientras la caché no esté domada, la mayor parte de lo que pagas se va en la porción de contexto de tus tokens. Cuanto más grande es la ventana, más se convierte cada turno en un ir y venir arrastrando una montaña cada vez más pesada.
Ojo, que esto lleva un condicional: el contexto largo solo es «caro, pero acotado» cuando el precio del cache-hit es suficientemente bajo. A día de hoy, los únicos dos fabricantes que han aplastado de verdad ese precio son DeepSeek y MiMo. Solo ellos pueden vender su ventana de un millón como «asequible». En el resto, la tarifa por contexto largo roza lo indecente; la elección racional por defecto es siempre contexto corto.
Las cuentas no tienen sentimiento. Un contexto de 1M se mueve en la práctica en torno a los 500K de media; frente a un contexto de 50K, la diferencia de gasto es de 10x sin redondeos.
Acostúmbrate a compactar en torno a los 100K y tu contexto medio se queda cerca de 50K. Déjalo correr hasta los 990K esperando al auto-compact y la media se va a 500K. Mismo «modelo de contexto largo», pero el segundo hábito cuesta 10x que el primero. Y ya dentro de la franja de 256K, una conversación que llegue a 200K te cuesta 4x tu línea base de 50K.
Todo esto solo deja de cumplirse cuando el precio del cache-hit es genuinamente barato. La mayoría de los modelos mainstream también mantienen la caché cara, así que el coste dominante sigue aparcado en el contexto, y el contexto largo siempre va a inflar tu factura. Limitar el contexto activamente deja que tu harness (la capa del agente) controle el tamaño automáticamente: ese es el movimiento que de verdad recorta el gasto.
🧠 Casi nadie tiene el reflejo de gestionar su contexto
El problema de fondo es de hábito. Mucha gente no tiene ningún instinto de gestionar el contexto de forma activa: lo delegan entero en el harness y su auto-compact. Peor aún, eligen el modelo más caro, exprimen una sola conversación hasta la médula y solo compactan cuando la cosa ya está a punto de reventar en 1M.
Con ese patrón, «fundir la cuota en un par de rondas» es casi una certeza. Las burlas que se leen en los grupos de Feishu de Kimi —«consume poco, se agota en unos cuantos turnos»— casi seguro que vienen de aquí, exactamente. La nota oficial del grupo decía que «el 90 % de los escenarios de uso no supera los 256K de contexto»; leído al revés, significa que aún hay un 10 % de usuarios quemando K3 a base de contexto largo.
Y luego está la frase enterrada en la documentación de K3: «recomendamos abrir una conversación nueva antes de cambiar a K3». Era un consejo amistoso. Mucha gente no lo supo leer en absoluto: cogieron una conversación ya apilada por encima de 200K, la pasaron a K3 y la empujaron hasta el límite de 1M antes de que saltara el auto-compact. No hay tarifa que sobreviva a eso. Esa nota de la doc se lee más bien como un cortafuegos de PR montado con antelación.
Cuando GPT 5.6 Sol subió en Codex la ventana de contexto por defecto de 272K a 372K, le llovieron críticas al instante por «los tokens no duran». Tibo tuvo que publicar una explicación de que la diferencia del Auto Compact entre ambos tramos no era para tanto, pero la presión aguantó y acabaron devolviendo el valor por defecto a su sitio, sin hacer ruido. Poner el contexto a tope por defecto es un diseño ingrato.
🔍 «Mi tasa de cache-hit es del 98 %» es, en realidad, una señal de alarma
Verás a gente de la comunidad presumiendo de tasas de cache-hit del 98 % o del 99 %, como si fuera la prueba de que están gastando poco. La intuición, casi seguro, es la contraria.
En la capa del harness, las tasas de cache-hit no varían tanto entre proveedores. Una tasa anormalmente alta suele significar una sola cosa: estás apretando fuerte sobre el contexto largo, que es justamente la parte más cara. Así que «tasa alta», leído del revés, viene a ser «estoy gastando lo más donde más cuesta».
Al final del día, no todos los escenarios necesitan contexto largo. Aprende a controlar el contexto de forma activa y esos modelos carísimos pasan a ser, a duras penas, utilizables. Si eres de los que exprime una sola conversación hasta el fondo esperando el auto-compact en 1M, entonces fuera de DeepSeek y MiMo, cualquier otro modelo te va a volar el presupuesto.
🏷️ ¿La versión de 256K va a ser más barata? Probablemente no
Hay bastante gente conjeturando si este nuevo ID de modelo llega con un precio más bajo. Lo más probable es que no: mismo precio. El multiplicador oficial que manejan viene tirado por la entrada en contexto largo y por el sobrecoste de los cache-hits, no por el modelo abaratándose.
En términos de caso medio, la diferencia se instala en torno a 3x. Solo que la mayoría de las conversaciones no se acercan ni de lejos al millón, así que la versión oficial suelta un conservador «estimado en 2x».
Bajo el techo de 256K, la longitud media de contexto ronda los 150K; bajo el techo de 1M, la media se va a unos 600K: con que mires solo el precio de la caché, el hueco ya es de 4x. Un prompt medio son unos 8 turnos de mensaje; contando 4K de entrada y 600 tokens de salida por turno, la parte real de entrada/salida en la factura es bastante pequeña.
Así que la ganancia de rentabilidad no viene de una bajada de precio, sino del acto en sí de «cortar el contexto largo desde la configuración del modelo».
Justo por eso Kimi se ha tomado la molestia de sacar una versión aparte y cortar el contexto largo en la capa de configuración. Es el único movimiento que de verdad mejora la relación coste/rendimiento del trabajo real que hace la gente.
📊 Sobre el terreno: más o menos un tercio de la cuota de la versión completa
Algunos tests y datos curiosos de los hilos de comentarios que merece la pena señalar:
- Dato curioso: Codex y Cursor enchufan ambos a modelos de 1M, pero el contexto que de verdad puedes usar se queda en 200K–300K.
- Cuánto pierdes de verdad: alguien corrió la misma tarea y la versión de 256K consumió más o menos 1/3 de la cuota de la versión completa — porque un contexto grande, por sí solo, ya infla el consumo de tokens. Medido a igual nivel de acabado, la misma tarea cuesta alrededor del 40 % de lo que costaba antes.
- Tareas largas: un trabajo de una o dos horas en kimi cli consumió un 5,53 % de la cuota semanal; antes era básicamente un 10 %+ por hora.
- ¿Se resiente la calidad?: sí — después de la revisión toca repasar y remendar; la versión completa casi nunca necesita retoque.
- El cómputo de vídeo y 1M: quitar la entrada de vídeo y la ventana de 1M reduce la demanda de cómputo, como mínimo, a la mitad.
Para quien esté en el plan de 199 —cuya cuota ya era claramente insuficiente—, la versión recortada permite respirar un poco. Y la clave es esta: la versión de 1M de K3 MAX sigue disponible, a diferencia de ChatGPT, donde el 1M está cerrado tras la facturación por API.
Vamos, que encima del tramo low-cost te colocan otra opción encima de la mesa (que de paso aligera la carga oficial de cómputo). Todo ventaja, sin contrapartida.
🎯 En una frase
Para la inmensa mayoría, el contexto largo es un asesino de tokens: fuera de DeepSeek y MiMo, con su caché por los suelos, todos los demás modelos están vaciando tu saldo en silencio.
Kimi K3-256K pone un techo en la capa de configuración y gestiona la postura de gasto por ti. Para un equipo con el cómputo siempre tenso, es una jugada bastante digna. Lo que de verdad sale caro nunca fue el modelo: fue ese «infinito» que creías poder permitirte.
Basado en la discusión pública y los tests de la comunidad de desarrolladores en torno al lanzamiento de Kimi K3-256K. Las cifras y opiniones provienen de los comentarios de la comunidad y son solo orientativas; para la facturación real, remítase a las fuentes oficiales de Moonshot.