⚡ الخلاصة

أطلقت Moonshot نموذج Kimi K3-256K: الدماغ نفسه الذي في نسخة K3 الكاملة، بلا إدخال فيديو، ونافذة السياق مَحْصورةٌ بحدٍّ صارم عند 256K. على الورق تبدو «نسخةً مخفّضة». لكنّ مجتمع المطوّرين ما إن أنهى الحسابات حتى خرج بحكمٍ شبه إجماعي — هذا هو القرار العمليّ الصائب، لأنّ السياق الطويل، في حدّ ذاته، هو أغلى قاتلٍ متخفٍّ داخل فاتورتك.

الخلاصة بسطر واحد
في أغلب مهام البرمجة، التكلفة الطاغية ليست في المدخلات ولا المخرجات — بل في السياق. ارفع نافذتك من 50K نحو المليون، فيقفز متوسّط استهلاكك للـ token بمقدار مرتبةٍ كاملة. ما لم يكن الـ cache رخيصًا جدًا، فهذا قاتل token بحقّ. كبح السياق على مستوى الإعداد يُطفئ عنك أغلى مفتاحٍ في لوحة التحكم.

💸 لماذا يكلّفك السياق الطويل هذا الثمن الباهظ

حقيقةٌ يعيد الناس اكتشافها على حسابهم مرارًا: في مهام البرمجة، ما دام الـ cache لم يُروَّض، فإنّ معظم ما تدفعه يركد في جزء السياق من الـ token. كلّما اتّسعت النافذة، صار كلّ دورٍ مجرّد نقلٍ ذهابًا وإيابًا لجبلٍ يكبر ولا يصغر.

لكنّ ثمّة شرطًا — السياق الطويل «مُكلِّفٌ محدود» فقط حين يكون تسعير إصابة الـ cache منخفضًا بما يكفي. اليوم، المزوّدان الوحيدان اللذان خفضا تسعير الـ cache فعلًا هما DeepSeek وMiMo، ولذا فإنّ نوافذهما بمليون token هما وحدهما ما يستحقّ وصف «ميسور». أمّا تسعير بقية الأطراف للسياق الطويل فشبهُ عبثيّ، والخيار العقلانيّ دائمًا هو السياق القصير.

والحساب لا يرحم: نافذة 1M يبلغ متوسّطها عمليًا نحو 500K، وبمقابلتها مع نافذة 50K يكون الفارق في الإنفاق 10 أضعاف.

المتغيّر الحاسم: متى تُجري الضغط
عوّد نفسك على الضغط حول 100K، يبقَ متوسّط سياقك قرب 50K. دعه يجري إلى 990K وينتظر الضغط التلقائيّ، فيكون المتوسّط 500K. النموذج «طويل السياق» نفسه، لكنّ العادة الثانية تكلّف 10 أضعاف الأولى. وحتى داخل فئة 256K، فإنّ محادثةً واحدة تجري إلى 200K تكلّف 4 أضعاف خطّ أساسك عند 50K.

هذا كلّه لا يبطل إلّا حين يكون تسعير إصابة الـ cache رخيصًا فعلًا. معظم النماذج السائدة تُبقي تسعير الـ cache مرتفعًا أيضًا، فيظلّ الخطّ الطاغي في التكلفة راكدًا على السياق — والسياق الطويل سيدفع فاتورتك للأعلى دائمًا. كبح السياق فعليًا يترك لبرمجيّة الوكيل (harness) إدارة الحجم تلقائيًا، وهو التحرك الوحيد الذي يخفض الإنفاق فعلًا.

🧠 أغلب الناس بلا غريزةٍ لإدارة السياق

المشكلة الأعمق هي العادة. كثيرون بلا أيّ غريزة لإدارة السياق بوعي — يُصرِفون الأمر كليًّا إلى الـ harness (طبقة برمجيّة الوكيل) وإلى ضغطها التلقائيّ. والأسوأ أنّهم يختارون أغلى نموذج، ويُشغلون محادثةً واحدة حتى النخاع، ولا يُطلِقون الضغط إلّا حين تنفجر عند 1M.

تحت هذا النمط، «احتراق الحصّة في جولاتٍ معدودة» يكاد يكون حتمًا. السخرية التي تراها في مجموعات Kimi على Feishu — «استخدامٌ قليل، ينفد في جولاتٍ قليلة» — شبهُ مرتبطٍ بهذا النمط تحديدًا. بلاغ المجموعة الرسميّ يقول «90% من سيناريوهات الاستخدام لا تتجاوز 256K من السياق»، ويُقرَأ بالاتجاه المعاكس أيضًا: لا يزال نحو 10% من المستخدمين يحرقون K3 على السياق الطويل.

ثمّة أيضًا تلك الجملة في وثائق K3: «ننصح بفتح محادثة جديدة قبل التحوّل إلى K3». كان ذلك نصحًا ودودًا. لكنّ كثيرين لم يفكّكوه أصلًا — أخذوا محادثةً مُكدَّسة حتى 200K+، حوّلوها إلى K3، ثمّ دفعوها حتى حدّ 1M قبل أن يُطلِق الضغط التلقائيّ. لا باقة تصمد أمام هذا. تبدو تلك الجملة في الوثائق أشبه بتفكيكٍ استباقيّ لأزمة علاقات عامّة.

سابقة: انزلاقة GPT 5.6 Sol «أشبع النافذة افتراضيًّا»
حين رفع GPT 5.6 Sol داخل Codex نافذة السياق الافتراضيّة من 272K إلى 372K، تعرّض فورًا لوابلٍ من الانتقادات: «الـ token لا يدوم». اضُطرّ Tibo إلى نشر منشورٍ يشرح أنّ فارق الضغط التلقائيّ (Auto Compact) بين الفئتين ليس بهذا الحجم، لكنّ الضغط استمرّ، فرُدَّ الحدّ الافتراضيّ بصمت. إشباع النافذة افتراضيًّا تصميمٌ لا يشكرك عليه أحد.

🔍 «معدّل إصابة الـ cache عندي 98%» هو في الحقيقة إنذار

سترى في المجتمع من يتباهى بمعدّلات إصابة cache تصل إلى 98% أو 99%، ويتّخذها دليلًا على البُخل والترشيد. الحدس هنا معكوسٌ على الأرجح.

على مستوى الـ harness، لا تتباين معدّلات الإصابة كثيرًا بين المزوّدين. معدّلٌ مرتفعٌ بصورة شاذّة يعني شيئًا واحدًا غالبًا: أنت تعتمد بثقلٍ على السياق الطويل — والسياق الطويل هو الجزء الأغلى. فلِذلك يُقرَأ «المعدّل المرتفع» بالاتجاه الآخر بوصفه اختصارًا لـ: «أنا أنفق الأكثر حيث التكلفة الأعلى».

في نهاية المطاف، ليست كلّ السيناريوهات بحاجةٍ إلى سياقٍ طويل. تعلّم كبح السياق بوعي، تصبح تلك النماذج الباهظة صالحةً للاستخدام بالكاد. فإن كنت من نوعية من تُجري محادثةً واحدة حتى النخاع وتنتظر ضغط 1M التلقائيّ، فخارج DeepSeek وMiMo سيخترق كلّ نموذجٍ آخر ميزانيّتك على الأرجح.

🏷️ هل ستكون نسخة 256K أرخص؟ على الأرجح لا

كثيرون يخمّنون إن كان هذا المعرّف الجديد للنموذج يأتي بسعرٍ أقلّ. الأرجح لا — هو السعر نفسه. مُعامِل التسعير الرسميّ مدفوعٌ أساسًا بمدخلات السياق الطويل وعبء إصابة الـ cache، لا برخص النموذج نفسه.

على أساس المتوسّط، يستقرّ الفارق نحو 3 أضعاف. غير أنّ أغلب المحادثات لا تقترب أصلًا من 1M، لذا تقدّم الجهة الرسميّة رقمًا تحفّظيًّا: «تقديريًّا ضعفان».

مجموعة افتراضات عمل
تحت حدّ 256K، يجلس متوسّط طول السياق نحو 150K؛ وتحت حدّ 1M يقترب المتوسّط من 600K — وتفتح تسعيرات الـ cache وحدها فارقًا قدره 4 أضعاف. يبلغ متوسّط الطلب الواحد نحو 8 جولات رسائل؛ بافتراض 4K مدخلات و600 token مخرجات في كلّ جولة، تكون حصّة المدخلات والمخرجات الفعليّة من فاتورتك صغيرة.

إذًا، يأتي التحسّن في القيمة مقابل السعر من فعل «قطع السياق الطويل على مستوى إعداد النموذج» بحدّ ذاته — لا من تخفيضٍ في السعر.

ولهذا بالضبط كلّفت Kimi نفسها إصدار نسخةٍ منفصلة من النموذج وقطع السياق الطويل على مستوى الإعداد. هذا هو التحرك الوحيد الذي يرفع فعلًا نسبة السعر إلى الأداء في المهام التي يؤدّيها المستخدمون حقًّا.

📊 ميدانيًّا: نحو ثلث حصّة النسخة الكاملة

في تعليقات النقاش، ثمة عدّة اختبارات وملاحظات تستحقّ الإشارة:

  • معلومة طريفة: كلٌّ من Codex وCursor يتّصلان بنماذج 1M، لكنّ السياق الذي تستطيع استخدامه فعلًا لا يتجاوز من 200K إلى 300K.
  • كم تخسر فعلًا: أجرى أحدهم المهمّة نفسها، فاستهلكت نسخة 256K نحو الثلث من حصّة النسخة الكاملة — لأنّ السياق الكبير في حدّ ذاته ينتفخ به استهلاك الـ token. وعلى معيار إنجازٍ متساوٍ، تكلّفت المهمّة نفسها نحو 40% ممّا كانت عليه.
  • المهام طويلة الأمد: مهمّة جرت من ساعة إلى ساعتين في kimi cli احترقت 5.53% من الحصّة الأسبوعيّة؛ فيما كان الأمر سابقًا يصل أساسًا إلى 10%+ في الساعة.
  • هل تتأثّر الجودة: نعم — ستحتاج إلى بعض إعادة العمل بعد المراجعة، حيث لا تكاد النسخة الكاملة تحتاج إلى إعادة عمل.
  • حساب الفيديو و1M: إسقاط إدخال الفيديو ونافذة 1M يخفض طلب الحساب إلى النصف على الأقلّ.

لمشترك باقة 199، الحصّة أصلًا غير كافيةٍ بمرير — والنسخة المُقتطعة تمنحك بعض المتنفّس. والنقطة المحوريّة: نسخة 1M من K3 MAX لا تزال متاحة، خلافًا لـ ChatGPT حيث لا يُفتح 1M إلّا خلف فوترة API.

أيّ أنّك، فوق الفئة منخفضة التكلفة، صار بين يديك خيارٌ إضافيّ (يخفض أيضًا عبء الحساب على الجهة الرسميّة) — كلّه ربحٌ ولا ضرر فيه.

🎯 الخلاصة الأخيرة

لأغلب الناس، السياق الطويل هو قاتل token — فخارج DeepSeek وMiMo بتسعير cacheهما الصخريّ، كلّ نموذجٍ آخر يُفرغ رصيدك في صمت.

يضع Kimi K3-256K حدًّا على مستوى الإعداد ويُدير وضعيّة الإنفاق نيابةً عنك. ولفريقٍ حسابه دائمًا مشدود، فهذا قرارٌ لائق. ما كان غاليًا على الحقيقة ليس النموذج قطعًا — بل ذلك «اللانهائيّ» الذي ظننت أنّك تستطيع تحمّله.


يستند هذا المقال إلى النقاش العلنيّ في مجتمع المطوّرين والاختبارات الميدانيّة حول إصدار Kimi K3-256K. الأرقام والآراء واردةٌ من ردود المجتمع وهي للاستئناس فقط؛ وللفوترة الفعليّة يُرجع إلى المصادر الرسميّة لـ Moonshot.