
📋 ข้อมูลภายในรั่วไหล
ชุดบันทึกภายในจาก MiniMax — หนึ่งในห้องแลป AI ของจีนที่ถูกประเมินต่ำเกินไป — เพิ่งถูกเปิดเผย เอกสารฉบับนี้ครอบคลุมสี่ด้าน: การพัฒนาโมเดลรุ่นถัดไป ตำแหน่งการแข่งขันบน benchmark การเขียนโค้ด กลยุทธ์โครงสร้างพื้นฐานคอมพิวต์ และมุมมองอัตรากำไรขั้นต้น มองรวมกันแล้วภาพที่ได้คือบริษัทที่กำลังจะขับเคลื่อนอย่างจริงจังในสนามโมเดลแนวหน้า — และอาจปรับโฉมภูมิทัศน์ราคาของ AI API จีนได้
นอกจีน ชื่อ MiniMax อาจไม่คุ้นหู แต่ในวงการอุตสาหกรรม พวกเขาโด่งดังจากสองอย่าง: กลไก Lightning Attention (ที่พัฒนาต่อมาเป็น MSA) ที่ทำให้ inference คอนเท็กซ์ยาวถูกลงอย่างมาก และโมเดลเขียนโค้ด (M3) ที่ทำผลงานเกินระดับตัวเอง บันทึกเหล่านี้ชี้ว่าทั้งสองจุดแข็งกำลังจะใหญ่ขึ้นมาก
🧬 รุ่นถัดไป: 2.5–3 ล้านล้านพารามิเตอร์
ตัวเลขสำคัญ: โมเดลรุ่นถัดไปของ MiniMax เป็นเป้าหมายที่ 2.5–3 ล้านล้านพารามิเตอร์ เทียบเคียงให้เห็นภาพ GPT-4 ประมาณ 1.8T และ DeepSeek V4 น่าจะอยู่ในช่วง 1–2T ถ้า MiniMax ไปถึง 3T จะกลายเป็นหนึ่งในโมเดล dense/MoE ที่ใหญ่ที่สุดเท่าที่เคยฝึกมา
การ pre-train โมเดลใหม่นี้รันมาแล้วราวครึ่งเดือน และตามบันทึก การลู่เข้าเกินคาด โมเดลใช้สถาปัตยกรรม MSA 2.0 (อธิบายด้านล่าง) และมีทั้งจำนวนพารามิเตอร์และจำนวน activation เพิ่มขึ้นเกือบเป็นสองเท่าเมื่อเทียบกับรุ่น M2 ปัจจุบัน
ไทม์ไลน์: โมเดลใหม่คาดว่าจะเปิดตัวหลังฤดูร้อน 2026 (น่าจะประมาณกันยายน–ตุลาคม) ทีมภายในมั่นใจมากในผลงานและความพร้อม โดยอ้างว่าจะนำตลาดในประเทศ (จีน)
⚡ MSA 2.0: อาวุธลับด้านประสิทธิภาพต้นทุน
MSA ย่อมาจาก Multi-Scale Attention — สถาปัตยกรรมกรรมเจ้าของของ MiniMax ที่วิวัฒนาการมาจากงาน Lightning Attention ดั้งเดิม จุดแข็งหลักคือ: ลดค่าใช้จ่ายการคำนวณ Attention ลงอย่างมาก ในขณะที่ยังรักษาคุณภาพโมเดลไว้ได้
ทำไมเรื่องนี้สำคัญต่อราคา:
- ประสิทธิภาพการฝึก: MSA 2.0 ให้ MiniMax ฝึกโมเดล 3T พารามิเตอร์ในต้นทุนเพียงเศษเสี้ยวของ Transformer มาตรฐาน ต้นทุนฝึกต่ำลง = ทุนที่ต้องคืนน้อยลง = พื้นที่ให้ตั้งราคา API ก้าวร้าวมากขึ้น
- ประสิทธิภาพการ inference: MSA รองรับลำดับขนาดยิ่งใหญ่โดยลดค่าใช้จ่ายคำนวณลงหนึ่งระดับอันดับ หมายความว่า MiniMax สามารถเสนอหน้าต่างคอนเท็กซ์กว่า 1M ด้วยต้นทุนส่วนเพิ่มที่ต่ำกว่าคู่แข่งที่ใช้ Attention แบบเดิมๆ มาก
- อัตรากำไรขั้นต้น: บันทึกระบุชัดเจนว่า แม้พารามิเตอร์และ activation จะเพิ่มเป็นสองเท่า อัตรากำไรขั้นต้นของโมเดลใหม่คาดว่าจะสูงกว่า M2 เป็นไปได้ก็ต่อเมื่อ MSA 2.0 ลดต้นทุนต่อ token ได้จริง
🚀 ความสามารถเขียนโค้ดและความเร็วการ inference
บันทึกเผยรายละเอียดที่น่าสนใจเกี่ยวกับกลยุทธ์เขียนโค้ดของ MiniMax:
- M3 เป็นโมเดลที่เร็วที่สุดในไลน์อัพหลัก — ประมาณ 100 TPS (tokens per second) โดยอ้างว่าเร็วกว่าคู่แข่งทุกราย สำหรับเวิร์กโฟลว์เขียนโค้ดที่นักพัฒนาดู output สตรีมมาแบบเรียลไทม์ ความได้เปรียบด้านความเร็วนี้แปลเป็น UX ที่ดีกว่าโดยตรง
- ปรัชญาการฝึกของ MiniMax เน้นข้อมูลโค้ดระดับมืออาชีพคุณภาพสูงมากกว่าปริมาณล้วนๆ บันทึกย้ำว่า "คุณภาพและวิธีการฝึกสำคัญกว่าปริมาณ" — ท่าทีที่สวนกระแสในอุตสาหกรรมที่หมกมุ่นกับสเกลของชุดข้อมูล
- M3.1 เป็นการอัปเกรดครั้งใหญ่จาก M3 (ซึ่งมีจุดอ่อนเพราะ post-training ถูกเร่งจนเกินไป) ด้วยการปรับคุณภาพข้อมูลและเพิ่มข้อมูลงาน long-horizon M3.1 ทำผลงานได้ดีขึ้นระดับอันดับบนปัญหาเขียนโค้ดที่ซับซ้อน
สำหรับผู้อ่าน China AI Arbitrage: โมเดลเขียนโค้ดของ MiniMax ปัจจุบันตั้งราคาประมาณ $1.20/M output tokens — แข่งกับ Qwen ได้และถูกกว่า GLM อยู่แล้ว ถ้าโมเดลรุ่นถัดไปเป็นไปตามที่สัญญา MiniMax อาจกลายเป็นตัวเลือกเขียนโค้ดที่คุ้มค่าที่สุดในตลาด AI จีน
🏗️ โครงสร้างพื้นฐานคอมพิวต์: ความได้เปรียบทางทรัพยากรต่างประเทศ
หนึ่งในส่วนที่เปิดเผยข้อมูลได้มากที่สุด: MiniMax เข้าถึงทรัพยากร GPU ต่างประเทศในรูปแบบที่สอดคล้องกฎเกณฑ์ ทำให้แซงหน้าคู่แข่ง AI จีนส่วนใหญ่ที่กำลังวิ่งหาทางเลือกภายในประเทศอย่างเลือดลายไหล
- เครือข่ายสร้างเอง: MiniMax สร้างโครงสร้างเครือข่ายเชื่อมระหว่าง GPU ของตัวเอง แทนที่จะพึ่งพาโซลูชันของผู้จำหน่าย บันทึกอ้างว่าประหยัดทั้งต้นทุนและเวลา และเสถียรภาพ "เกินคาด"
- ไปป์ไลน์คอมพิวต์ภายในประเทศ: GPU ที่ผลิตในจีนใช้ได้แต่ความจำกัดด้านความจุ MiniMax คาดว่าคลัสเตอร์ GPU ในประเทศแรกจะออนไลน์ในไตรมาส 3 ปี 2026 เริ่มจากงาน inference ก่อน
- กลยุทธ์สองทาง: GPU ต่างประเทศสำหรับการฝึก (ที่ต้องการประสิทธิภาพขั้นสูงสุด), GPU ในประเทศสำหรับ inference (ที่ต้องการสเกลและประสิทธิภาพต้นทุน) นี่คือแนวทางปฏิบัติที่ห้องแลป AI จีนส่วนใหญ่ปรารถนา — MiniMax ดูเหมือนจะก้าวไกลกว่าในการลงมือทำจริง
💰 ผลกระทบต่อราคา AI
ลองเชื่อมโยงเบาะแสทั้งหมดเป็นผลกระทบด้านราคา:
| มิติ | ปัจจุบัน (M3/M3.1) | รุ่นถัดไป (โมเดล 3T) | ผลกระทบต่อราคา |
|---|---|---|---|
| พารามิเตอร์ | ~1.5T (ประมาณ) | 2.5–3T | เพดานความสามารถสูงขึ้น |
| สถาปัตยกรรม | MSA 1.0 | MSA 2.0 | ต้นทุนคำนวณต่อ token ลดลง |
| อัตรากำไรขั้นต้น | เส้นฐาน | คาดว่าสูงกว่า M2 | มีพื้นที่ลดราคาหรือเพิ่มกำไร |
| ความเร็ว inference | ~100 TPS | รอดู (น่าจะเร็วกว่า) | UX ที่ดีกว่าในต้นทุนเดียวกัน |
| ราคา output | ~$1.20/M token | รอดู | แรงกดดันแข่งขันต่อ DeepSeek/Qwen |
บทสรุปสำคัญ: MiniMax กำลังสร้างโมเดลที่ใหญ่กว่าและมีประสิทธิภาพกว่าพร้อมกัน ในตลาดที่ DeepSeek V4 Flash ให้ output ที่ $0.28/M tokens อยู่แล้ว MiniMax ไม่สามารถสู้ทางราคาเพียงอย่างเดียวได้ — ต้องสร้างความแตกต่าง บันทึกชี้ว่ามุมของพวกเขาคือ: คุณภาพระดับแนวหน้า + ความเร็วที่ดีที่สุดในระดับ + อัตรากำไรที่ยั่งยืนผ่านนวัตกรรมสถาปัตยกรรม
🌍 มุมมองเดินสาย arbitrage
สำหรับผู้อ่าน China AI Arbitrage นี่คือเหตุผลที่เรื่องนี้สำคัญ:
ทุกครั้งที่ห้องแลป AI จีนรายหนึ่งแสดงสถาปัตยกรรมที่มีประสิทธิภาพกว่า ก็จะกดดันรายอื่นๆ ทุกราย — DeepSeek, Qwen, GLM, Kimi — ให้ต้องสู้ประสิทธิภาพให้ได้ ไม่ก็ลดราคา การแข่งขันสู่เบื้องล่างนี้เอื้อประโยชน์ต่อนักพัฒนาตะวันตกที่เข้าถึง API เหล่านี้ได้ในราคาเพียงเศษเสี้ยวของราคาอเมริกัน
ห้องแลป AI จีนหลายแห่งเผชิญความไม่แน่นอนด้านคอมพิวต์เพราะการควบคุมการส่งออกของสหรัฐฯ "การเข้าถึงต่างประเทศที่สอดคล้องกฎเกณฑ์" ของ MiniMax หมายความว่า API ของพวกเขามีโอกาสน้อยที่จะเผชิญข้อจำกัดความจุกะทันหัน — เป็นความเสี่ยงจริงสำหรับห้องแลปที่พึ่งพา GPU ภายในประเทศเพียงอย่างเดียว อุปทานเสถียร = ฐาน arbitrage ที่ไว้ใจได้
ถ้าคุณกำลังสร้างผลิตภัณฑ์ที่ขายต่อความจุ AI ของจีนให้ผู้ใช้ตะวันตก latency สำคัญมาก 100 TPS ของ MiniMax หมายความว่าผู้ใช้ปลายทางของคุณจะได้ประสบการณ์ที่ตอบสนองว่องไวกว่า — ซึ่งช่วยให้คุณตั้งราคาสูงกว่าทางเลือกที่ช้ากว่าได้ ความเร็วเป็นคุณค่าเพิ่มที่เปลี่ยนเป็นเงินได้
⏳ บทสรุป
MiniMax ไม่ใช่ห้องแลป AI จีนที่เสียงดังที่สุด — ตำแหน่งนั้นเป็นของ DeepSeek ไม่ใช่แหล่งทุนมากที่สุด — ตำแหน่งนั้นเป็นของ Zhipu หรือ ByteDance แต่บันทึกภายในเหล่านี้ชี้ว่าอาจเป็นรายที่วางตำแหน่งเชิงกลยุทธ์ดีที่สุด: สถาปัตยกรรมเจ้าของที่ลดต้นทุนได้จริง การเข้าถึงคอมพิวต์ต่างประเทศที่ให้ความเสถียร และโมเดลเขียนโค้ดที่แข่งขันได้อยู่แล้วและกำลังจะใหญ่ขึ้นมาก
สามเรื่องที่ต้องจับตา:
- กันยายน–ตุลาคม 2026: การเปิดตัวโมเดล 3T ใหม่ ถ้าเป็นไปตามคำมั่น "นำตลาดในประเทศ" ได้จริง ราคา API ของ MiniMax อาจขยับภูมิทัศน์การแข่งขันทั้งหมด
- การปรับราคา API ของ MiniMax: ถ้า MiniMax ลดราคาหลังเปิดตัวโมเดลใหม่ (น่าจะทำ เพราะกำไรดีขึ้น) มันจะกลายเป็นทางเลือกแทน DeepSeek ที่น่าพิจารณาสำหรับงาน batch
- การ open-source MSA 2.0: MiniMax ยังไม่เปิด MSA ถ้าเปิด จะลดต้นทุนการฝึกในระบบนิเวศ AI จีนทั้งหมดลงอย่างมาก — และเร่งสงครามราคาสู่ศูนย์
สงครามราคา AI ของจีนมีผู้เข้าร่วมใหม่ และรายนี้มีสถาปัตยกรรมที่แท้จริงและใหม่เป็นหลักประกัน
แหล่งข้อมูล: บันทึกภายใน MiniMax (กรกฎาคม 2026) ตรวจสอบข้ามกับราคา API สาธารณะและข้อมูล benchmark ของ MiniMax