บันทึกภายใน MiniMax — โมเดลรุ่นถัดไป สถาปัตยกรรม MSA ความเร็วการเขียนโค้ด โครงสร้างพื้นฐานคอมพิวต์

📋 ข้อมูลภายในรั่วไหล

ชุดบันทึกภายในจาก MiniMax — หนึ่งในห้องแลป AI ของจีนที่ถูกประเมินต่ำเกินไป — เพิ่งถูกเปิดเผย เอกสารฉบับนี้ครอบคลุมสี่ด้าน: การพัฒนาโมเดลรุ่นถัดไป ตำแหน่งการแข่งขันบน benchmark การเขียนโค้ด กลยุทธ์โครงสร้างพื้นฐานคอมพิวต์ และมุมมองอัตรากำไรขั้นต้น มองรวมกันแล้วภาพที่ได้คือบริษัทที่กำลังจะขับเคลื่อนอย่างจริงจังในสนามโมเดลแนวหน้า — และอาจปรับโฉมภูมิทัศน์ราคาของ AI API จีนได้

นอกจีน ชื่อ MiniMax อาจไม่คุ้นหู แต่ในวงการอุตสาหกรรม พวกเขาโด่งดังจากสองอย่าง: กลไก Lightning Attention (ที่พัฒนาต่อมาเป็น MSA) ที่ทำให้ inference คอนเท็กซ์ยาวถูกลงอย่างมาก และโมเดลเขียนโค้ด (M3) ที่ทำผลงานเกินระดับตัวเอง บันทึกเหล่านี้ชี้ว่าทั้งสองจุดแข็งกำลังจะใหญ่ขึ้นมาก

🧬 รุ่นถัดไป: 2.5–3 ล้านล้านพารามิเตอร์

ตัวเลขสำคัญ: โมเดลรุ่นถัดไปของ MiniMax เป็นเป้าหมายที่ 2.5–3 ล้านล้านพารามิเตอร์ เทียบเคียงให้เห็นภาพ GPT-4 ประมาณ 1.8T และ DeepSeek V4 น่าจะอยู่ในช่วง 1–2T ถ้า MiniMax ไปถึง 3T จะกลายเป็นหนึ่งในโมเดล dense/MoE ที่ใหญ่ที่สุดเท่าที่เคยฝึกมา

การ pre-train โมเดลใหม่นี้รันมาแล้วราวครึ่งเดือน และตามบันทึก การลู่เข้าเกินคาด โมเดลใช้สถาปัตยกรรม MSA 2.0 (อธิบายด้านล่าง) และมีทั้งจำนวนพารามิเตอร์และจำนวน activation เพิ่มขึ้นเกือบเป็นสองเท่าเมื่อเทียบกับรุ่น M2 ปัจจุบัน

ไทม์ไลน์: โมเดลใหม่คาดว่าจะเปิดตัวหลังฤดูร้อน 2026 (น่าจะประมาณกันยายน–ตุลาคม) ทีมภายในมั่นใจมากในผลงานและความพร้อม โดยอ้างว่าจะนำตลาดในประเทศ (จีน)

⚡ MSA 2.0: อาวุธลับด้านประสิทธิภาพต้นทุน

MSA ย่อมาจาก Multi-Scale Attention — สถาปัตยกรรมกรรมเจ้าของของ MiniMax ที่วิวัฒนาการมาจากงาน Lightning Attention ดั้งเดิม จุดแข็งหลักคือ: ลดค่าใช้จ่ายการคำนวณ Attention ลงอย่างมาก ในขณะที่ยังรักษาคุณภาพโมเดลไว้ได้

ทำไมเรื่องนี้สำคัญต่อราคา:

  • ประสิทธิภาพการฝึก: MSA 2.0 ให้ MiniMax ฝึกโมเดล 3T พารามิเตอร์ในต้นทุนเพียงเศษเสี้ยวของ Transformer มาตรฐาน ต้นทุนฝึกต่ำลง = ทุนที่ต้องคืนน้อยลง = พื้นที่ให้ตั้งราคา API ก้าวร้าวมากขึ้น
  • ประสิทธิภาพการ inference: MSA รองรับลำดับขนาดยิ่งใหญ่โดยลดค่าใช้จ่ายคำนวณลงหนึ่งระดับอันดับ หมายความว่า MiniMax สามารถเสนอหน้าต่างคอนเท็กซ์กว่า 1M ด้วยต้นทุนส่วนเพิ่มที่ต่ำกว่าคู่แข่งที่ใช้ Attention แบบเดิมๆ มาก
  • อัตรากำไรขั้นต้น: บันทึกระบุชัดเจนว่า แม้พารามิเตอร์และ activation จะเพิ่มเป็นสองเท่า อัตรากำไรขั้นต้นของโมเดลใหม่คาดว่าจะสูงกว่า M2 เป็นไปได้ก็ต่อเมื่อ MSA 2.0 ลดต้นทุนต่อ token ได้จริง
💡 ข้อสังเกตสำคัญ: ห้องแลป AI จีนส่วนใหญ่แข่งเรื่องราคาด้วยการเผาเงิน MiniMax ดูเหมือนจะแข่งทางสถาปัตยกรรม — ลดต้นทุนผ่านวิศวกรรม ไม่ใช่ผ่านการอุดหนุน นี่เป็นคู่แข่งที่ยั่งยืนกว่ามาก

🚀 ความสามารถเขียนโค้ดและความเร็วการ inference

บันทึกเผยรายละเอียดที่น่าสนใจเกี่ยวกับกลยุทธ์เขียนโค้ดของ MiniMax:

  • M3 เป็นโมเดลที่เร็วที่สุดในไลน์อัพหลัก — ประมาณ 100 TPS (tokens per second) โดยอ้างว่าเร็วกว่าคู่แข่งทุกราย สำหรับเวิร์กโฟลว์เขียนโค้ดที่นักพัฒนาดู output สตรีมมาแบบเรียลไทม์ ความได้เปรียบด้านความเร็วนี้แปลเป็น UX ที่ดีกว่าโดยตรง
  • ปรัชญาการฝึกของ MiniMax เน้นข้อมูลโค้ดระดับมืออาชีพคุณภาพสูงมากกว่าปริมาณล้วนๆ บันทึกย้ำว่า "คุณภาพและวิธีการฝึกสำคัญกว่าปริมาณ" — ท่าทีที่สวนกระแสในอุตสาหกรรมที่หมกมุ่นกับสเกลของชุดข้อมูล
  • M3.1 เป็นการอัปเกรดครั้งใหญ่จาก M3 (ซึ่งมีจุดอ่อนเพราะ post-training ถูกเร่งจนเกินไป) ด้วยการปรับคุณภาพข้อมูลและเพิ่มข้อมูลงาน long-horizon M3.1 ทำผลงานได้ดีขึ้นระดับอันดับบนปัญหาเขียนโค้ดที่ซับซ้อน

สำหรับผู้อ่าน China AI Arbitrage: โมเดลเขียนโค้ดของ MiniMax ปัจจุบันตั้งราคาประมาณ $1.20/M output tokens — แข่งกับ Qwen ได้และถูกกว่า GLM อยู่แล้ว ถ้าโมเดลรุ่นถัดไปเป็นไปตามที่สัญญา MiniMax อาจกลายเป็นตัวเลือกเขียนโค้ดที่คุ้มค่าที่สุดในตลาด AI จีน

🏗️ โครงสร้างพื้นฐานคอมพิวต์: ความได้เปรียบทางทรัพยากรต่างประเทศ

หนึ่งในส่วนที่เปิดเผยข้อมูลได้มากที่สุด: MiniMax เข้าถึงทรัพยากร GPU ต่างประเทศในรูปแบบที่สอดคล้องกฎเกณฑ์ ทำให้แซงหน้าคู่แข่ง AI จีนส่วนใหญ่ที่กำลังวิ่งหาทางเลือกภายในประเทศอย่างเลือดลายไหล

  • เครือข่ายสร้างเอง: MiniMax สร้างโครงสร้างเครือข่ายเชื่อมระหว่าง GPU ของตัวเอง แทนที่จะพึ่งพาโซลูชันของผู้จำหน่าย บันทึกอ้างว่าประหยัดทั้งต้นทุนและเวลา และเสถียรภาพ "เกินคาด"
  • ไปป์ไลน์คอมพิวต์ภายในประเทศ: GPU ที่ผลิตในจีนใช้ได้แต่ความจำกัดด้านความจุ MiniMax คาดว่าคลัสเตอร์ GPU ในประเทศแรกจะออนไลน์ในไตรมาส 3 ปี 2026 เริ่มจากงาน inference ก่อน
  • กลยุทธ์สองทาง: GPU ต่างประเทศสำหรับการฝึก (ที่ต้องการประสิทธิภาพขั้นสูงสุด), GPU ในประเทศสำหรับ inference (ที่ต้องการสเกลและประสิทธิภาพต้นทุน) นี่คือแนวทางปฏิบัติที่ห้องแลป AI จีนส่วนใหญ่ปรารถนา — MiniMax ดูเหมือนจะก้าวไกลกว่าในการลงมือทำจริง

💰 ผลกระทบต่อราคา AI

ลองเชื่อมโยงเบาะแสทั้งหมดเป็นผลกระทบด้านราคา:

มิติปัจจุบัน (M3/M3.1)รุ่นถัดไป (โมเดล 3T)ผลกระทบต่อราคา
พารามิเตอร์~1.5T (ประมาณ)2.5–3Tเพดานความสามารถสูงขึ้น
สถาปัตยกรรมMSA 1.0MSA 2.0ต้นทุนคำนวณต่อ token ลดลง
อัตรากำไรขั้นต้นเส้นฐานคาดว่าสูงกว่า M2มีพื้นที่ลดราคาหรือเพิ่มกำไร
ความเร็ว inference~100 TPSรอดู (น่าจะเร็วกว่า)UX ที่ดีกว่าในต้นทุนเดียวกัน
ราคา output~$1.20/M tokenรอดูแรงกดดันแข่งขันต่อ DeepSeek/Qwen

บทสรุปสำคัญ: MiniMax กำลังสร้างโมเดลที่ใหญ่กว่าและมีประสิทธิภาพกว่าพร้อมกัน ในตลาดที่ DeepSeek V4 Flash ให้ output ที่ $0.28/M tokens อยู่แล้ว MiniMax ไม่สามารถสู้ทางราคาเพียงอย่างเดียวได้ — ต้องสร้างความแตกต่าง บันทึกชี้ว่ามุมของพวกเขาคือ: คุณภาพระดับแนวหน้า + ความเร็วที่ดีที่สุดในระดับ + อัตรากำไรที่ยั่งยืนผ่านนวัตกรรมสถาปัตยกรรม

🌍 มุมมองเดินสาย arbitrage

สำหรับผู้อ่าน China AI Arbitrage นี่คือเหตุผลที่เรื่องนี้สำคัญ:

1. การแข่งขันผลักดันให้ทั้งอุตสาหกรรมลดราคา
ทุกครั้งที่ห้องแลป AI จีนรายหนึ่งแสดงสถาปัตยกรรมที่มีประสิทธิภาพกว่า ก็จะกดดันรายอื่นๆ ทุกราย — DeepSeek, Qwen, GLM, Kimi — ให้ต้องสู้ประสิทธิภาพให้ได้ ไม่ก็ลดราคา การแข่งขันสู่เบื้องล่างนี้เอื้อประโยชน์ต่อนักพัฒนาตะวันตกที่เข้าถึง API เหล่านี้ได้ในราคาเพียงเศษเสี้ยวของราคาอเมริกัน
2. การเข้าถึง GPU ต่างประเทศของ MiniMax = อุปทานเสถียร
ห้องแลป AI จีนหลายแห่งเผชิญความไม่แน่นอนด้านคอมพิวต์เพราะการควบคุมการส่งออกของสหรัฐฯ "การเข้าถึงต่างประเทศที่สอดคล้องกฎเกณฑ์" ของ MiniMax หมายความว่า API ของพวกเขามีโอกาสน้อยที่จะเผชิญข้อจำกัดความจุกะทันหัน — เป็นความเสี่ยงจริงสำหรับห้องแลปที่พึ่งพา GPU ภายในประเทศเพียงอย่างเดียว อุปทานเสถียร = ฐาน arbitrage ที่ไว้ใจได้
3. ความได้เปรียบความเร็ว 100 TPS เป็นตัวเร่ง arbitrage
ถ้าคุณกำลังสร้างผลิตภัณฑ์ที่ขายต่อความจุ AI ของจีนให้ผู้ใช้ตะวันตก latency สำคัญมาก 100 TPS ของ MiniMax หมายความว่าผู้ใช้ปลายทางของคุณจะได้ประสบการณ์ที่ตอบสนองว่องไวกว่า — ซึ่งช่วยให้คุณตั้งราคาสูงกว่าทางเลือกที่ช้ากว่าได้ ความเร็วเป็นคุณค่าเพิ่มที่เปลี่ยนเป็นเงินได้

⏳ บทสรุป

MiniMax ไม่ใช่ห้องแลป AI จีนที่เสียงดังที่สุด — ตำแหน่งนั้นเป็นของ DeepSeek ไม่ใช่แหล่งทุนมากที่สุด — ตำแหน่งนั้นเป็นของ Zhipu หรือ ByteDance แต่บันทึกภายในเหล่านี้ชี้ว่าอาจเป็นรายที่วางตำแหน่งเชิงกลยุทธ์ดีที่สุด: สถาปัตยกรรมเจ้าของที่ลดต้นทุนได้จริง การเข้าถึงคอมพิวต์ต่างประเทศที่ให้ความเสถียร และโมเดลเขียนโค้ดที่แข่งขันได้อยู่แล้วและกำลังจะใหญ่ขึ้นมาก

สามเรื่องที่ต้องจับตา:

  1. กันยายน–ตุลาคม 2026: การเปิดตัวโมเดล 3T ใหม่ ถ้าเป็นไปตามคำมั่น "นำตลาดในประเทศ" ได้จริง ราคา API ของ MiniMax อาจขยับภูมิทัศน์การแข่งขันทั้งหมด
  2. การปรับราคา API ของ MiniMax: ถ้า MiniMax ลดราคาหลังเปิดตัวโมเดลใหม่ (น่าจะทำ เพราะกำไรดีขึ้น) มันจะกลายเป็นทางเลือกแทน DeepSeek ที่น่าพิจารณาสำหรับงาน batch
  3. การ open-source MSA 2.0: MiniMax ยังไม่เปิด MSA ถ้าเปิด จะลดต้นทุนการฝึกในระบบนิเวศ AI จีนทั้งหมดลงอย่างมาก — และเร่งสงครามราคาสู่ศูนย์

สงครามราคา AI ของจีนมีผู้เข้าร่วมใหม่ และรายนี้มีสถาปัตยกรรมที่แท้จริงและใหม่เป็นหลักประกัน

แหล่งข้อมูล: บันทึกภายใน MiniMax (กรกฎาคม 2026) ตรวจสอบข้ามกับราคา API สาธารณะและข้อมูล benchmark ของ MiniMax