Alibaba เปิดตัว Qwen3.8-Flash โมเดล MoE แบบเปิดเผยค่าน้ำหนัก สเปก 125B ดึงใช้จริงเพียง 6B รองรับบริบท 1 ล้านโทเคน พร้อมเชื่อม API ในราคาเริ่มต้น 1 หยวน

อาลีบาบาเปิดตัว Qwen3.8-Flash โมเดลประมวลผลมัลติโมดัลแบบเปิดเผยค่าน้ำหนักที่ผ่านการเทรนเรียบร้อยแล้ว (open-weight) ที่ใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ชูจุดเด่นเรื่องความคุ้มค่าสูงสุด โมเดลนี้ประกอบด้วยโมเดลหลักที่มีพารามิเตอร์ 125 พันล้านรายการ (125B) เสริมด้วย N-gram Embeddings อีก 51 พันล้านรายการ (51B) โดยดึงพารามิเตอร์มาใช้งานจริงเพียง 6 พันล้านพารามิเตอร์ (6B) ต่อหนึ่งโทเคน ซึ่งช่วยสร้างความสมดุลได้อย่างลงตัวระหว่างความสามารถ ความเร็วในการตอบสนอง และต้นทุน เหมาะสำหรับแอปพลิเคชันที่ต้องรองรับปริมาณงานสูง เวิร์กโฟลว์ที่ทำงานร่วมกับเครื่องมือต่าง ๆ ตลอดจนระบบช่วยเขียนโค้ดและผู้ช่วยทำงานร่วม นอกจากนี้ Qwen3.8-Flash ยังเป็นต้นแบบของสถาปัตยกรรมที่ออกแบบมาเพื่อรองรับซีรีส์ Qwen4 ที่กำลังจะเปิดตัวเร็ว ๆ นี้

Qwen3.8-Flash แสดงให้เห็นศักยภาพอันโดดเด่นทั้งการเขียนโค้ดด้วยเอเจนต์ (agentic coding),  การทำงานอัตโนมัติอย่างต่อเนื่องในระยะยาว (long-horizon agent tasks) และ AI ที่ประมวลผลได้แบบมัลติโมดัล (multimodal intelligence) โมเดลนี้ทำคะแนนเทียบชั้นได้กับโมเดลชั้นนำเช่น DeepSeek-V4-Flash และ Claude-Opus-4.6 จากการทดสอบในหลายเกณฑ์วัดมาตรฐาน (benchmarks) ไม่ว่าจะเป็น SWE-bench Pro (การเขียนโค้ดด้วยเอเจนต์), CoWorkBench (งานออฟฟิศที่มีขั้นตอนซับซ้อนและต้องทำอย่างต่อเนื่องเป็นระยะเวลานาน), Toolathlon Verified (การเรียกใช้เครื่องมือจริงเพื่อทำงานซับซ้อนหลายขั้นตอนให้สำเร็จ), MathVision (การแก้โจทย์คณิตศาสตร์ผ่านการประมวลผลและตีความภาพ), AndroidWorld (การควบคุมสมาร์ตโฟนด้วยเอเจนต์) และ ERQA (ปัญญาประดิษฐ์เชิงกายภาพ) 

โมเดลนี้รองรับ context ในตัวได้ 262K โทเคน และขยายได้ถึง 1 ล้านโทเคน ปัจจุบันเปิดให้นักพัฒนาทั่วโลกดาวน์โหลดและใช้งานค่าน้ำหนักโมเดล (weights) ได้แล้วบน Hugging Face และ ModelScope นอกจากนี้ยังสามารถเข้าถึงโมเดลผ่าน API ในราคาประหยัดบน Model Studio และ Qwen Cloud ซึ่งเป็นแพลตฟอร์มคลาวด์ของอาลีบาบาที่สร้างขึ้นเพื่อรองรับ AI อย่างเจาะจง โดยมีอัตราค่าบริการต่อ 1 ล้านโทเคนสำหรับการอินพุตอยู่ที่ 1 หยวน (0.16 ดอลลาร์สหรัฐ) และ 3 หยวน (0.47 ดอลลาร์สหรัฐ) สำหรับเอาต์พุต 

โมเดลนี้ยังพร้อมใช้งานบน QwenWork ซึ่งเป็นแพลตฟอร์ม AI agent สำหรับการทำงานแบบครบวงจรของอาลีบาบา โดยเข้ามาขับเคลื่อน standard mode ออกแบบใหม่ ช่วยลดการใช้โทเคนต่องานลง 75% และเพิ่มความเร็วในการสร้างเนื้อหาได้เกือบสองเท่า เมื่อเทียบกับโหมดปัจจุบัน ช่วยให้ผู้ใช้สามารถดึงความสามารถระดับเรือธงมาใช้กับเวิร์กโหลดทั่วไปได้  

นวัตกรรมทางสถาปัตยกรรม ช่วยยกระดับประสิทธิภาพการประมวลผล

 Qwen3.8-Flash มาพร้อมนวัตกรรมทางสถาปัตยกรรมที่ครอบคลุมทั้ง attention mechanisms, residual connections, embeddings ไปจนถึงการทำ optimization ส่งผลให้โมเดลมีความสามารถสูงขึ้น ควบคู่กับการเพิ่มประสิทธิภาพ การประมวลผล ความจุ และความเสถียรในการเทรน เช่น สถาปัตยกรรม hybrid attention ที่ผสาน Gated DeltaNet (GDN) ที่ช่วยบีบอัดข้อมูลย้อนหลังได้อย่างมีประสิทธิภาพ เข้ากับ Qwen Sparse Attention (QSA) ซึ่งเป็นสถาปัตยกรรมรูปแบบใหม่ที่ใช้ดัชนีบีบอัดน้ำหนักเบาในการคัดเลือกบริบทที่เกี่ยวข้อง ช่วยลดต้นทุนในการประมวลผล attention สำหรับลำดับข้อมูลขนาดยาวได้อย่างมหาศาล นอกจากนี้กลไก Gated Residual (GR) ยังช่วยขยายช่องทางการส่งข้อมูลระหว่างเลเยอร์ พร้อมเสริมความแข็งแกร่งให้กับการไหลของข้อมูล และเพิ่มความเสถียรในการเทรน ในขณะที่เทคนิค N-gram Embedding ช่วยเพิ่มความจุของโมเดลโดยใช้ทรัพยากรการประมวลผลเพิ่มเพียงเล็กน้อย และการใช้ Muon Optimizer ยังช่วยเพิ่มประสิทธิภาพในการเทรนโมเดลขนาดใหญ่ให้ทำได้ดีขึ้น

นวัตกรรมทางสถาปัตยกรรมขับเคลื่อนให้ Qwen3.8-Flash สามารถช่วยลดต้นทุนการเทรนและการอนุมาน (inference) ได้อย่างมีนัยสำคัญเมื่อเทียบกับ Qwen3.7-Plus ซึ่งเป็นโมเดลที่มีขนาดใหญ่กว่าถึงสามเท่า โดยใช้ทรัพยากรในการเทรนเพียงประมาณหนึ่งในเก้าเท่านั้น แต่กลับให้ประสิทธิภาพด้านการเขียนโค้ดและงานออฟฟิศที่เหนือกว่า

ปัจจุบันอาลีบาบาได้เปิดโอเพนซอร์สโมเดลไปแล้วมากกว่า 460 โมเดลให้กับชุมชนโอเพนซอร์ส ซึ่งรวมถึง Hugging Face และ ModelScope จนระบบนิเวศนี้ได้ทำให้เกิดการพัฒนาต่อยอดเป็นโมเดลอนุพันธ์ (derivative models) มากกว่า 300,000 โมเดล และมียอดดาวน์โหลดทั่วโลกสะสมกว่า 3 พันล้านครั้ง ส่งผลให้โมเดลตระกูลนี้กลายเป็นตระกูลโมเดลโอเพนซอร์สที่มียอดดาวน์โหลดสูงที่สุดในโลก 

Alibaba Launches Qwen3.8-Flash with 125B Parameters and 6B Active Parameters per Token

Alibaba has launched Qwen3.8-Flash, an open-weight multimodal AI model built on a Mixture-of-Experts (MoE) architecture. The model is designed for high-volume applications, agentic coding, long-horizon workflows, and tool-based work.

Qwen3.8-Flash combines a 125-billion-parameter core model with 51 billion N-gram Embedding parameters, while activating only 6 billion parameters per token. This approach is designed to balance model capability, response speed, and inference cost.

Alibaba says Qwen3.8-Flash delivers performance comparable to leading models such as DeepSeek-V4-Flash and Claude-Opus-4.6 across benchmarks covering agentic coding, complex office workflows, multi-step tool use, visual mathematics, smartphone control, and physical intelligence.

The model supports a native context window of 262K tokens, expandable to 1 million tokens. Its architecture combines Gated DeltaNet, Qwen Sparse Attention, Gated Residual, and N-gram Embedding technologies to improve long-sequence processing, information flow, training stability, and model capacity.

According to Alibaba, Qwen3.8-Flash requires approximately one-ninth of the training resources used by Qwen3.7-Plus, despite Qwen3.7-Plus being around three times larger. The new model also delivers stronger performance in coding and office-related tasks.

Developers can download the model weights through Hugging Face and ModelScope. API access is available through Model Studio and Qwen Cloud at 1 yuan, or approximately US$0.16, per million input tokens and 3 yuan, or approximately US$0.47, per million output tokens.

Qwen3.8-Flash is also available on Alibaba’s QwenWork platform, where it powers a redesigned standard mode. The company says the mode reduces token usage per task by 75% and nearly doubles content-generation speed compared with the previous mode.

The model also serves as an architectural preview for the upcoming Qwen4 series. Alibaba has released more than 460 models to the open-source community, generating more than 300,000 derivative models and over 3 billion downloads worldwide.

Comments

comments