Alibaba เปิด Wan3.0 โมเดลสร้างวิดีโอ AI สูงสุด 30 วินาที รองรับข้อความ ภาพ วิดีโอ เสียง เว็บไซต์ PDF และ PowerPoint พร้อมเปิด Public Beta

อาลีบาบา เปิดตัว Wan3.0 เวอร์ชันเบต้า โมเดลสร้างวิดีโอขั้นสูงรองรับการสร้างวิดีโอความยาวสูงสุด 30 วินาที และอินพุตหลายรูปแบบพร้อมกัน (multimodal) นับเป็นอีกก้าวสำคัญของ generative AI ด้วยการผสานความสามารถในการสร้างวิดีโอคุณภาพสูง รักษาความต่อเนื่องและความสอดคล้องขององค์ประกอบภาพที่แม่นยำ รวมถึงการรองรับอินพุตแบบ multimodal ไว้ในโมเดลเดียว ช่วยเพิ่มประสิทธิภาพและลดความซับซ้อนของกระบวนการทำงานสำหรับการใช้งานระดับมืออาชีพ ปัจจุบัน Wan3.0 เปิดให้ทดสอบแบบ public beta แล้ว ผู้ใช้สามารถลงทะเบียนร่วมทดสอบโมเดลผ่าน Model Studio แพลตฟอร์มพัฒนา AI ของอาลีบาบา คลาวด์ และ Qwen Cloud ซึ่งเป็นแพลตฟอร์มคลาวด์แบบ AI-native
เครื่องมือสร้างวิดีโอ AI ทั่วไปสามารถสร้างคลิปได้ตั้งแต่ไม่กี่วินาทีจนถึงประมาณ 15 วินาที (ซึ่งเป็นความยาวสูงสุดของ Wan2.7-Video ซึ่งเป็นโมเดลรุ่นก่อนหน้า) ขณะที่ Wan3.0 รองรับการสร้างวิดีโอที่มีความยาวสูงสุดถึง 30 วินาทีต่อคลิป ช่วยให้ครีเอเตอร์สามารถสร้างสรรค์การเคลื่อนไหวของกล้องที่ซับซ้อน รวมถึงช็อตต่อเนื่องแบบไม่ตัดได้อย่างราบรื่น นอกจากนี้ Wan3.0 ยังมาพร้อมฟีเจอร์ intelligent duration ที่ช่วยแนะนำความยาววิดีโอที่เหมาะสมตามพร้อมต์ของผู้ใช้ รวมถึงฟีเจอร์ video extension ที่ช่วยขยายความยาววิดีโอ เพื่อถ่ายทอดเรื่องราวได้อย่างต่อเนื่องยิ่งขึ้น
อีกหนึ่งจุดเด่นสำคัญของ Wan3.0 คือความสามารถในการรับอินพุตหลายรูปแบบที่ครอบคลุม โดยโมเดลสามารถประมวลผลข้อความ รูปภาพ วิดีโอและเสียงได้พร้อมกัน รวมถึงหน้าเว็บและเอกสารต่าง ๆ อาทิ ไฟล์ PDF และ PowerPoint ฟีเจอร์นี้ช่วยให้ผู้ใช้สามารถเปลี่ยนข้อมูลที่เป็นตัวหนังสือยาว ๆ ที่ไม่มีลูกเล่นใด ๆ ให้เป็นคอนเทนต์วิดีโอที่มีความเคลื่อนไหวได้อย่างมีประสิทธิภาพ
วิดีโอตัวอย่างโดย Wan3.0
Wan3.0 มาพร้อมกับความสามารถในการรักษาความต่อเนื่องของภาพด้วยความแม่นยำสูง เพื่อแก้ไขปัญหาความไม่ต่อเนื่องและผิดเพี้ยนของภาพที่พบได้ทั่วไปในสื่อที่สร้างด้วย AI โดยโมเดลสามารถเรนเดอร์ใบหน้ามนุษย์ได้อย่างสมจริง พร้อมถ่ายทอดรายละเอียดการแสดงออกทางสีหน้าได้อย่างเป็นธรรมชาติและสอดคล้องกัน สร้างเสียงพูดหลายภาษาได้อย่างเป็นธรรมชาติ ตลอดจนแสดงผลหน้าจอซอฟต์แวร์และโมชั่นกราฟิกได้อย่างถูกต้องและมีเสถียรภาพ
นอกเหนือจากความเสถียรของภาพแล้ว Wan3.0 ยังออกแบบให้สามารถถ่ายทอดรายละเอียดที่ซับซ้อนจากอินพุตได้อย่างแม่นยำ พร้อมควบคุมรายละเอียดของตัวละคร และผลิตภัณฑ์ ความสัมพันธ์เชิงพื้นที่ ตลอดจนความสอดคล้องของเสียงได้อย่างมีประสิทธิภาพ แทนที่จะสร้างเพียงภาพที่มีความคล้ายคลึงเท่านั้น นอกจากนี้ Wan3.0 ยังสามารถจำลองตัวละคร อุปกรณ์ประกอบฉาก เสียง การจัดวางองค์ประกอบ และสไตล์จากอินพุตได้อย่างแม่นยำ พร้อมรักษาความสอดคล้องขององค์ประกอบภาพและเสียง ความแม่นยำนี้เมื่อผสานเข้ากับการเคลื่อนไหวและการแสดงอารมณ์ที่เป็นธรรมชาติ ช่วยยกระดับคลิป AI ทั่วไปให้กลายเป็นเรื่องราวที่มีมิติ น่าติดตาม และชวนให้ผู้ชมรู้สึกมีส่วนร่วมกับเรื่องราวมากยิ่งขึ้น
Wan3.0 ออกแบบให้รองรับการใช้งานในหลากหลายอุตสาหกรรม ตั้งแต่การช่วยเพิ่มประสิทธิภาพกระบวนการผลิตสำหรับผู้สร้างภาพยนตร์ การสร้างละครสั้น และคอนเทนต์บนโซเชียลมีเดีย ไปจนถึงช่วยให้ภาคธุรกิจสามารถเปลี่ยนข้อความและรูปภาพให้เป็นวิดีโอสำหรับการตลาดและการศึกษาได้อย่างง่ายดาย นอกจากนี้ Wan3.0 ยังเป็นเครื่องมือทรงพลังสำหรับนักพัฒนาเทคโนโลยี ในการสร้างวิดีโอจำลองสถานการณ์ที่สมจริง เพื่อนำไปใช้ฝึกระบบรถยนต์ไร้คนขับและระบบหุ่นยนต์
อาลีบาบา เปิดตัวโมเดลสร้างภาพและวิดีโอในตระกูล Wan เป็นครั้งแรกเมื่อเดือนกรกฎาคม 2566 จากนั้นได้พัฒนาและยกระดับความสามารถของโมเดลอย่างต่อเนื่อง เพื่อให้การสร้างภาพและวิดีโอมีความสมจริง ใช้งานง่าย และตอบโจทย์การใช้งานของครีเอเตอร์ได้ดียิ่งขึ้น
ติดตามรายละเอียดเพิ่มเติม และ รับชมวิดีโอตัวอย่างที่สร้างโดย Wan3.0 ได้ที่ Alizila
Alibaba Unveils Wan3.0 With 30-Second AI Videos and Multimodal Support for Text, Audio, PDFs and PowerPoint
Alibaba has introduced the beta version of Wan3.0, its latest AI video generation model, doubling the maximum clip length to 30 seconds from the 15-second limit of its predecessor, Wan2.7-Video, while adding multimodal input capabilities within a single model.
Wan3.0 can process text, images, video and audio simultaneously, as well as information from webpages and documents including PDF and PowerPoint files. This allows users to turn text-heavy source material directly into dynamic video content.
The extended 30-second output gives creators more room to generate complex camera movements and longer uninterrupted shots. Wan3.0 also includes an intelligent duration feature that recommends an appropriate video length based on a user’s prompt, along with a video extension function for continuing a sequence beyond the initial clip.
Alibaba said Wan3.0 places greater emphasis on visual continuity and consistency to address distortions commonly found in AI-generated media. The model is designed to render human faces and expressions more naturally, generate multilingual speech, and reproduce software interfaces and motion graphics with greater stability.
The model can also preserve details related to characters, products, spatial relationships, audio, props and visual styles from source inputs, while maintaining consistency across both visual and audio elements throughout a clip.
Potential applications range from filmmaking, short-form drama and social media content to marketing and educational videos generated from text and images. Developers can also use Wan3.0 to create realistic simulation videos for training autonomous driving and robotics systems.
Alibaba first introduced its Wan family of image and video generation models in July 2023 and has continued to expand their capabilities. Wan3.0 is now available for public beta testing through Alibaba Cloud’s Model Studio and Qwen Cloud.
