อาลีบาบา เปิดตัว Wan3.0 เวอร์ชันเบต้า โมเดลสร้างวิดีโอขั้นสูงรองรับการสร้างวิดีโอความยาวสูงสุด 30 วินาที และอินพุตหลายรูปแบบพร้อมกัน (multimodal) นับเป็นอีกก้าวสำคัญของ generative AI ด้วยการผสานความสามารถในการสร้างวิดีโอคุณภาพสูง รักษาความต่อเนื่องและความสอดคล้องขององค์ประกอบภาพที่แม่นยำ รวมถึงการรองรับอินพุตแบบ multimodal ไว้ในโมเดลเดียว ช่วยเพิ่มประสิทธิภาพและลดความซับซ้อนของกระบวนการทำงานสำหรับการใช้งานระดับมืออาชีพ ปัจจุบัน Wan3.0 เปิดให้ทดสอบแบบ public beta แล้ว ผู้ใช้สามารถลงทะเบียนร่วมทดสอบโมเดลผ่าน Model Studio แพลตฟอร์มพัฒนา AI ของอาลีบาบา คลาวด์ และ Qwen Cloud ซึ่งเป็นแพลตฟอร์มคลาวด์แบบ AI-native.
เครื่องมือสร้างวิดีโอ AI ทั่วไปสามารถสร้างคลิปได้ตั้งแต่ไม่กี่วินาทีจนถึงประมาณ 15 วินาที (ซึ่งเป็นความยาวสูงสุดของ Wan2.7-Video ซึ่งเป็นโมเดลรุ่นก่อนหน้า) ขณะที่ Wan3.0 รองรับการสร้างวิดีโอที่มีความยาวสูงสุดถึง 30 วินาทีต่อคลิป ช่วยให้ครีเอเตอร์สามารถสร้างสรรค์การเคลื่อนไหวของกล้องที่ซับซ้อน รวมถึงช็อตต่อเนื่องแบบไม่ตัดได้อย่างราบรื่น นอกจากนี้ Wan3.0 ยังมาพร้อมฟีเจอร์ intelligent duration ที่ช่วยแนะนำความยาววิดีโอที่เหมาะสมตามพร้อมต์ของผู้ใช้ รวมถึงฟีเจอร์ video extension ที่ช่วยขยายความยาววิดีโอ เพื่อถ่ายทอดเรื่องราวได้อย่างต่อเนื่องยิ่งขึ้น
อีกหนึ่งจุดเด่นสำคัญของ Wan3.0 คือความสามารถในการรับอินพุตหลายรูปแบบที่ครอบคลุม โดยโมเดลสามารถประมวลผลข้อความ รูปภาพ วิดีโอและเสียงได้พร้อมกัน รวมถึงหน้าเว็บและเอกสารต่าง ๆ อาทิ ไฟล์ PDF และ PowerPoint ฟีเจอร์นี้ช่วยให้ผู้ใช้สามารถเปลี่ยนข้อมูลที่เป็นตัวหนังสือยาว ๆ ที่ไม่มีลูกเล่นใด ๆ ให้เป็นคอนเทนต์วิดีโอที่มีความเคลื่อนไหวได้อย่างมีประสิทธิภาพ
วิดีโอตัวอย่างโดย Wan3.0
Wan3.0 มาพร้อมกับความสามารถในการรักษาความต่อเนื่องของภาพด้วยความแม่นยำสูง เพื่อแก้ไขปัญหาความไม่ต่อเนื่องและผิดเพี้ยนของภาพที่พบได้ทั่วไปในสื่อที่สร้างด้วย AI โดยโมเดลสามารถเรนเดอร์ใบหน้ามนุษย์ได้อย่างสมจริง พร้อมถ่ายทอดรายละเอียดการแสดงออกทางสีหน้าได้อย่างเป็นธรรมชาติและสอดคล้องกัน สร้างเสียงพูดหลายภาษาได้อย่างเป็นธรรมชาติ ตลอดจนแสดงผลหน้าจอซอฟต์แวร์และโมชั่นกราฟิกได้อย่างถูกต้องและมีเสถียรภาพ
นอกเหนือจากความเสถียรของภาพแล้ว Wan3.0 ยังออกแบบให้สามารถถ่ายทอดรายละเอียดที่ซับซ้อนจากอินพุตได้อย่างแม่นยำ พร้อมควบคุมรายละเอียดของตัวละคร และผลิตภัณฑ์ ความสัมพันธ์เชิงพื้นที่ ตลอดจนความสอดคล้องของเสียงได้อย่างมีประสิทธิภาพ แทนที่จะสร้างเพียงภาพที่มีความคล้ายคลึงเท่านั้น นอกจากนี้ Wan3.0 ยังสามารถจำลองตัวละคร อุปกรณ์ประกอบฉาก เสียง การจัดวางองค์ประกอบ และสไตล์จากอินพุตได้อย่างแม่นยำ พร้อมรักษาความสอดคล้องขององค์ประกอบภาพและเสียง ความแม่นยำนี้เมื่อผสานเข้ากับการเคลื่อนไหวและการแสดงอารมณ์ที่เป็นธรรมชาติ ช่วยยกระดับคลิป AI ทั่วไปให้กลายเป็นเรื่องราวที่มีมิติ น่าติดตาม และชวนให้ผู้ชมรู้สึกมีส่วนร่วมกับเรื่องราวมากยิ่งขึ้น
Wan3.0 ออกแบบให้รองรับการใช้งานในหลากหลายอุตสาหกรรม ตั้งแต่การช่วยเพิ่มประสิทธิภาพกระบวนการผลิตสำหรับผู้สร้างภาพยนตร์ การสร้างละครสั้น และคอนเทนต์บนโซเชียลมีเดีย ไปจนถึงช่วยให้ภาคธุรกิจสามารถเปลี่ยนข้อความและรูปภาพให้เป็นวิดีโอสำหรับการตลาดและการศึกษาได้อย่างง่ายดาย นอกจากนี้ Wan3.0 ยังเป็นเครื่องมือทรงพลังสำหรับนักพัฒนาเทคโนโลยี ในการสร้างวิดีโอจำลองสถานการณ์ที่สมจริง เพื่อนำไปใช้ฝึกระบบรถยนต์ไร้คนขับและระบบหุ่นยนต์
อาลีบาบา เปิดตัวโมเดลสร้างภาพและวิดีโอในตระกูล Wan เป็นครั้งแรกเมื่อเดือนกรกฎาคม 2566 จากนั้นได้พัฒนาและยกระดับความสามารถของโมเดลอย่างต่อเนื่อง เพื่อให้การสร้างภาพและวิดีโอมีความสมจริง ใช้งานง่าย และตอบโจทย์การใช้งานของครีเอเตอร์ได้ดียิ่งขึ้น
ติดตามรายละเอียดเพิ่มเติมและรับชมวิดีโอตัวอย่างที่สร้างโดย Wan3.0 ได้ที่ Alizila
















