MMAudio Video-to-Audio Generator

MMAudio สังเคราะห์ซาวด์แทร็กแบบภาพยนตร์จากวิดีโอและข้อความเสริม — ไม่ได้ดึงเสียงเดิมออกจากไฟล์ ความต่างนี้สำคัญ: หน้า "วิดีโอเป็นเสียง" ส่วนใหญ่เป็นตัวแยกเสียง MMAudio เป็นโมเดลวิจัย video-to-audio (CVPR 2025) ที่ต้องใช้ GPU ดังนั้นหน้านี้ไม่แสร้งรันในเบราว์เซอร์ วางลิงก์ในเครื่องมือ BibiGPT ด้านล่างเพื่ออ่านภาพและเนื้อหาที่พูดก่อน — นี่คือครึ่งฝั่งเข้าใจของเวิร์กโฟลว์ซาวด์แทร็ก

สร้างใหม่ ไม่ใช่แยกเสียง โมเดลวิจัยบน GPU ฝังสรุปสด

Read the video here before you score it

Paste a video or podcast URL — BibiGPT returns key points, a transcript, and a visual read. The live app loads inline. This is not an in-browser MMAudio renderer.

เพิ่ม BibiGPT เป็นแหล่งข้อมูลที่ต้องการบน Google เห็น BibiGPT มากขึ้นใน Top Stories และคำตอบจาก AI

การสร้างกับการแยกเสียงในหนึ่งประโยค

MMAudio เขียนซาวด์แทร็กใหม่ที่ตามภาพ ตัวแยกเสียงคัดลอกเสียงที่มีอยู่แล้วในไฟล์ หน้านี้อธิบายเจตนาการสร้าง แล้วส่งต่อ embed BibiGPT สดให้คุณสรุปและอ่านภาพคลิปเดียวกันก่อนไปหา GPU demo

Features

MMAudio ทำอะไรจริงๆ

MMAudio เป็นโมเดล video-to-audio generation: ได้คลิปและข้อความเสริมแล้วเขียนซาวด์แทร็กใหม่ที่ซิงก์กับเฟรม เครื่องมือแยกเสียง extraction แทร็กที่มีอยู่แล้วในคอนเทนเนอร์ การปนเจตนาทั้งสองแบบทำให้หน้าค้นหากินกันเอง

สร้างใหม่ ไม่ใช่การแยกเสียง

ตัวแยกเสียงตอบว่า "ขอ MP3 ที่มีอยู่แล้วใน MP4 นี้" MMAudio ตอบว่า "สร้างโฟลีย์ แอมเบียนซ์ หรือสกอร์ที่เข้ากับภาพบนจอ" วิดีโอ AI เงียบ คลิป temp-track และ demo วิจัยอยู่ในถังหลัง

วิดีโอ + ข้อความเสริมเป็นเงื่อนไข

งาน MMAudio ปี 2024–2025 เทรนร่วมบนข้อมูล video-audio และ text-audio แล้วจัด latent เสียงให้ตรงเฟรมวิดีโอ คุณบังคับทิศทางเสียงด้วยพรอมต์สั้นได้ แต่ภาพยังเป็นตัวขับจังหวะ

ไม่ใช่ codec ในเบราว์เซอร์

checkpoint สาธารณะอยู่ระดับพารามิเตอร์ราว 157M และผู้เขียนรายงานว่าสร้างคลิป 8 วินาทีได้ในราว 1.23 วินาทีบน GPU ไม่มีพอร์ต WebAssembly แลนดิ้งที่ "แปลง" ในแท็บคือการแยกเสียง ไม่ใช่การรัน MMAudio

ทำไม BibiGPT อยู่ข้างตัวสร้าง

งานซาวด์แทร็กเริ่มจากการรู้ว่าภาพกำลังทำอะไร BibiGPT เปลี่ยนลิงก์เดียวกันเป็นบทถอดเสียงพร้อม timestamp สรุปมีโครง และการอ่านภาพ — บรีฟที่คุณจะส่งนักออกแบบเสียง โดยไม่ต้องประกอบสแต็กวิจัยเอง

อ่านฉากก่อนใส่สกอร์

ตัวสร้างจับคู่การเคลื่อนไหวกับข้อความพรอมต์ มันไม่บอกอาร์กิวเมนต์ของบรรยาย จังหวะมุกของคลิปสั้น หรือวัตถุที่ปรากฏจริง สรุปและการวิเคราะห์ภาพเติมช่องว่างนั้น

ลิงก์เดียว ไม่ต้องเซ็ตอัพ GPU

วางเวิร์กโฟลว์ YouTube Bilibili หรือไฟล์ท้องถิ่นใน embed ด้านบน คุณได้โน้ตที่ค้นหาและส่งออกได้ ครึ่งฝั่งสร้างยังอยู่ที่ demo วิจัยหรือเครื่องสตูดิโอ

เก็บตัวแยกเสียงให้อยู่เลนของมัน

ถ้าต้องการแทร็กเดิมจริงๆ ใช้ตัวแยกเสียง MP4-to-MP3 หน้านี้จะไม่รีแบรนด์งานนั้นเป็น MMAudio หนึ่งเจตนา หนึ่ง URL

3 ขั้นตอนบนหน้านี้

คุณจะไม่เรนเดอร์ MMAudio ที่นี่ คุณจะออกไปพร้อมบรีฟของคลิปและการแยกเจตนาสร้างกับการแยกเสียงที่ชัดเจน

  1. 1

    เปิดตัวสรุปสด

    ใช้ embed ใต้ฮีโร่ วาง URL วิดีโอหรือพอดแคสต์ แอป BibiGPT โหลดในหน้า — ไม่ต้องเปิดแท็บเพิ่มเพื่อเริ่ม

  2. 2

    อ่านภาพและเสียงพูด

    ได้สรุปมีโครง บทถอดเสียงพร้อม timestamp และการอ่านภาพว่าอะไรปรากฏบนจอ นั่นคือบรีฟที่พาสซาวด์แทร็กต้องการ

  3. 3

    เลือกสร้างหรือแยกเสียง

    ภาพเงียบหรือสกอร์แย่ → GPU demo ของ MMAudio หรือโปรแกรมตัดเสียง แทร็กเดิมที่ต้องเก็บ → ตัวแยกเสียง อย่าส่งงานทั้งสองไป URL เดียวกัน

MMAudio กับตัวแยกเสียง กับ BibiGPT

สามเครื่องมือ สามงาน ทั้งเครื่องมือค้นหาและคนต้องการให้แยกนี้อย่างตรงไปตรงมา

ความสามารถ MMAudio (สร้าง) เครื่องมือแยกเสียง BibiGPT
ผลลัพธ์ ซาวด์แทร็กใหม่ซิงก์กับภาพ สตรีมเสียงเดิมที่แยกออก แล้ว บทถอดเสียง สรุป การวิเคราะห์ภาพ
รันในเบราว์เซอร์ ไม่ — GPU / demo วิจัย มักได้ (แปลงในเครื่อง) ได้ — วางลิงก์
เหมือน "วิดีโอเป็นเสียง" หรือไม่? เฉพาะความหมายฝั่งสร้าง ใช่ — ความหมายฝั่งแยกเสียง ไม่ — เข้าใจคลิป
เหมาะเมื่อ คลิปเงียบหรือต้องการสกอร์ใหม่ ต้องเก็บแทร็กต้นทาง ต้องรู้ก่อนว่าเกิดอะไรขึ้น

3 สถานการณ์ทั่วไป

จุดที่การสร้าง การแยกเสียง และการเข้าใจไม่ควรใช้ URL ร่วมกัน

วิดีโอ AI เงียบที่ยังต้องการห้องเสียง

คลิป text-to-video มาโดยไม่มีโฟลีย์ ก่อนอื่น BibiGPT บอกว่าอะไรอยู่บนจอจริง แล้วโมเดลสร้างเสนอแอมเบียนซ์ที่ตามเหตุการณ์เหล่านั้น — ไม่ใช่ MP3 ที่ดึงจากแทร็กเสียงว่าง

คลิปที่ตัดแล้วแต่ temp track ส่งไม่ได้

ภาพล็อกแล้ว เพลง placeholder มีปัญหาลิขสิทธิ์หรือผิด อ่านบีตของฉากจากสรุป แล้วสร้างหรือออกแบบสกอร์ การแยกเสียงจะให้แค่ temp track ที่คุณเกลียดอยู่แล้ว

บรรยายที่ต้องเก็บคำต่อคำ

นี่คืองานแยกเสียงและถอดเสียง แยกเสียงพูดเดิม แล้วสรุป MMAudio จะประดิษฐ์เบดใหม่และทิ้งคำที่สำคัญ ส่งเจตนานี้ไปตัวแยกเสียงบวก BibiGPT ไม่ใช่ตัวสร้าง

แหล่งที่มา

ข้อเท็จจริงโมเดลด้านล่างอิงเปเปอร์และหน้าโปรเจกต์ของผู้เขียน ไม่ใช่ข้อความจากรีเซลเลอร์

  • MMAudio สังเคราะห์เสียงคุณภาพสูงที่ซิงก์จากวิดีโอและข้อความเสริมผ่าน multimodal joint training และโมดูลซิงก์ระดับเฟรม ผู้เขียนรายงานพารามิเตอร์ 157M และใช้เวลา 1.23 วินาทีสร้างคลิป 8 วินาที พร้อมโค้ดและ demo ที่หน้าโปรเจกต์

    Cheng et al., arXiv:2412.15322 (CVPR 2025) ↗
  • หน้าโปรเจกต์ โค้ด Hugging Face demo และ Colab ของ MMAudio เผยแพร่โดยผู้เขียนที่ hkchengrex.github.io/MMAudio

    MMAudio project page ↗

นิยาม video-to-audio

MMAudio คืออะไร?

MMAudio เป็นโมเดล generative หลายโมดัลที่สังเคราะห์เสียงซิงก์จากวิดีโอและข้อความเสริม การเทรนร่วมบนข้อมูล video-audio และ text-audio สอนการจัดความหมาย โมดูลซิงก์จัด latent เสียงให้ตรงเฟรมวิดีโอ ผลลัพธ์คือซาวด์แทร็กใหม่ ไม่ใช่การแยกเสียง ของไฟล์ต้นทาง

video-to-audio generation คืออะไร?

video-to-audio generation คืองานผลิตเวฟฟอร์มเสียงใหม่ที่ตรงกับเหตุการณ์และจังหวะของวิดีโอ และบางครั้งบังคับทิศทางด้วยพรอมต์ข้อความ ใช้เมื่อคลิปเงียบ สกอร์แย่ หรือถูกสร้างโดยไม่มีเสียง ไม่ใช่การรู้จำคำพูด และไม่ใช่การดึง MP3 ออกจาก MP4

การแยกเสียงจากวิดีโอคืออะไร?

การแยกเสียง คัดลอกสตรีมเสียงที่มีอยู่แล้วในคอนเทนเนอร์วิดีโอไปเป็นไฟล์เช่น MP3 หรือ WAV ไม่มีการประดิษฐ์เสียงใหม่ การแยกเสียงเหมาะเมื่อต้องเก็บเสียงพูดหรือเพลงต้นทาง การสร้างเหมาะเมื่อสตรีมนั้นหายหรือผิด

เป็นที่ชื่นชอบของครีเอเตอร์ นักเรียน และนักวิจัย

เหตุผลที่ผู้คนใช้ BibiGPT แปลงวิดีโอเป็นข้อความทุกวัน

ผู้ใช้กว่า 50,000 คนทั่วโลกไว้วางใจ

★★★★★

“แค่วางลิงก์ก็ได้ข้อความซับไตเติลที่เรียบร้อยในไม่กี่วินาที ช่วยประหยัดเวลาพิมพ์ซ้ำหลายชั่วโมงทุกสัปดาห์”

Maya R.

ครีเอเตอร์ · นำวิดีโอสั้นมาใช้ใหม่

★★★★★

“การส่งออกทรานสคริปต์ทำให้ฉันทบทวนคำศัพท์ใหม่ตามจังหวะของตัวเอง โดยไม่ต้องกดหยุดวิดีโอตลอดเวลา”

Daniel K.

ผู้เรียนภาษา · เรียนรู้จากวิดีโอจริง

★★★★★

“ข้อความแม่นยำพร้อมไทม์สแตมป์ที่นำไปอ้างอิงได้ทันที กลายเป็นส่วนหนึ่งของงานประจำวันของฉันไปแล้ว”

Priya S.

นักวิจัย · อ้างอิงงานบรรยายสาธารณะ

คำถามที่พบบ่อย

ถามอะไรก็ได้

Popular guides

อ่านคลิปก่อนใส่สกอร์

วางลิงก์ Bilibili YouTube หรือพอดแคสต์ — หรืออัปโหลดไฟล์ BibiGPT ส่งคืนบทถอดเสียงพร้อม timestamp สรุปด้วย AI และการอ่านภาพที่ค้นหาและส่งออกได้ ไม่ต้องมี GPU ไม่ต้องเซ็ตอัพวิจัย และไม่เคลมว่านี่คือ MMAudio เอง