MMAudio 是什么?
MMAudio 是多模态生成模型,能根据视频和可选文字合成同步音频。在视频—音频与文字—音频数据上联合训练,学会语义对齐;同步模块再把音频潜变量对齐到视频帧。结果是全新配乐,不是对源文件做提取。
MMAudio 根据视频和可选文字合成电影感配乐——它不会把文件里已有的原音抠出来。这个区别很关键:网上多数「视频转音频」页其实是提取器。MMAudio 是需要 GPU 的研究级视频转音频生成模型(CVPR 2025),所以本页不会假装能在浏览器里跑它。先在下方的 BibiGPT 实装工具里粘贴链接,读懂画面和口播内容——这是配乐工作流里「理解」那一半。
Paste a video or podcast URL — BibiGPT returns key points, a transcript, and a visual read. The live app loads inline. This is not an in-browser MMAudio renderer.
MMAudio 写出跟随画面的全新配乐;提取器复制文件里已有的音频。本页讲清「生成」意图,再交给你一个可用的 BibiGPT 嵌入,让你在去找 GPU 演示之前,先总结并视觉解读同一段片子。
MMAudio 是视频转音频生成模型:给你一段片子和可选文字,它写出与帧对齐的全新音轨。提取工具只是把容器里已有的音轨拆出来。把这两种意图混在一起,搜索页就会互相抢流量。
提取器回答的是「把这个 MP4 里已有的 MP3 给我」。MMAudio 回答的是「发明一段贴合画面的拟音、环境声或配乐」。无声 AI 视频、临时轨粗剪、研究演示,都属于第二种。
2024–2025 的 MMAudio 工作在视频—音频与文字—音频数据上联合训练,再把音频潜变量对齐到视频帧。你可以用短提示词引导音色,但节奏仍由画面驱动。
公开权重大约在 1.57 亿参数量级,作者报告在 GPU 上生成 8 秒片段约需 1.23 秒。没有 WebAssembly 移植。声称「页内一键转换」的落地页,做的是提取,不是在跑 MMAudio。
配乐工作从搞清画面在干什么开始。BibiGPT 把同一条链接变成带时间戳的文字稿、结构化总结和视觉解读——相当于交给音效师的简报,却不用自己搭一整套研究环境。
生成器匹配运动和提示词,不会告诉你讲座在争什么、短视频的笑点卡在哪、画面里实际出现了哪些物体。总结和视觉分析补的正是这块。
把 YouTube、Bilibili 或本地文件工作流粘进上方嵌入区,就能拿到可搜索、可导出的笔记。生成那一半仍然属于研究演示或工作室机器。
真要原音轨,请用 MP4-to-MP3 提取器。本页不会把那份活重新包装成 MMAudio。一种意图,一个 URL。
你不会在这里渲染 MMAudio。你会带走一份片子简报,以及生成与提取之间清晰的分界。
用 hero 下方的嵌入区。粘贴视频或播客 URL。BibiGPT 应用内联加载——开始时不必另开标签页。
拿到结构化总结、带时间戳的文字稿,以及对画面内容的视觉解读。这正是配乐这一关需要的简报。
静音或配乐很差的画面 → GPU 上的 MMAudio 演示或声音编辑器。必须保留的原轨 → 提取器。别把两种活丢给同一个 URL。
三个工具,三份活。搜索引擎和人都需要把这个分界讲诚实。
| 能力 | MMAudio(生成) | 提取音频工具 | BibiGPT |
|---|---|---|---|
| 输出 | 与画面同步的全新配乐 | 拆出的原音轨 | 文字稿、总结、视觉分析 |
| 能否在浏览器跑 | 否 — 需要 GPU / 研究演示 | 常常可以(本地转换) | 可以 — 粘贴链接即可 |
| 等于「视频转音频」吗? | 仅在「生成」这个意义上 | 是 — 「提取」这个意义 | 否 — 用来理解片子 |
| 最适合何时 | 片子静音或需要新配乐 | 必须保留源音轨 | 你得先知道发生了什么 |
生成、提取与理解,不该共用一个 URL。
文生视频来了,却没有拟音。先让 BibiGPT 告诉你画面上到底有什么,再让生成模型提出跟随那些事件的环境声——而不是从空音轨里「抠」出一个 MP3。
画面已定;占位音乐有版权问题或完全不对。先从总结里读场景节拍,再生成或设计配乐。提取只会把你已经讨厌的临时轨再给你一遍。
这是提取加转写的活。先提取 原声人声,再做总结。MMAudio 会发明一条新底噪,把真正重要的话扔掉。把这种意图交给提取器加 BibiGPT,别交给生成器。
下方模型事实遵循论文与作者项目页,不是经销商文案。
MMAudio 通过多模态联合训练与帧级同步模块,从视频和可选文字合成高质量、同步的音频。作者报告约 1.57 亿参数,生成 8 秒片段约 1.23 秒,代码与演示见项目页。
Cheng et al., arXiv:2412.15322 (CVPR 2025) ↗MMAudio 的项目页、代码、Hugging Face 演示与 Colab 由作者发布在 hkchengrex.github.io/MMAudio。
MMAudio project page ↗MMAudio 是多模态生成模型,能根据视频和可选文字合成同步音频。在视频—音频与文字—音频数据上联合训练,学会语义对齐;同步模块再把音频潜变量对齐到视频帧。结果是全新配乐,不是对源文件做提取。
视频转音频生成是产出一段匹配视频事件与节奏的新音频波形,有时用文字提示引导。片子静音、配乐糟糕、或生成时本来就没有声音时会用到它。它不是语音识别,也不是从 MP4 里抠出 MP3。
音频提取(추출)把视频容器里已存的音轨复制成 MP3 或 WAV 等文件,不会发明新声音。必须保留原声人声或音乐时用提取;那条音轨缺失或错误时用生成。
看看大家为什么每天都用 BibiGPT 把视频转成文字。
全球 50,000+ 用户的信赖之选
“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”
Maya R.
内容创作者 · 二次创作短视频
“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”
Daniel K.
语言学习者 · 用真实视频学外语
“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”
Priya S.
研究人员 · 引用公开演讲
常见问题
有问题?问我们!
1 2026年B站AI视频总结工具哪个最好?粘贴任意链接,几秒生成结构化总结、思维导图和重点提炼,支持30+平台、免登录。文末对比5大工具,选出最适合你的那一个。
2 给 DeepSeek Harness 装视频总结 skill 只需拷贝目录——SKILL.md 和 Claude Code 通用。也可以不装 dsh:在浏览器里粘贴 B 站或 YouTube 链接,直接出带时间戳的总结。
3 无需 App、无需下载,在浏览器里免费倒放任意视频。iPhone、Android、PC 分步教程,以及如何同步倒放音频(2026)。
粘贴 Bilibili、YouTube 或播客链接——或上传文件。BibiGPT 返回带时间戳的文字稿、AI 总结和可搜索、可导出的视觉解读。不用 GPU,不用研究环境,也不声称这就是 MMAudio 本身。