MMAudio — Gerador de trilha sonora a partir do vídeo

O MMAudio sintetiza uma trilha sonora cinematográfica a partir do vídeo e de um texto opcional — ele não puxa o áudio original do arquivo. Essa distinção importa: a maioria das páginas de «vídeo para áudio» são extratores. O MMAudio é um modelo de pesquisa de geração vídeo→áudio (CVPR 2025) que precisa de GPU, então esta página não finge rodá-lo no seu navegador. Cole um link na ferramenta ao vivo do BibiGPT abaixo para ler primeiro a imagem e o conteúdo falado — a metade de compreensão de um fluxo de trilha sonora.

Geração, não extração Modelo de pesquisa com GPU Resumo ao vivo embutido

Read the video here before you score it

Paste a video or podcast URL — BibiGPT returns key points, a transcript, and a visual read. The live app loads inline. This is not an in-browser MMAudio renderer.

Adicionar BibiGPT como fonte preferida no Google Veja mais BibiGPT nas Principais notícias e nas respostas com IA.

Geração vs extração em uma frase

O MMAudio escreve uma trilha sonora nova que acompanha a imagem; extratores copiam o áudio que já está dentro do arquivo. Esta página explica a intenção de geração e depois entrega um embed ao vivo do BibiGPT para você resumir e ler visualmente o mesmo clipe antes de procurar um demo com GPU.

Features

O que o MMAudio realmente faz

O MMAudio é um modelo de geração de áudio a partir de vídeo: dado um clipe e um texto opcional, ele escreve uma trilha sonora nova, sincronizada quadro a quadro. Ferramentas de extração demultiplexam a faixa que já está no contêiner. Misturar essas duas intenções é como páginas de busca se canibalizam.

Geração, não extração

Um extrator responde «me dá o MP3 que já está neste MP4». O MMAudio responde «invente foley, ambiência ou uma trilha que combine com o que está na tela». Vídeo silencioso de IA, cortes com trilha provisória e demos de pesquisa vivem no segundo balde.

Vídeo + texto opcional como condições

O trabalho MMAudio de 2024–2025 treina em conjunto dados vídeo-áudio e texto-áudio, e depois alinha latentes de áudio aos frames do vídeo. Você pode direcionar o som com um prompt curto, mas a imagem ainda manda no timing.

Não é um codec de navegador

Os checkpoints públicos ficam na classe de 157M parâmetros e os autores reportam cerca de 1,23 segundos para gerar um clipe de 8 segundos em GPU. Não há porta WebAssembly. Uma landing que «converte» na aba está extraindo, não rodando MMAudio.

Por que o BibiGPT fica ao lado de um gerador

O trabalho de trilha começa sabendo o que a imagem está fazendo. O BibiGPT transforma o mesmo link em transcrição com timestamps, resumo estruturado e leitura visual — o briefing que você entregaria a um designer de som, sem montar uma pilha de pesquisa.

Leia a cena antes de marcar a trilha

Um gerador combina movimento e texto do prompt. Ele não conta o argumento de uma aula, o timing da piada de um short ou quais objetos realmente aparecem. Resumos e análise visual preenchem essa lacuna.

Mesmo link, sem setup de GPU

Cole um fluxo de YouTube, Bilibili ou arquivo local no embed acima. Você recebe notas que dá para buscar e exportar. A metade da geração ainda fica num demo de pesquisa ou numa máquina de estúdio.

Mantenha os extratores na própria faixa

Se você realmente precisa da faixa original, use um extrator MP4-to-MP3. Esta página não vai rebatizar esse trabalho como MMAudio. Uma intenção, uma URL.

3 passos nesta página

Você não vai renderizar o MMAudio aqui. Vai sair com um briefing do clipe e uma separação clara entre geração e extração.

  1. 1

    Abra o resumidor ao vivo

    Use o embed abaixo do hero. Cole uma URL de vídeo ou podcast. O app BibiGPT carrega inline — sem aba extra para começar.

  2. 2

    Leia imagem e fala

    Receba um resumo estruturado, uma transcrição com timestamps e uma leitura visual do que aparece na tela. Esse é o briefing que uma passagem de trilha precisa.

  3. 3

    Escolha geração ou extração

    Imagem silenciosa ou mal sonorizada → um demo MMAudio com GPU ou um editor de som. Faixa original que você precisa manter → um extrator. Não mande os dois trabalhos para a mesma URL.

MMAudio vs extratores vs BibiGPT

Três ferramentas, três trabalhos. Mecanismos de busca e pessoas precisam manter essa divisão honesta.

Capacidade MMAudio (geração) Ferramentas de extrair áudio BibiGPT
Saída Trilha sonora nova sincronizada à imagem Stream de áudio original, demultiplexado Transcrição, resumo, análise visual
Roda no navegador Não — GPU / demo de pesquisa Muitas vezes sim (conversão local) Sim — cole um link
É o mesmo que «vídeo para áudio»? Só no sentido de geração Sim — sentido de extração Não — compreensão do clipe
Melhor quando O clipe é silencioso ou precisa de trilha nova Você precisa manter a faixa de origem Você precisa saber o que acontece primeiro

3 cenários típicos

Onde geração, extração e compreensão não deveriam compartilhar a mesma URL.

Vídeo de IA silencioso que ainda precisa de um ambiente

Um clipe de texto-para-vídeo chega sem foley. Primeiro, o BibiGPT conta o que realmente está na tela. Depois um modelo de geração pode propor ambiência que segue esses eventos — não um MP3 arrancado de uma faixa de áudio vazia.

Um corte com trilha provisória que você não pode entregar

A imagem está travada; a música placeholder está licenciada ou errada. Leia os beats da cena no resumo e depois gere ou desenhe uma trilha. Extração só te daria a trilha provisória que você já odeia.

Uma aula que você precisa manter palavra por palavra

Este é o trabalho de extração e transcrição. Demultiplexe a voz original e depois resuma. O MMAudio inventaria uma base nova e jogaria fora as palavras que importam. Mande essa intenção a um extrator mais BibiGPT, não a um gerador.

Fontes

Os fatos do modelo abaixo seguem o paper e a página do projeto dos autores, não copy de revendedor.

  • O MMAudio sintetiza áudio de alta qualidade e sincronizado a partir de vídeo e texto opcional via treinamento multimodal conjunto e um módulo de sincronização em nível de frame. Os autores reportam 157M parâmetros e 1,23s para gerar um clipe de 8 segundos, com código e demo na página do projeto.

    Cheng et al., arXiv:2412.15322 (CVPR 2025) ↗
  • Página do projeto, código, demo no Hugging Face e Colab do MMAudio são publicados pelos autores em hkchengrex.github.io/MMAudio.

    MMAudio project page ↗

Vídeo para áudio, definido

O que é o MMAudio?

O MMAudio é um modelo generativo multimodal que sintetiza áudio sincronizado a partir de vídeo e texto opcional. O treinamento conjunto em dados vídeo-áudio e texto-áudio ensina alinhamento semântico; um módulo de sincronização alinha latentes de áudio aos frames do vídeo. O resultado é uma trilha sonora nova, não um extraction do arquivo de origem.

O que é geração de áudio a partir de vídeo?

Geração de áudio a partir de vídeo é a tarefa de produzir uma nova forma de onda de áudio que combine com os eventos e o timing de um vídeo, às vezes guiada por um prompt de texto. Serve quando um clipe é silencioso, mal sonorizado ou gerado sem som. Não é reconhecimento de fala e não é arrancar um MP3 de um MP4.

O que é extração de áudio de vídeo?

Extração de áudio copia o stream de áudio já armazenado em um contêiner de vídeo para um arquivo como MP3 ou WAV. Nenhum som novo é inventado. Extração é a ferramenta certa quando a voz ou a música original precisam ser preservadas; geração é a ferramenta certa quando esse stream está ausente ou errado.

Adorado por criadores, estudantes e pesquisadores

Por que as pessoas usam o BibiGPT todos os dias para transformar vídeos em texto.

Mais de 50.000 usuários no mundo todo confiam

★★★★★

“Colo um link e recebo legendas limpas em segundos — economizo horas de redigitação toda semana.”

Maya R.

Criadora de conteúdo · Reaproveita vídeos curtos

★★★★★

“Exportar a transcrição me deixa revisar palavras novas no meu ritmo, sem pausar o vídeo o tempo todo.”

Daniel K.

Estudante de idiomas · Estuda com vídeos reais

★★★★★

“Texto preciso e com marcação de tempo que posso citar diretamente. Sem perceber, virou parte do meu fluxo diário.”

Priya S.

Pesquisadora · Cita palestras públicas

Perguntas frequentes

Tire qualquer dúvida.

Popular guides

Leia o clipe antes de marcar a trilha

Cole um link do Bilibili, YouTube ou podcast — ou envie um arquivo. O BibiGPT devolve uma transcrição com timestamps, um resumo com IA e uma leitura visual que você pode buscar e exportar. Sem GPU, sem setup de pesquisa, sem afirmar que isto é o MMAudio em si.