MMAudio Video-to-Audio Generator

MMAudio synthétise une bande-son cinématographique à partir de la vidéo et d'un texte optionnel — il ne sort pas l'audio d'origine du fichier. Cette distinction compte : la plupart des pages « vidéo vers audio » sont des extracteurs. MMAudio est un modèle de recherche vidéo-vers-audio (CVPR 2025) qui nécessite un GPU ; cette page ne prétend pas l'exécuter dans votre navigateur. Collez un lien dans l'outil BibiGPT ci-dessous pour d'abord lire l'image et le contenu parlé — la moitié compréhension d'un workflow de bande-son.

Génération, pas extraction Modèle de recherche GPU Résumé live intégré

Read the video here before you score it

Paste a video or podcast URL — BibiGPT returns key points, a transcript, and a visual read. The live app loads inline. This is not an in-browser MMAudio renderer.

Ajouter BibiGPT aux sources préférées Google Vous verrez plus de BibiGPT dans les À la une et les réponses IA.

Génération vs extraction en une phrase

MMAudio écrit une nouvelle bande-son qui suit l'image ; les extracteurs copient l'audio déjà dans le fichier. Cette page explique l'intention de génération, puis vous tend un embed BibiGPT live pour résumer et lire visuellement le même clip avant d'aller chercher une démo GPU.

Features

Ce que MMAudio fait vraiment

MMAudio est un modèle de génération vidéo-vers-audio : à partir d'un clip et d'un texte optionnel, il écrit une nouvelle bande-son synchronisée image par image. Les outils d'extraction démuxent la piste déjà présente dans le conteneur. Mélanger ces deux intentions, c'est comment les pages de recherche se cannibalisent.

Génération, pas démux

Un extracteur répond « donnez-moi le MP3 déjà dans ce MP4 ». MMAudio répond « inventez des bruitages, une ambiance ou une partition qui collent à l'écran ». Les vidéos IA muettes, les montages avec piste temporaire et les démos de recherche vivent dans le second seau.

Vidéo + texte optionnel comme conditions

Les travaux MMAudio 2024–2025 s'entraînent conjointement sur des données vidéo-audio et texte-audio, puis alignent les latents audio sur les images vidéo. Vous pouvez orienter le son avec une courte consigne, mais c'est toujours l'image qui pilote le timing.

Pas un codec navigateur

Les checkpoints publics sont de l'ordre de 157M de paramètres et les auteurs rapportent environ 1,23 s pour générer un clip de 8 s sur GPU. Il n'existe pas de port WebAssembly. Une landing qui « convertit » dans l'onglet extrait — elle n'exécute pas MMAudio.

Pourquoi BibiGPT se place à côté d'un générateur

Le travail de bande-son commence par comprendre ce que fait l'image. BibiGPT transforme le même lien en transcription horodatée, résumé structuré et lecture visuelle — le brief que vous remettriez à un sound designer, sans monter une stack de recherche.

Lisez la scène avant de la scorer

Un générateur suit le mouvement et le texte de consigne. Il ne vous dit pas l'argument d'une conférence, le timing d'une blague dans un short, ni quels objets apparaissent vraiment. Résumés et analyse visuelle comblent ce trou.

Même lien, sans setup GPU

Collez un workflow YouTube, Bilibili ou fichier local dans l'embed ci-dessus. Vous obtenez des notes que vous pouvez chercher et exporter. La moitié génération reste sur une démo de recherche ou une machine de studio.

Gardez les extracteurs dans leur voie

Si vous avez vraiment besoin de la piste d'origine, utilisez un extracteur MP4-to-MP3. Cette page ne rebaptisera pas ce travail en MMAudio. Une intention, une URL.

3 étapes sur cette page

Vous ne rendrez pas MMAudio ici. Vous repartirez avec un brief du clip et une séparation claire entre génération et extraction.

  1. 1

    Ouvrez le résumé live

    Utilisez l'embed sous le hero. Collez une URL vidéo ou podcast. L'app BibiGPT se charge en ligne — aucun onglet supplémentaire pour commencer.

  2. 2

    Lisez l'image et la parole

    Obtenez un résumé structuré, une transcription horodatée et une lecture visuelle de ce qui apparaît à l'écran. C'est le brief dont a besoin une passe de bande-son.

  3. 3

    Choisissez génération ou extraction

    Image muette ou mal scorée → une démo MMAudio GPU ou un éditeur sonore. Piste d'origine à conserver → un extracteur. N'envoyez pas les deux jobs à la même URL.

MMAudio vs extracteurs vs BibiGPT

Trois outils, trois jobs. Les moteurs de recherche et les gens ont tous deux besoin que cette séparation reste honnête.

Capacité MMAudio (génération) Outils d'extraction audio BibiGPT
Sortie Nouvelle bande-son syncée à l'image Flux audio d'origine, démuxé Transcription, résumé, analyse visuelle
Tourne dans le navigateur Non — GPU / démo de recherche Souvent oui (conversion locale) Oui — collez un lien
Pareil que « vidéo vers audio » ? Seulement au sens génération Oui — au sens extraction Non — comprendre le clip
Idéal quand Le clip est muet ou a besoin d'une nouvelle partition Vous devez garder la piste source Vous devez d'abord savoir ce qui se passe

3 scénarios typiques

Là où génération, extraction et compréhension ne doivent pas partager une URL.

Vidéo IA muette qui a encore besoin d'une salle

Un clip text-to-video arrive sans bruitages. D'abord, BibiGPT vous dit ce qui est vraiment à l'écran. Ensuite, un modèle de génération peut proposer une ambiance qui suit ces événements — pas un MP3 arraché à une piste audio vide.

Un montage avec une piste temporaire non livrable

L'image est verrouillée ; la musique placeholder est sous licence ou mauvaise. Lisez les temps forts de la scène via le résumé, puis générez ou concevez une partition. L'extraction ne vous donnerait que la piste temporaire que vous détestez déjà.

Une conférence à conserver mot pour mot

C'est le job d'extraction et de transcription. Démuxez la voix d'origine, puis résumez-la. MMAudio inventerait un nouveau lit sonore et jetterait les mots qui comptent. Envoyez cette intention à un extracteur plus BibiGPT, pas à un générateur.

Sources

Les faits modèles ci-dessous suivent l'article et la page projet des auteurs, pas le copy des revendeurs.

  • MMAudio synthétise un audio haute qualité et synchronisé à partir de la vidéo et d'un texte optionnel via un entraînement conjoint multimodal et un module de synchronisation au niveau image. Les auteurs rapportent 157M de paramètres et 1,23 s pour générer un clip de 8 s, avec code et démo sur la page projet.

    Cheng et al., arXiv:2412.15322 (CVPR 2025) ↗
  • La page projet, le code, la démo Hugging Face et le Colab pour MMAudio sont publiés par les auteurs sur hkchengrex.github.io/MMAudio.

    Page projet MMAudio ↗

Vidéo-vers-audio, défini

Qu'est-ce que MMAudio ?

MMAudio est un modèle génératif multimodal qui synthétise de l'audio synchronisé à partir de la vidéo et d'un texte optionnel. L'entraînement conjoint sur des données vidéo-audio et texte-audio enseigne l'alignement sémantique ; un module de synchronisation aligne les latents audio sur les images vidéo. Le résultat est une nouvelle bande-son, pas un démux du fichier source.

Qu'est-ce que la génération vidéo-vers-audio ?

La génération vidéo-vers-audio consiste à produire une nouvelle forme d'onde audio qui correspond aux événements et au timing d'une vidéo, parfois orientée par une consigne texte. On l'utilise quand un clip est muet, mal scoré, ou généré sans son. Ce n'est ni de la reconnaissance vocale, ni l'extraction d'un MP3 hors d'un MP4.

Qu'est-ce que l'extraction audio depuis une vidéo ?

L'extraction audio (démux) copie le flux audio déjà stocké dans un conteneur vidéo vers un fichier tel que MP3 ou WAV. Aucun son nouveau n'est inventé. L'extraction est le bon outil quand la voix ou la musique d'origine doit être préservée ; la génération est le bon outil quand ce flux manque ou est faux.

Adopté par les créateurs, étudiants et chercheurs

Pourquoi tant de personnes utilisent BibiGPT chaque jour pour transformer leurs vidéos en texte.

Plus de 50 000 utilisateurs dans le monde nous font confiance

★★★★★

“Je colle un lien et j'obtiens des sous-titres propres en quelques secondes — cela m'épargne des heures de retranscription chaque semaine.”

Maya R.

Créatrice de contenu · Réutilise des vidéos courtes

★★★★★

“Exporter la transcription me permet de réviser le vocabulaire à mon rythme au lieu de mettre la vidéo en pause sans arrêt.”

Daniel K.

Apprenant en langues · Étudie avec de vraies vidéos

★★★★★

“Un texte précis et horodaté que je peux citer directement. C'est devenu, mine de rien, une partie de mon quotidien.”

Priya S.

Chercheuse · Cite des conférences publiques

Questions fréquentes

Posez-nous vos questions !

Popular guides

Lisez le clip avant de le scorer

Collez un lien Bilibili, YouTube ou podcast — ou importez un fichier. BibiGPT renvoie une transcription horodatée, un résumé IA et une lecture visuelle que vous pouvez chercher et exporter. Pas de GPU, pas de setup de recherche, aucune prétention que ceci soit MMAudio lui-même.