Czym jest MMAudio?
MMAudio to multimodalny model generatywny, który syntezuje zsynchronizowane audio z wideo i opcjonalnego tekstu. Wspólny trening na danych wideo–audio i tekst–audio uczy wyrównania semantycznego; moduł synchronizacji ustawia latent audio względem klatek wideo. Wynik to nowa ścieżka dźwiękowa, a nie ekstrakcja pliku źródłowego.