Doubao SeedRealtime explicado: ver, ouvir e falar ao mesmo tempo

Em resumo: a ByteDance Seed lançou o SeedRealtime em 2026-08-05. É um modelo nativo áudio-vídeo full-duplex, totalmente disponível no app Doubao pelo botão de chamada do chat. Você pode falar enquanto o vídeo toca. Se depois precisar de notas pesquisáveis, um resumo assíncrono ainda é melhor.

Lançamento · 2026-08-05 Ao vivo no Doubao Demo abaixo

Keep the notes after the call

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A you can search later.

Adicionar BibiGPT como fonte preferida no Google Veja mais BibiGPT nas Principais notícias e nas respostas com IA.

Fatos-chave (leitura de 90 segundos)

Em 2026-08-19, a ByteDance Seed lançou o SeedRealtime em 2026-08-05 — um modelo nativo áudio-vídeo full-duplex, plenamente ao vivo no app Doubao. Ele lê juntos imagem, som e timing para você falar enquanto o vídeo toca. Uma chamada ao vivo não deixa um arquivo pesquisável; o BibiGPT cobre essa metade.

Features

O que o SeedRealtime realmente entregou

O lançamento da ByteDance Seed em 2026-08-05 é um modelo full-duplex nativo, não um stack costurado de APIs de fala e visão separadas. Está ao vivo no Doubao, não como research preview.

Arquitetura unificada de áudio + vídeo + texto

Um único modelo lê o frame, a trilha sonora e a conversa no mesmo stream — em vez de um legendador que passa o bastão a um modelo de chat.

Três capacidades principais

Compreensão audiovisual conjunta, turnos proativos e um ritmo de fala mais natural. A formulação oficial é «ver, ouvir e falar».

Ao vivo no modo chamada do Doubao

Atualize o Doubao, toque no controle de chamada no chat e a sessão roda no SeedRealtime. A ByteDance chama isso de primeiro pouso de produto em larga escala do full-duplex A/V nativo.

Quando um resumo assíncrono é a melhor ferramenta

Uma videochamada ao vivo é ótima para «o que está acontecendo agora». É um arquivo ruim. O BibiGPT faz o oposto: transforma um vídeo concluído em capítulos, transcrição e perguntas de follow-up que você busca amanhã.

Você precisa de um registro, não de uma conversa

Aulas, earnings calls e podcasts longos são reutilizados. Uma chamada Doubao some quando você desliga. Capítulos com carimbo de tempo mais transcrição são o artefato para colar nas notas.

Você não está na tela

Full-duplex quer você na chamada. O resumo assíncrono funciona no deslocamento ou depois do stream — cole o link e volte aos pontos-chave.

Você vai perguntar de novo sobre o mesmo vídeo

Q&A de follow-up sobre uma transcrição salva («o que disseram sobre preço às 47:00?») é outro produto do que falar sobre um feed ao vivo. Ficam o vídeo e as notas.

5 mudanças-chave (leitura de 90 segundos)

Os principais deslocamentos do lançamento do SeedRealtime em 2026-08-05.

  1. 1

    Full-duplex nativo, não um stack remendado

    O SeedRealtime é treinado como um único modelo áudio-vídeo-texto. Não é um legendador ligado a um modelo de chat. É isso que «nativo» significa na nota de lançamento.

  2. 2

    Compreensão conjunta de imagem, som e tempo

    O modelo usa o frame, a trilha sonora e o timing dos turnos juntos para estimar a intenção — inclusive quando falar sem esperar um toque.

  3. 3

    Turnos proativos

    A ByteDance lista a «intervenção ativa» como capacidade central: o modelo pode entrar, não só responder depois da sua frase.

  4. 4

    Enviado no Doubao, não uma demo em lista de espera

    O post de lançamento declara rollout completo. O caminho do usuário é o botão de chamada no chat após atualizar o app.

  5. 5

    Falar ao vivo vs notas depois

    Uma chamada duplex é para o momento. Se você precisa de capítulos, transcrição ou uma pergunta que fará de novo amanhã, mantenha um resumo assíncrono ao lado.

3 cenários típicos para usuários do BibiGPT

Onde uma chamada Doubao ao vivo e um resumo assíncrono devem ficar lado a lado.

Esclareça a aula enquanto roda, depois guarde as notas

Use a chamada Doubao para interromper uma demo confusa. Ao fim da aula, cole a mesma gravação no BibiGPT para capítulos e transcrição para revisar antes da prova.

Assista a um livestream de produto e escreva o recap

Full-duplex ajuda a perguntar «o que acabou de aparecer na tela?». O recap para o time ainda precisa de carimbos de tempo e texto exportável — isso é o resumo assíncrono.

Pule a chamada e arquive o vídeo

Nem toda gravação precisa de conversa. Um podcast de 90 minutos ou um replay de earnings costuma ser mais rápido como resumo por capítulos mais Q&A de follow-up do que outra sessão ao vivo.

Fontes

Notas de lançamento primárias. Datas e alegações de produto vêm destas páginas.

  • A ByteDance Seed anunciou o SeedRealtime em 2026-08-05 como modelo nativo áudio-vídeo full-duplex lançado no app Doubao.

    Blog ByteDance Seed ↗
  • A home da Seed lista o SeedRealtime com a linha «ver, ouvir e falar» e o carimbo de lançamento do modelo 2026-08-05.

    ByteDance Seed ↗

Adorado por criadores, estudantes e pesquisadores

Por que as pessoas usam o BibiGPT todos os dias para transformar vídeos em texto.

Mais de 50.000 usuários no mundo todo confiam

★★★★★

“Colo um link e recebo legendas limpas em segundos — economizo horas de redigitação toda semana.”

Maya R.

Criadora de conteúdo · Reaproveita vídeos curtos

★★★★★

“Exportar a transcrição me deixa revisar palavras novas no meu ritmo, sem pausar o vídeo o tempo todo.”

Daniel K.

Estudante de idiomas · Estuda com vídeos reais

★★★★★

“Texto preciso e com marcação de tempo que posso citar diretamente. Sem perceber, virou parte do meu fluxo diário.”

Priya S.

Pesquisadora · Cita palestras públicas

Perguntas frequentes

Tire qualquer dúvida.

Popular guides

Precisa de notas depois que a chamada acaba?

Cole um link de vídeo no BibiGPT. Você recebe capítulos, transcrição e Q&A de follow-up para buscar depois — a metade assíncrona de «ver, ouvir e falar».