Doubao SeedRealtime erklärt: Sehen, hören und sprechen zugleich

Kurz gesagt: ByteDance Seed hat SeedRealtime am 2026-08-05 veröffentlicht. Es ist ein natives Audio-/Video-Full-Duplex-Modell und über den Telefon-Button im Doubao-Chat vollständig ausgerollt. Sie können während der Wiedergabe sprechen. Brauchen Sie später durchsuchbare Notizen, ist eine asynchrone Zusammenfassung oft besser.

Release · 2026-08-05 Live in Doubao Demo unten

Keep the notes after the call

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A you can search later.

BibiGPT als bevorzugte Quelle bei Google hinzufügen So siehst du mehr von BibiGPT in den Top-Meldungen und in KI-Antworten.

Kerndaten (90-Sekunden-Lektüre)

Stand 2026-08-19 hat ByteDance Seed am 2026-08-05 SeedRealtime veröffentlicht — ein natives Audio-/Video-Full-Duplex-Modell, vollständig live in der Doubao-App. Es liest Bild, Ton und Timing gemeinsam, sodass Sie während der Wiedergabe sprechen können. Ein Live-Call hinterlässt kein durchsuchbares Archiv; BibiGPT deckt diese Hälfte ab.

Features

Was SeedRealtime wirklich ausgeliefert hat

Das Release von ByteDance Seed am 2026-08-05 ist ein natives Full-Duplex-Modell — kein zusammengefügter Stack aus Sprach- und Vision-APIs. Es läuft in Doubao, nicht als Research-Preview.

Einheitliche Architektur für Audio + Video + Text

Ein Modell liest Bild, Tonspur und Gespräch im selben Stream — statt eines Captioners, der an ein Chat-Modell übergibt.

Drei zentrale Fähigkeiten

Gemeinsames Audio-Video-Verständnis, proaktives Eingreifen und ein natürlicheres Sprechtempo. Offiziell heißt das „sehen, hören und sprechen“.

Live im Doubao-Telefonmodus

Doubao aktualisieren, im Chat den Telefon-Button tippen — die Sitzung läuft auf SeedRealtime. ByteDance nennt das die erste großflächige Produktlandung von nativem A/V-Full-Duplex.

Wann eine asynchrone Zusammenfassung besser ist

Ein Live-Call eignet sich für „was passiert gerade“. Als Archiv taugt er wenig. BibiGPT macht das Gegenteil: aus einem fertigen Video werden Kapitel, Transkript und Folgefragen, die Sie morgen noch suchen können.

Sie brauchen eine Aufzeichnung, kein Gespräch

Vorlesungen, Earnings Calls und lange Podcasts werden wiederverwendet. Ein Doubao-Call verschwindet beim Auflegen. Kapitel mit Zeitstempeln plus Transkript sind das Artefakt für Ihre Notizen.

Sie sitzen nicht am Bildschirm

Full-Duplex verlangt, dass Sie im Call bleiben. Die asynchrone Zusammenfassung läuft im Pendelzug oder nach dem Stream — Link einfügen, später die Kernpunkte lesen.

Sie fragen dasselbe Video später noch einmal

Folgefragen an ein gespeichertes Transkript („Was sagten sie zu Preisen bei 47:00?“) sind ein anderes Produkt als Sprechen über einen Live-Feed. Video und Notizen bleiben.

5 zentrale Veränderungen (90-Sekunden-Lektüre)

Die wichtigsten Verschiebungen aus dem SeedRealtime-Launch am 2026-08-05.

  1. 1

    Natives Full-Duplex, kein angeschraubter Stack

    SeedRealtime wird als ein Audio-Video-Text-Modell trainiert. Es ist kein Captioner, der in ein Chat-Modell piped. Das meint „native“ in der Launch-Notiz.

  2. 2

    Gemeinsames Verständnis von Bild, Ton und Zeit

    Das Modell nutzt Frame, Tonspur und Turn-Timing zusammen, um Absicht zu schätzen — inklusive wann es von selbst sprechen soll.

  3. 3

    Proaktives Eingreifen

    ByteDance listet „aktive Intervention“ als Kernfähigkeit: Das Modell kann eingreifen, nicht nur antworten, wenn Sie fertig sind.

  4. 4

    In Doubao ausgeliefert, keine Wartelisten-Demo

    Der Launch-Post sagt vollständigen Rollout. Der Nutzerweg ist der Telefon-Button im Chat nach einem App-Update.

  5. 5

    Live sprechen vs. Notizen später

    Ein Duplex-Call ist für den Moment. Brauchen Sie Kapitel, Transkript oder eine Frage, die Sie morgen wieder stellen, behalten Sie daneben eine asynchrone Zusammenfassung.

3 typische Szenarien für BibiGPT-Nutzer

Wo ein Live-Doubao-Call und eine asynchrone Zusammenfassung nebeneinander stehen sollten.

In der Vorlesung klären, danach Notizen behalten

Unterbrechen Sie mit einem Doubao-Call eine verwirrende Demo. Nach der Stunde denselben Mitschnitt in BibiGPT einfügen — Kapitel und Transkript für die Prüfungsvorbereitung.

Livestream schauen, dann das Recap schreiben

Full-Duplex hilft bei „was ist gerade auf dem Screen erschienen?“. Das Recap fürs Team braucht weiterhin Zeitstempel und exportierbaren Text — das ist die asynchrone Zusammenfassung.

Den Call überspringen und das Video ablegen

Nicht jede Aufnahme braucht ein Gespräch. Ein 90-Minuten-Podcast oder Earnings-Replay ist oft als Kapitel-Summary plus Folge-Q&A schneller als eine weitere Live-Session.

Quellen

Primäre Launch-Notizen. Daten und Produktaussagen stammen von diesen Seiten.

  • ByteDance Seed kündigte SeedRealtime am 2026-08-05 als natives Audio-/Video-Full-Duplex-Modell an und rollte es in der Doubao-App vollständig aus.

    ByteDance Seed Blog ↗
  • Auf der Seed-Homepage steht SeedRealtime mit dem Satz „sehen, hören und sprechen“ und dem Modell-Release-Stempel 2026-08-05.

    ByteDance Seed ↗

Beliebt bei Creators, Studierenden & Forschenden

Warum Menschen täglich Videos mit BibiGPT in Text verwandeln.

Von über 50.000 Nutzern weltweit geschätzt

★★★★★

“Ich füge einen Link ein und bekomme in Sekunden saubere Untertitel — das spart mir jede Woche stundenlanges Abtippen.”

Maya R.

Content Creator · Verwertet Kurzvideos neu

★★★★★

“Dank des Transkript-Exports lerne ich neue Wörter in meinem eigenen Tempo, statt das Video ständig anzuhalten.”

Daniel K.

Sprachlerner · Lernt mit echten Videos

★★★★★

“Präziser Text mit Zeitstempeln, den ich direkt zitieren kann. Er ist still und leise Teil meines Arbeitsalltags geworden.”

Priya S.

Forscherin · Zitiert öffentliche Vorträge

Häufig gestellte Fragen

Fragen Sie uns!

Popular guides

Brauchen Sie Notizen, wenn der Call endet?

Fügen Sie einen Videolink in BibiGPT ein. Sie erhalten Kapitel, Transkript und Folge-Q&A zum späteren Suchen — die asynchrone Hälfte von „sehen, hören und sprechen“.