SeedRealtime登場:リアルタイム全二重通話では「あとから検索」はできない
トレンド

SeedRealtime登場:リアルタイム全二重通話では「あとから検索」はできない

公開日 · 著者: BibiGPT チーム
BibiGPT を Google の優先ソースに追加 トップニュースと AI による回答に BibiGPT がもっと表示されます。

会議が終わる前から、すでに誰かがホワイトボードへカメラを向けている。相手が「さっきのページに数字があった」と補足するのを聞きながら、その一文を留めようとする——次の瞬間、話題が逸れる。通話はスムーズなのに、頭には熱気だけが残る。

マイクの問題ではない。「その場で理解した」ことと「あとから使える」ことが、同じ一件に押し込まれている。

2026年8月5日、ByteDanceはネイティブの音声・映像フルデュプレックス大規模モデル SeedRealtime を正式公開し、ByteDanceのチャットアプリへ全面展開したと発表した。多くの記事は「見ながら、聞きながら、話す」で止まる。本稿が切り出すのはもう半分だ。リアルタイム対話が何を解決し、1時間が終わったあとに何が足りないのか。

目次

リアルタイム通話が解決したこと、していないこと

SeedRealtimeの公式ポジションは明確だ。統一アーキテクチャで音声・映像・テキストをネイティブに融合し、連続するマルチモーダル情報流の上でリアルタイムに対話する。ByteDanceはプロジェクトページで「見ながら、聞きながら、話す」と書いている。体験の入り口も具体的だ。ByteDanceのチャットアプリを最新版に更新し、ダイアログで「電話する」を選び、ビデオ通話に入る。

それが解くのはいまこの一秒の摩擦だ——先に録って、上げて、転写を待つ必要がない。モデルは画面を見ながら、音を聞きながら、口を開ける。指導、デモ、遠隔協業では本物の需要だ。

解いていないのは次の一時間の摩擦だ。通話が切れた瞬間、現場のリズムは散る。タイムスタンプ付きチャプターもない。検索できるキーワードもない。ノートアプリに投げ込める構造化要約もない。リアルタイムモデルが支えるのは「臨場」であり、「アーカイブ」ではない。

Edison Researchの Infinite Dial 2026 は対照になる数字を出している。米国のポッドキャスト聴取者は週平均8時間24分聞き、一人あたり6.8番組を購読する。この8時間を全部「もう一度聴く」人はいない。本当に使われるのは、検索でき、引用でき、「深掘りするかどうか」を決められる、その一層のテキストだ。

自然言語で動画をAgentに渡して処理する会話画面 スクリーンショット:音声・映像を検索可能なワークフローに渡す。もう一度リアルタイム通話をかける話ではない。出典:BibiGPT。

実用ルール: リアルタイム通話は「臨場」を支え、事後要約は「再利用」を支える。両方を同じ製品物語に押し込むと、結局どちらも透けてしまう。

私はSeedRealtimeを「モデルをビデオ通話の中まで押し進めた」一歩と見る。「動画の知識仕事をそれが丸ごと引き取った」とは見ない。後者に必要なのは入力層だ——字幕、チャプター、キーフレーム、横断プラットフォームで開けるリンク。

全二重モデルが本当に変える三つのこと

ByteDanceの8月5日発表に沿うと、SeedRealtimeは三つの能力を強調する。音声・映像の統合理解、能動的インタラクション、より自然な対話リズム。鳳凰網などのメディアも報道で同じ言い回しを踏襲している。話題としては三つとも成立する。ワークフロー判断としては、それぞれ別の失敗モードに対応する。

統合理解:画面がようやく対話に入る

以前のリアルタイム音声モデルは、だいたい音だけを食っていた。画面を指して「ここ」と言っても、モデルは見えない。SeedRealtimeは音・画面・時系列を束ねるから、誰に話しかけているか、どの領域を指しているかを判断できる。「見せながら聞く」には効く。

事後の振り返りには効かない。統合理解は通話の中で起きる。デフォルトではタイムコード付きノートにはならない。

能動的インタラクション:モデルが割り込める

全二重とは、双方が同時に話せることで、ラウンドの終わりを待つ必要がない、という意味だ。モデルはあなたの間でさらに尋ねられるし、画面が変わったときに自ら口を開けることもできる。リズムは人に近い。

代償がある。割り込みが多いほど、アーカイブ可能な主線は細かく砕ける。現場では自然なものほど、再生時にチャプターを切るのがいちばん難しい。

対話リズム:電話のようで、課題提出のようではない

ByteDanceのチャットアプリが入り口を「電話する」に置いたのは製品判断だ。ユーザーが欲しいのはセッションであり、提出物ではない。これは「まず要約してから見るか決める」と逆方向の時系列だ——後者こそ、大半の知識ワーカーが実際に使っている門番である。

音声・映像要約をインストール可能なスキルにしたあとのマーケット入口 スクリーンショット:インストール可能な音声・映像スキルの入口。対応するのは事後の入力層であり、リアルタイム通話ではない。出典:BibiGPT。

実用ルール: モデルが「割り込み」上手になるほど、割り込まないアーカイブ軌道が必要になる。現場のリズムと検索構造は、二つの製品だ。

これは別の判断カードと同じ話だ。モデルが安くなると、勝敗はパラメータ数に残らず、「音声・映像を安定して投げ込めるか」へ前倒しされる。SeedRealtimeは、投げ込みが通話の中で起きうることを示した。投げ込みのあと必ず検索できることは示していない。

事後要約ワークフロー:1時間を検索可能な資産にする

リアルタイム経路の反対側は、「もっと上手に雑談するモデルを探す」ことではない。大半のコンテンツは、あなたがいないときに起きると認めることだ。録り済みの授業、2時間のライブ配信アーカイブ、購読したが今夜は聴けないポッドキャスト。

使える事後ワークフローは五ステップしかない。

  1. 断片に切る前に、元のリンクかローカルファイルを取る。
  2. 字幕または転写を抜き、タイムスタンプを残す。
  3. 長い散文ではなく、チャプター単位で要約する。
  4. 結論・数字・ToDoをチャプターから抜き出す。
  5. 本当に開くノートアプリへ入れ、原片へ戻るタイムコードを残す。

このステップの受け入れ基準は泥臭い。一週間後、キーワード一つでその結論を検索で取り戻せるか。取り戻せなければ、通話がどれだけ自然でも熱気のままだ。

リンクを入れて章立てが出る入力層のデモです。リアルタイム通話ではありません。

デモ:動画を要約ワークフローに送る。出典:BibiGPT。

「まず要約してから見るか決める」が製品にどう落ちるかを見るなら、このAI動画要約の完全ガイドと、リアルタイム翻訳ツール横断比較を対照してほしい——後者は「その場で聞き取る」話で、本稿の「あとから使える」と補完関係にあり、代替ではない。

音声・映像要約CLIのヘルプ画面 スクリーンショット:コマンドライン要約ツールが露出するのは入力層であり、セッション層ではない。出典:BibiGPT。

判断フィルター: 問い一つで足りる。この件が終わって24時間後、その中の一文を取り戻す必要があるか。必要なら事後要約へ。不要なら、リアルタイム通話でもう足りている。

国内プラットフォームでは特にそうだ。Bilibiliの3時間ライブ配信に、リアルタイムモデルは助けにならない——あなたはそもそもその場にいない。勝負は誰がより上手に割り込むかではなく、誰がそのリンクを開き、タイムスタンプ付きチャプターを吐き出せるかだ。関連経路は Bilibili動画要約YouTube動画要約

二つの経路をどう選ぶか

SeedRealtime式のリアルタイム通話と事後要約を同じ机に置くと、差はかなりはっきりする。

次元リアルタイム全二重通話事後チャプター要約いちばん向いている相手
時点いま起きているすでに起きた臨場 vs 振り返り
成果対話そのもの検索可能なテキスト + タイムスタンプノートが欲しい人
入力カメラ + マイクリンク / ローカルファイル / 多プラットフォームBilibili・ポッドキャストを覆いたい人
失敗モードいま聞き漏らすあとから検索できないどちらを怖れるか
プライバシー画面がリアルタイムでモデルへ既存録画を処理できるカメラを開けない場面

「全面的に良い」側はない。子どもの宿題を見る、遠隔で機器故障を見るなら、リアルタイム向きだ。週5本の業界ライブ配信、試験があるオンライン講座、原稿を書くためのポッドキャスト一季分なら、事後要約が主経路だ。

実用ルール: 先に時点を選び、それからモデルを選ぶ。「雑談できる」を「アーカイブできる」と取り違えるのが、2026年でいちばん多いミスマッチだ。

すでにリアルタイム通話を使っているなら、アーカイブ軌道を足しても衝突しない。散会後に録画を要約へ入れ、「さっきのページの数字」を熱気からタイムコード付きノートへ変える。それが 動画要約ツール という製品ラインが存在する理由だ——通話を奪わない。通話が終わったあとを引き取る。

よくある誤解

誤解1:全二重が来たから、非同期要約は時代遅れだ

逆だ。全二重は「臨場」を安くするから、録音される通話が増える。録音されたものが検索できなければ、熱気をより大きな熱気として保存しただけだ。反証可能な予測:2027年8月までに、主流のリアルタイム通話製品がタイムスタンプ付きチャプターノートをデフォルト出力し、検索体験が独立要約ツールに劣らなければ、この判断は無効になる。

誤解2:リアルタイムモデルが画面を見た=視覚分析をした

見ることとアーカイブは別件だ。通話内の統合理解は、いまの返答に奉仕する。視覚分析が欲しいのは、キーフレーム、板書、図表の数字を単独で引用できることだ。後者は視覚コンテンツ要約を参照。

誤解3:モデルが十分速ければ、入力層は要らない

入力層には、開けるプラットフォーム、安定する字幕、切れるチャプター、戻れるタイムコードが含まれる。モデルが速くなったから自動で現れるものではない。モデルが安いほど、この層は高くつく。

見終わってから使えるまで

今週から使える分担はこうだ。

  1. 人が現場にいなければならず、画面を見なければならないなら、ByteDanceのチャットアプリのビデオ通話でSeedRealtimeを体験する。
  2. 会議後や再生では、同じ素材を事後要約へ入れ、チャプターとタイムスタンプを必須にする。
  3. ノートには「結論 / 数字 / ToDo」だけを書き、原文はタイムコードで戻る。
  4. 翌週は記憶ではなく検索で再利用する。

リアルタイムモデルが変えるのは、対話の手触りだ。知識仕事が変えるのは、一週間後にその一文を取り戻せるかどうかだ。

今すぐBibiGPT公式サイトへ。次の再生を検索可能なノートに:

BibiGPT チーム

「モデル更新」の記事 47 本をすべて見る →

これらの AI ツールを試す