SeedRealtime 来了:实时全双工通话,解决不了「事后还能搜」
热点解读

SeedRealtime 来了:实时全双工通话,解决不了「事后还能搜」

发布于 · 作者: BibiGPT 团队
把 BibiGPT 设为 Google 优先来源 在热门报道和 AI 概览里看到更多 BibiGPT。

会议还没散,屏幕上已经有人把摄像头对准白板。你一边听对方补一句「刚才那页有个数字」,一边想把这句话钉住——结果下一秒话题拐走了。通话很流畅,脑子里却只剩一团热气。

这不是麦克风的问题。这是「当时听懂」和「事后还能用」被挤进了同一件事。

2026 年 8 月 5 日,字节跳动正式推出原生音视频全双工大模型 SeedRealtime,并宣布已在字节自家聊天应用 全量上线。多数文章会停在「边看、边听、边说」。本文要拆的是另一半:实时交互解决了什么,以及一小时结束后你还缺什么。

目录

实时通话解决了什么,没解决什么

SeedRealtime 的官方定位很清楚:用统一架构原生融合音频、视频与文本,在连续的多模态信息流上实时交互。字节在项目页上把它写成「边看、边听、边说」。体验入口也具体:把字节自家聊天应用更新到最新版,对话框里选「打电话」,进入视频通话。

它解决的是当下这一秒的摩擦——你不用先录完、再上传、再等转写。模型可以一边看画面,一边听声音,一边开口。对辅导、演示、远程协作,这是真需求。

它没解决的是下一小时的摩擦。通话一断,现场节奏就散了。你没有带时间戳的章节,没有能搜的关键词,没有能丢进笔记库的结构化摘要。实时模型服务的是「在场」,不是「归档」。

Edison Research 的 Infinite Dial 2026 给出过一组对照:美国播客听众每周平均听 8 小时 24 分钟,人均订阅 6.8 档。没人能把这 8 小时全部「再听一遍」。真正被用到的,是能被检索、被引用、被决定「要不要深挖」的那一层文字。

用自然语言把一条视频交给 Agent 处理的对话界面 截图:把音视频交给可检索工作流,而不是再打一通实时电话。来源:BibiGPT。

实用规则: 实时通话服务「在场」,事后总结服务「可复用」。两者叠在同一条产品叙事里,你最后两样都做不透。

我会把 SeedRealtime 看成「把模型推进到视频通话里」的一步,而不是「视频知识工作被它收走了」。后者需要的是输入层:字幕、章节、关键画面、能跨平台打开的链接。

全双工模型真正改变的三件事

按字节 8 月 5 日的发布说明,SeedRealtime 强调三项能力:音视频联合理解、主动交互、更自然的对话节奏。凤凰网等媒体在报道里也沿用了这组表述。作为话题,这三项都成立;作为工作流决策,它们对应三种不同的失败模式。

联合理解:画面终于进了对话

以前的实时语音模型大多只吃声音。你指着屏幕说「这块」,模型看不见。SeedRealtime 把声音、画面和时序绑在一起,才能判断你在跟谁说话、指的是哪一块。这对「边演示边问」有用。

对事后复盘没用。联合理解发生在通话里,默认不会变成一份带时间码的笔记。

主动交互:模型可以插话

全双工的意思是双方可以同时说,不必等一轮结束。模型可以在你停顿时追问,也可以在画面变化时主动开口。节奏更像人。

代价是:插话越多,可归档的主线越碎。现场很自然的东西,回放时往往最难切章节。

对话节奏:像打电话,不像交作业

字节自家聊天应用把入口放在「打电话」,是产品判断:用户要的是会话,不是作业。这和「先总结再决定看不看」是反方向的时序——后者才是大多数知识工作者真正在用的守门员。

把音视频总结做成可安装技能后的市场页入口 截图:可安装的音视频技能入口,对应的是事后输入层,不是实时通话。来源:BibiGPT。

实用规则: 模型越会「插话」,你越需要一条不插话的归档轨。现场节奏和检索结构是两种产品。

这和另一张判断卡是同一件事:模型变便宜,不会把胜负手留在参数量上,而会前移到「能不能稳定把音视频喂进去」。SeedRealtime 证明喂进去可以发生在通话里;它没有证明喂进去之后一定能被检索。

事后总结工作流:把一小时变成可检索资产

实时路径的反面,不是「再找一个更会聊天的模型」。是承认大多数内容发生在你不在场的时候:一门录好的课、一条两小时直播回放、一期你订阅了但今晚没时间听的播客。

一条能用的事后工作流只有五步:

  1. 拿到原始链接或本地文件,而不是先剪成片段。
  2. 抽字幕或转写,保留时间戳。
  3. 按章节生成摘要,而不是整篇散文。
  4. 把结论、数字、待办从章节里抠出来。
  5. 丢进你真正会打开的笔记库,并保留回跳原片的时间码。

这一步的验收标准很土:一周后你还能用一个关键词把那句结论搜回来。搜不回来,通话再自然也是热气。

想先看「链接进去、章节出来」长什么样,下面这段是同一条输入层路径的演示,不是实时通话。

演示:把一条视频送进总结工作流。来源:BibiGPT。

想看「先总结再决定看不看」怎么落到产品里,可以对照这篇AI 视频总结完整指南,以及实时翻译工具横评——后者讲的是「当场听懂」,和本文的「事后能用」是互补,不是替代。

音视频总结命令行工具的帮助界面 截图:命令行总结工具暴露的是输入层,不是会话层。来源:BibiGPT。

决策过滤器: 问一句就够了。这件事结束 24 小时后,你还需要找回其中某一句话吗?需要,就走事后总结;不需要,实时通话已经够了。

国内平台尤其如此。一条 B 站三小时直播,实时模型帮不上忙——你根本不在场。这时比拼的不是谁更会插话,而是谁能打开这条链接并吐出带时间戳的章节。相关路径见 B 站视频总结YouTube 视频总结

两条路径怎么选

把 SeedRealtime 式实时通话和事后总结放在一张桌上,差别会清楚很多:

维度实时全双工通话事后章节总结最适合谁
时间点正在发生已经发生在场 vs 回看
产出对话本身可检索文本 + 时间戳要笔记的人
输入摄像头 + 麦克风链接 / 本地文件 / 多平台要覆盖 B 站、播客的人
失败模式当下听漏事后搜不到看你怕哪一种
隐私画面实时进模型可对已有录像处理不能开摄像头的场景

没有「全面更好」的一边。辅导孩子写题、远程看设备故障,实时更合适。一周五场行业直播、一门要考试的网课、一季要写稿的播客,事后总结才是主路径。

实用规则: 先选时间点,再选模型。把「会聊天」当成「会归档」,是 2026 年最常见的错配。

如果你已经在用实时通话,补一条归档轨并不冲突:散会后把录像丢进总结,把「刚才那页的数字」从热气变成一条带时间码的笔记。这正是 视频总结器 这条产品线存在的理由——它不跟你抢通话,它接管通话结束之后。

常见误区

误区 1:全双工上线,异步总结就过时了

反了。全双工让「在场」变便宜,于是会有更多通话被录下来。被录下来的东西如果不能检索,只是把热气存成了更大的热气。可打脸预判:若到 2027 年 8 月,主流实时通话产品已经默认输出带时间戳的章节笔记,并且检索体验不弱于独立总结工具,这条判断作废。

误区 2:实时模型看过画面,就等于做了视觉分析

看见和归档是两件事。通话里的联合理解服务于当下回应;视觉分析要的是关键帧、板书、图表数字能被单独引用。后者见视觉内容总结

误区 3:只要模型够快,就不需要输入层

输入层包括:打得开的平台、稳得住的字幕、切得动的章节、回得去的时间码。这些不会因为模型更快而自动出现。模型越便宜,这一层越值钱。

从看完到用上

一套本周就能用的分工:

  1. 必须人在场、必须看画面的,用字节自家聊天应用视频通话体验 SeedRealtime。
  2. 会后或回放,把同一段内容丢进事后总结,强制要章节和时间戳。
  3. 只把「结论 / 数字 / 待办」写进笔记,原文用时间码回跳。
  4. 下一周用搜索而不是记忆来复用。

实时模型改变的是对话的手感。知识工作改变的是:一周后你还能不能把那句话找回来。

立即访问 BibiGPT 官网,把下一条回放变成可检索笔记:

BibiGPT 团队

查看「模型更新与解读」全部 47 篇 →

试试这些 AI 工具