SeedRealtime 来了:实时全双工通话,解决不了「事后还能搜」
会议还没散,屏幕上已经有人把摄像头对准白板。你一边听对方补一句「刚才那页有个数字」,一边想把这句话钉住——结果下一秒话题拐走了。通话很流畅,脑子里却只剩一团热气。
这不是麦克风的问题。这是「当时听懂」和「事后还能用」被挤进了同一件事。
2026 年 8 月 5 日,字节跳动正式推出原生音视频全双工大模型 SeedRealtime,并宣布已在字节自家聊天应用 全量上线。多数文章会停在「边看、边听、边说」。本文要拆的是另一半:实时交互解决了什么,以及一小时结束后你还缺什么。
目录
实时通话解决了什么,没解决什么
SeedRealtime 的官方定位很清楚:用统一架构原生融合音频、视频与文本,在连续的多模态信息流上实时交互。字节在项目页上把它写成「边看、边听、边说」。体验入口也具体:把字节自家聊天应用更新到最新版,对话框里选「打电话」,进入视频通话。
它解决的是当下这一秒的摩擦——你不用先录完、再上传、再等转写。模型可以一边看画面,一边听声音,一边开口。对辅导、演示、远程协作,这是真需求。
它没解决的是下一小时的摩擦。通话一断,现场节奏就散了。你没有带时间戳的章节,没有能搜的关键词,没有能丢进笔记库的结构化摘要。实时模型服务的是「在场」,不是「归档」。
Edison Research 的 Infinite Dial 2026 给出过一组对照:美国播客听众每周平均听 8 小时 24 分钟,人均订阅 6.8 档。没人能把这 8 小时全部「再听一遍」。真正被用到的,是能被检索、被引用、被决定「要不要深挖」的那一层文字。
截图:把音视频交给可检索工作流,而不是再打一通实时电话。来源:BibiGPT。
实用规则: 实时通话服务「在场」,事后总结服务「可复用」。两者叠在同一条产品叙事里,你最后两样都做不透。
我会把 SeedRealtime 看成「把模型推进到视频通话里」的一步,而不是「视频知识工作被它收走了」。后者需要的是输入层:字幕、章节、关键画面、能跨平台打开的链接。
全双工模型真正改变的三件事
按字节 8 月 5 日的发布说明,SeedRealtime 强调三项能力:音视频联合理解、主动交互、更自然的对话节奏。凤凰网等媒体在报道里也沿用了这组表述。作为话题,这三项都成立;作为工作流决策,它们对应三种不同的失败模式。
联合理解:画面终于进了对话
以前的实时语音模型大多只吃声音。你指着屏幕说「这块」,模型看不见。SeedRealtime 把声音、画面和时序绑在一起,才能判断你在跟谁说话、指的是哪一块。这对「边演示边问」有用。
对事后复盘没用。联合理解发生在通话里,默认不会变成一份带时间码的笔记。
主动交互:模型可以插话
全双工的意思是双方可以同时说,不必等一轮结束。模型可以在你停顿时追问,也可以在画面变化时主动开口。节奏更像人。
代价是:插话越多,可归档的主线越碎。现场很自然的东西,回放时往往最难切章节。
对话节奏:像打电话,不像交作业
字节自家聊天应用把入口放在「打电话」,是产品判断:用户要的是会话,不是作业。这和「先总结再决定看不看」是反方向的时序——后者才是大多数知识工作者真正在用的守门员。
截图:可安装的音视频技能入口,对应的是事后输入层,不是实时通话。来源:BibiGPT。
实用规则: 模型越会「插话」,你越需要一条不插话的归档轨。现场节奏和检索结构是两种产品。
这和另一张判断卡是同一件事:模型变便宜,不会把胜负手留在参数量上,而会前移到「能不能稳定把音视频喂进去」。SeedRealtime 证明喂进去可以发生在通话里;它没有证明喂进去之后一定能被检索。
事后总结工作流:把一小时变成可检索资产
实时路径的反面,不是「再找一个更会聊天的模型」。是承认大多数内容发生在你不在场的时候:一门录好的课、一条两小时直播回放、一期你订阅了但今晚没时间听的播客。
一条能用的事后工作流只有五步:
- 拿到原始链接或本地文件,而不是先剪成片段。
- 抽字幕或转写,保留时间戳。
- 按章节生成摘要,而不是整篇散文。
- 把结论、数字、待办从章节里抠出来。
- 丢进你真正会打开的笔记库,并保留回跳原片的时间码。
这一步的验收标准很土:一周后你还能用一个关键词把那句结论搜回来。搜不回来,通话再自然也是热气。
想先看「链接进去、章节出来」长什么样,下面这段是同一条输入层路径的演示,不是实时通话。
演示:把一条视频送进总结工作流。来源:BibiGPT。
想看「先总结再决定看不看」怎么落到产品里,可以对照这篇AI 视频总结完整指南,以及实时翻译工具横评——后者讲的是「当场听懂」,和本文的「事后能用」是互补,不是替代。
截图:命令行总结工具暴露的是输入层,不是会话层。来源:BibiGPT。
决策过滤器: 问一句就够了。这件事结束 24 小时后,你还需要找回其中某一句话吗?需要,就走事后总结;不需要,实时通话已经够了。
国内平台尤其如此。一条 B 站三小时直播,实时模型帮不上忙——你根本不在场。这时比拼的不是谁更会插话,而是谁能打开这条链接并吐出带时间戳的章节。相关路径见 B 站视频总结 与 YouTube 视频总结。
两条路径怎么选
把 SeedRealtime 式实时通话和事后总结放在一张桌上,差别会清楚很多:
| 维度 | 实时全双工通话 | 事后章节总结 | 最适合谁 |
|---|---|---|---|
| 时间点 | 正在发生 | 已经发生 | 在场 vs 回看 |
| 产出 | 对话本身 | 可检索文本 + 时间戳 | 要笔记的人 |
| 输入 | 摄像头 + 麦克风 | 链接 / 本地文件 / 多平台 | 要覆盖 B 站、播客的人 |
| 失败模式 | 当下听漏 | 事后搜不到 | 看你怕哪一种 |
| 隐私 | 画面实时进模型 | 可对已有录像处理 | 不能开摄像头的场景 |
没有「全面更好」的一边。辅导孩子写题、远程看设备故障,实时更合适。一周五场行业直播、一门要考试的网课、一季要写稿的播客,事后总结才是主路径。
实用规则: 先选时间点,再选模型。把「会聊天」当成「会归档」,是 2026 年最常见的错配。
如果你已经在用实时通话,补一条归档轨并不冲突:散会后把录像丢进总结,把「刚才那页的数字」从热气变成一条带时间码的笔记。这正是 视频总结器 这条产品线存在的理由——它不跟你抢通话,它接管通话结束之后。
常见误区
误区 1:全双工上线,异步总结就过时了
反了。全双工让「在场」变便宜,于是会有更多通话被录下来。被录下来的东西如果不能检索,只是把热气存成了更大的热气。可打脸预判:若到 2027 年 8 月,主流实时通话产品已经默认输出带时间戳的章节笔记,并且检索体验不弱于独立总结工具,这条判断作废。
误区 2:实时模型看过画面,就等于做了视觉分析
看见和归档是两件事。通话里的联合理解服务于当下回应;视觉分析要的是关键帧、板书、图表数字能被单独引用。后者见视觉内容总结。
误区 3:只要模型够快,就不需要输入层
输入层包括:打得开的平台、稳得住的字幕、切得动的章节、回得去的时间码。这些不会因为模型更快而自动出现。模型越便宜,这一层越值钱。
从看完到用上
一套本周就能用的分工:
- 必须人在场、必须看画面的,用字节自家聊天应用视频通话体验 SeedRealtime。
- 会后或回放,把同一段内容丢进事后总结,强制要章节和时间戳。
- 只把「结论 / 数字 / 待办」写进笔记,原文用时间码回跳。
- 下一周用搜索而不是记忆来复用。
实时模型改变的是对话的手感。知识工作改变的是:一周后你还能不能把那句话找回来。
立即访问 BibiGPT 官网,把下一条回放变成可检索笔记:
- 🌐 官网: https://bibigpt.co/zh
- 📱 移动端下载: https://bibigpt.co/zh/app
- 💻 桌面端下载: https://bibigpt.co/zh/desktop
- ✨ 了解更多功能: https://bibigpt.co/zh/features
BibiGPT 团队