什么是 WER(词错误率)?
词错误率是相对参考稿被替换、删除或插入的词所占比例。5.00% WER 表示在该测试集上每 100 个参考词大约有 5 处错误。它不会告诉你错的是专名、数字还是语气词——而听的人真正在意的往往是这些。
截至 2026-09-01:IBM 于 2026-08-25 发布 Granite Speech 5.0 Turbo CTC——两款紧凑的 470M 英语 ASR 模型。IBM 报告单卡 NVIDIA H200 吞吐超 12,600 RTFx——批量推理下一秒可处理超过 3.5 小时语音。BibiGPT 把视频或播客链接变成带时间戳的文字稿和总结,不用自己接 GPU。
Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without wiring a CTC decoder.
截至 2026-09-01:IBM 于 2026-08-25 发布 Granite Speech 5.0 Turbo CTC——两款 470M 英语 ASR 模型(Apache 2.0 与 CC-BY-NC-SA-4.0)。IBM 报告单卡 NVIDIA H200 吞吐超 12,600 RTFx——批量推理下一秒可处理超过 3.5 小时语音。最近更新:2026-09-01。
IBM Research 与 Hugging Face 上的 ibm-granite 组织于 2026-08-25 发布了两款仅编码器的英语 ASR 模型。它们去掉了早期 Granite Speech 模型里的 语言模型 骨干,整栈参数量压在 470M。
granite-speech-5.0-470m-turboctc 是 Apache 2.0。带 -nc 的变体额外用了 GigaSpeech、SPGI Speech 等数据,许可证为 CC-BY-NC-SA-4.0。要么要商业自由,要么要略低一点的 WER——同一份权重里两者不能兼得。
IBM 报告在单卡 NVIDIA H200 上批量推理吞吐超过 12,600× 实时——一秒可转写超过 3.5 小时语音。这是 IBM 公布的数字,不是第三方横评。
截至 2026-08-25,在 OpenASR Leaderboard 公开英语测试集上,IBM 报告 Apache 模型合计 WER 为 5.00%,NC 模型为 4.85%。词错误率统计替换、删除和插入——它是分数,不是对你录音里专名的承诺。
又快又开源的 ASR 权重,对打算自建的人有用。多数人只是想补一节课,要的是能当笔记用的字,不是一套 Conformer 栈。后半截活正是 BibiGPT 干的。
这些模型面向笔记本、手机和高吞吐转写机。它们放弃了早期 Granite Speech 里的语音翻译和关键词偏置。你仍然要自己包权重、解码器和存储。
任何 ASR 吐出来的纯文本,还是要人去读。BibiGPT 接一条链接,返回带时间戳的文字稿,加上 AI 总结和可搜索笔记——两小时录音变成几分钟能扫完的东西。
两款 Turbo CTC 都是英语 ASR。方言重的中文、日语或混语播客得走别的路径。BibiGPT 粘一条链接就能转写并总结那些录音,不用你自己挑权重。
来自 IBM 2026-08-25 Granite Speech 5.0 Turbo CTC 发布的核心事实。
IBM 在 Hugging Face 上同日放出 granite-speech-5.0-470m-turboctc(Apache 2.0)与 granite-speech-5.0-470m-turboctc-nc(CC-BY-NC-SA-4.0),与 Granite 4.2 语言模型同天。
与 Granite Speech 4.1 不同,Turbo CTC 是仅编码器的 CTC。IBM 去掉了语音翻译和关键词偏置,好让体积小到能上笔记本和手机。
IBM 报告在单卡 NVIDIA H200 上批量推理吞吐超过 12,600× 实时——一秒超过 3.5 小时语音。这是厂商在公开 OpenASR 集上的测量。
截至 2026-08-25,IBM 报告 Apache 模型在 OpenASR 公开英语测试上合计 WER 为 5.00%,NC 模型为 4.85%。在 FFASR 上,IBM 称这一对是当天榜单里最快的两款。
IBM 发布了 Chrome/Edge 的 WebGPU 流式演示。两款模型都是英语 ASR。混语或方言很重的视频,仍需要覆盖更广的转写工作流。
又快又开源的 ASR 发布哪里重要——以及「链接变笔记」产品真正要干的活在哪。
团队在自有 GPU 上转写通话存档时,可以评估 Apache 2.0 权重。然后再把成品丢进 BibiGPT,让人拿到章节,而不是一串生文本。
九十分钟课堂录音不需要搭一套 Conformer。把 URL 粘进 BibiGPT,导出带时间戳的文字稿,继续追问。这就是产品路径。
Granite Speech 5.0 Turbo CTC 是英语、吞吐优先。Qwen3-ASR 覆盖 52 种语言与方言。每个模型家族各留一个 URL;不要合成一张笼统的「开源 ASR」页。
与这次发布配套的转写与笔记工作流。
本页事实来自 IBM 自家 2026-08-25 的发布。吞吐与 WER 均为 IBM 报告。
IBM Granite 于 2026-08-25 宣布两款 470M 英语 ASR 模型,报告单卡 H200 吞吐超 12,600 RTFx,OpenASR 公开集 WER 为 5.00%(Apache 2.0)与 4.85%(NC)。
Hugging Face — Extremely Fast and Accurate Transcription with Granite Speech 5.0 Turbo CTC ↗ibm-granite/granite-speech-5.0-470m-turboctc 模型卡:Apache 2.0、英语、470M、Conformer CTC,发布日期 2026 年 8 月 25 日。
Hugging Face model card — granite-speech-5.0-470m-turboctc ↗IBM Research 于 2026-08-25 的 Granite 4.2 博文点名 Granite Speech 5.0 Turbo CTC 与 Turbo CTC NC 为当天的语音模型(URL slug 是 Granite 4.2,不是 Speech 5.0)。
IBM Research — Granite 4.2 ↗词错误率是相对参考稿被替换、删除或插入的词所占比例。5.00% WER 表示在该测试集上每 100 个参考词大约有 5 处错误。它不会告诉你错的是专名、数字还是语气词——而听的人真正在意的往往是这些。
RTFx 表示系统每秒墙钟时间能转写多少秒音频。RTFx 为 12,600 表示报告配置下处理速度是实时的 12,600 倍。这是硬件加批处理的数字,不是对笔记本麦克风的承诺。
看看大家为什么每天都用 BibiGPT 把视频转成文字。
全球 50,000+ 用户的信赖之选
“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”
Maya R.
内容创作者 · 二次创作短视频
“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”
Daniel K.
语言学习者 · 用真实视频学外语
“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”
Priya S.
研究人员 · 引用公开演讲
常见问题
有问题?问我们!
1 2026年B站AI视频总结工具哪个最好?粘贴任意链接,几秒生成结构化总结、思维导图和重点提炼,支持30+平台、免登录。文末对比5大工具,选出最适合你的那一个。
2 给 DeepSeek Harness 装视频总结 skill 只需拷贝目录——SKILL.md 和 Claude Code 通用。也可以不装 dsh:在浏览器里粘贴 B 站或 YouTube 链接,直接出带时间戳的总结。
3 无需 App、无需下载,在浏览器里免费倒放任意视频。iPhone、Android、PC 分步教程,以及如何同步倒放音频(2026)。
粘贴一条 YouTube、Bilibili 或播客链接——或上传文件。BibiGPT 返回带时间戳的文字稿、AI 总结,以及能搜索的笔记。最近更新:2026-09-01。