什麼是 WER(字錯誤率)?
字錯誤率是相對參考文字稿,被替換、刪除或插入的字所占比例。5.00% WER 代表在該測試集上,每 100 個參考字約有五處錯誤。它不會告訴你錯的是人名、數字還是語助詞——而聽的人真正在意的往往是這些。
截至 2026-09-01,IBM 已於 2026-08-25 發布 Granite Speech 5.0 Turbo CTC:兩款精簡的 470M 英語語音辨識模型。IBM 聲稱單張 NVIDIA H200 可達逾 12,600 RTFx——批次推論下一秒可轉寫超過 3.5 小時語音。BibiGPT 則把影片或播客連結變成帶時間戳的文字稿與總結,不用自己接顯示卡。
Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without wiring a CTC decoder.
截至 2026-09-01,IBM 已於 2026-08-25 發布 Granite Speech 5.0 Turbo CTC:兩款 470M 英語語音辨識模型(Apache 2.0 與 CC-BY-NC-SA-4.0)。IBM 聲稱單張 NVIDIA H200 可達逾 12,600 RTFx——批次推論下一秒可轉寫超過 3.5 小時語音。最後更新 2026-09-01。
IBM Research 與 Hugging Face 上的 ibm-granite 組織於 2026-08-25 釋出兩款僅編碼器的英語語音辨識模型。它們拿掉了先前 Granite Speech 用的 語言模型 骨幹,整套堆疊維持在 4.7 億參數。
granite-speech-5.0-470m-turboctc 採 Apache 2.0。-nc 變體額外用了 GigaSpeech、SPGI Speech 等資料,授權為 CC-BY-NC-SA-4.0。要商業自由,或要略低一點的 WER——同一個檢查點無法兩者兼得。
IBM 聲稱在單張 NVIDIA H200 上以批次推論可達逾 12,600 倍即時吞吐——足以一秒轉寫超過 3.5 小時語音。這是 IBM 公開數字,不是獨立評測對決。
截至 2026-08-25,IBM 在 OpenASR Leaderboard 公開英語測試集上報告:Apache 模型彙總 WER 5.00%,NC 模型 4.85%。字錯誤率計入替換、刪除與插入——數字是分數,不是保證你錄音裡的人名一定對。
快速的開源語音辨識檢查點,對會自託管的人有用。多數只是要補一堂課的人,需要的是能當筆記用的文字,不是一套 Conformer 堆疊。後半段工作,正是 BibiGPT 的位置。
這些模型為筆電、手機與高吞吐轉寫機而設計。它們放棄了先前 Granite Speech 具備的語音翻譯與關鍵詞偏置。你仍得自己包權重、解碼器與儲存。
任何語音辨識吐出的純文字,仍然要人去讀。BibiGPT 接一條連結就回傳帶時間戳的文字稿,加上 AI 總結與可搜尋筆記——兩小時錄音變成能掃完的東西。
兩款 Turbo CTC 都是英語語音辨識。方言很重的中文、日語或混語播客,需要另一條路。BibiGPT 從貼上的連結就能轉寫並總結那些錄音,不用你自己挑檢查點。
來自 IBM 2026-08-25 Granite Speech 5.0 Turbo CTC 發布的核心事實。
IBM 在 Hugging Face 上架 granite-speech-5.0-470m-turboctc(Apache 2.0)與 granite-speech-5.0-470m-turboctc-nc(CC-BY-NC-SA-4.0),與 Granite 4.2 語言模型同日。
不同於 Granite Speech 4.1,Turbo CTC 是僅編碼器的 CTC。IBM 拿掉語音翻譯與關鍵詞偏置,讓體積小到能上筆電與手機。
IBM 聲稱單張 NVIDIA H200 批次推論可達逾 12,600 倍即時吞吐——一秒轉寫超過 3.5 小時語音。這是廠商在公開 OpenASR 集上的量測。
截至 2026-08-25,IBM 報告 Apache 模型彙總 WER 5.00%、NC 模型 4.85%(OpenASR 公開英語測試)。在 FFASR 上,IBM 稱這對模型是當日榜上最快的兩款。
IBM 發布了 Chrome/Edge 的 WebGPU 串流示範。兩款模型都是英語語音辨識。混語或方言很重的影片,仍需要更廣的轉寫工作流。
快速開源語音辨識釋出真正有用的地方——以及「連結變筆記」產品才是真正要做的工作。
團隊用自己的顯示卡轉寫通話存檔時,可以評估 Apache 2.0 檢查點。然後仍把成品丟進 BibiGPT,讓人拿到章節,而不是原始文本 流。
90 分鐘的課堂錄音不需要一套 Conformer 堆疊。把網址貼進 BibiGPT,匯出帶時間戳的文字稿,繼續追問。這才是產品路徑。
Granite Speech 5.0 Turbo CTC 偏英語、偏吞吐。Qwen3-ASR 覆蓋 52 種語言與方言。每個模型家族各留一個 URL;不要併成單一「開源語音辨識」頁。
與這次釋出搭配的轉寫與筆記工作流。
本頁事實來自 IBM 自家 2026-08-25 文章。吞吐與 WER 皆為 IBM 報告值。
IBM Granite 於 2026-08-25 宣布兩款 470M 英語語音辨識模型,聲稱單張 H200 逾 12,600 RTFx,OpenASR 公開集 WER 為 5.00%(Apache 2.0)與 4.85%(NC)。
Hugging Face — Extremely Fast and Accurate Transcription with Granite Speech 5.0 Turbo CTC ↗ibm-granite/granite-speech-5.0-470m-turboctc 模型卡:Apache 2.0、英語、470M、Conformer CTC,發布日 2026 年 8 月 25 日。
Hugging Face model card — granite-speech-5.0-470m-turboctc ↗IBM Research 2026-08-25 的 Granite 4.2 文章點名 Granite Speech 5.0 Turbo CTC 與 Turbo CTC NC 為當日語音模型(URL slug 是 Granite 4.2,不是 Speech 5.0)。
IBM Research — Granite 4.2 ↗字錯誤率是相對參考文字稿,被替換、刪除或插入的字所占比例。5.00% WER 代表在該測試集上,每 100 個參考字約有五處錯誤。它不會告訴你錯的是人名、數字還是語助詞——而聽的人真正在意的往往是這些。
RTFx 表示系統每秒牆上時間能轉寫多少秒音訊。RTFx 12,600 代表報告的設定以 12,600 倍於即時的速度處理音訊。這是硬體與批次設定的數字,不是對筆電麥克風的承諾。
看看大家為什麼每天都用 BibiGPT 把影片轉成文字。
全球 50,000+ 使用者的信賴之選
“貼上連結幾秒鐘就拿到乾淨的字幕文字,每週幫我省下好幾個小時的手動整理時間。”
Maya R.
內容創作者 · 二次創作短影片
“匯出逐字稿後我可以按自己的節奏複習生詞,再也不用反覆暫停影片了。”
Daniel K.
語言學習者 · 用真實影片學外語
“準確、帶時間戳的文字可以直接引用,它已經悄悄成為我日常工作流程的一部分。”
Priya S.
研究人員 · 引用公開演講
FAQ
歡迎提問!
1 B站AI影片摘要工具哪個好?BibiGPT支援30+平台、100萬+用戶信賴,一鍵貼上連結即可產生結構化摘要。本文深度對比5大工具,含AI Agent 自動化方案。
2 Install a video-summary skill into DeepSeek Harness in one copy-paste — SKILL.md matches Claude Code. Or skip dsh: paste a Bilibili or YouTube link in the browser and get a timestamped summary.
3 Reverse any video free with no app and no download, right in your browser. Step-by-step for iPhone, Android, and PC, plus how to reverse audio (2026).
貼一條 YouTube、B 站或播客連結——或上傳檔案。BibiGPT 回傳帶時間戳的文字稿、AI 總結,以及可搜尋的筆記。最後更新 2026-09-01。