Granite Speech 5.0 Turbo CTC 詳解

截至 2026-09-01,IBM 已於 2026-08-25 發布 Granite Speech 5.0 Turbo CTC:兩款精簡的 470M 英語語音辨識模型。IBM 聲稱單張 NVIDIA H200 可達逾 12,600 RTFx——批次推論下一秒可轉寫超過 3.5 小時語音。BibiGPT 則把影片或播客連結變成帶時間戳的文字稿與總結,不用自己接顯示卡。

發布 · 2026-08-25 470M 英語語音辨識 下方可試用

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without wiring a CTC decoder.

將 BibiGPT 設為 Google 優先來源 在熱門報導和 AI 總覽裡看到更多 BibiGPT。

關鍵事實(90 秒讀完)

截至 2026-09-01,IBM 已於 2026-08-25 發布 Granite Speech 5.0 Turbo CTC:兩款 470M 英語語音辨識模型(Apache 2.0 與 CC-BY-NC-SA-4.0)。IBM 聲稱單張 NVIDIA H200 可達逾 12,600 RTFx——批次推論下一秒可轉寫超過 3.5 小時語音。最後更新 2026-09-01。

Features

Granite Speech 5.0 Turbo CTC 實際是什麼

IBM Research 與 Hugging Face 上的 ibm-granite 組織於 2026-08-25 釋出兩款僅編碼器的英語語音辨識模型。它們拿掉了先前 Granite Speech 用的 語言模型 骨幹,整套堆疊維持在 4.7 億參數。

兩種授權,兩套訓練資料

granite-speech-5.0-470m-turboctc 採 Apache 2.0。-nc 變體額外用了 GigaSpeech、SPGI Speech 等資料,授權為 CC-BY-NC-SA-4.0。要商業自由,或要略低一點的 WER——同一個檢查點無法兩者兼得。

號稱單張 H200 逾 12,600 RTFx

IBM 聲稱在單張 NVIDIA H200 上以批次推論可達逾 12,600 倍即時吞吐——足以一秒轉寫超過 3.5 小時語音。這是 IBM 公開數字,不是獨立評測對決。

OpenASR WER:5.00% 與 4.85%

截至 2026-08-25,IBM 在 OpenASR Leaderboard 公開英語測試集上報告:Apache 模型彙總 WER 5.00%,NC 模型 4.85%。字錯誤率計入替換、刪除與插入——數字是分數,不是保證你錄音裡的人名一定對。

若你處理影片與播客,這會改變什麼

快速的開源語音辨識檢查點,對會自託管的人有用。多數只是要補一堂課的人,需要的是能當筆記用的文字,不是一套 Conformer 堆疊。後半段工作,正是 BibiGPT 的位置。

邊緣語音辨識還不是產品

這些模型為筆電、手機與高吞吐轉寫機而設計。它們放棄了先前 Granite Speech 具備的語音翻譯與關鍵詞偏置。你仍得自己包權重、解碼器與儲存。

文字稿只是第一步

任何語音辨識吐出的純文字,仍然要人去讀。BibiGPT 接一條連結就回傳帶時間戳的文字稿,加上 AI 總結與可搜尋筆記——兩小時錄音變成能掃完的東西。

僅英語是真實限制

兩款 Turbo CTC 都是英語語音辨識。方言很重的中文、日語或混語播客,需要另一條路。BibiGPT 從貼上的連結就能轉寫並總結那些錄音,不用你自己挑檢查點。

5 條關鍵變化(90 秒讀完)

來自 IBM 2026-08-25 Granite Speech 5.0 Turbo CTC 發布的核心事實。

  1. 1

    2026-08-25 發布,兩個檢查點

    IBM 在 Hugging Face 上架 granite-speech-5.0-470m-turboctc(Apache 2.0)與 granite-speech-5.0-470m-turboctc-nc(CC-BY-NC-SA-4.0),與 Granite 4.2 語言模型同日。

  2. 2

    沒有 語言模型 骨幹,470M 參數

    不同於 Granite Speech 4.1,Turbo CTC 是僅編碼器的 CTC。IBM 拿掉語音翻譯與關鍵詞偏置,讓體積小到能上筆電與手機。

  3. 3

    號稱單張 H200 逾 12,600 RTFx

    IBM 聲稱單張 NVIDIA H200 批次推論可達逾 12,600 倍即時吞吐——一秒轉寫超過 3.5 小時語音。這是廠商在公開 OpenASR 集上的量測。

  4. 4

    OpenASR WER 5.00%/4.85%

    截至 2026-08-25,IBM 報告 Apache 模型彙總 WER 5.00%、NC 模型 4.85%(OpenASR 公開英語測試)。在 FFASR 上,IBM 稱這對模型是當日榜上最快的兩款。

  5. 5

    WebGPU 串流示範,僅英語

    IBM 發布了 Chrome/Edge 的 WebGPU 串流示範。兩款模型都是英語語音辨識。混語或方言很重的影片,仍需要更廣的轉寫工作流。

BibiGPT 使用者的 3 個典型場景

快速開源語音辨識釋出真正有用的地方——以及「連結變筆記」產品才是真正要做的工作。

你要大量自託管英語語音辨識

團隊用自己的顯示卡轉寫通話存檔時,可以評估 Apache 2.0 檢查點。然後仍把成品丟進 BibiGPT,讓人拿到章節,而不是原始文本 流。

你只是要課堂筆記

90 分鐘的課堂錄音不需要一套 Conformer 堆疊。把網址貼進 BibiGPT,匯出帶時間戳的文字稿,繼續追問。這才是產品路徑。

你在比較 2026 的開源語音辨識釋出

Granite Speech 5.0 Turbo CTC 偏英語、偏吞吐。Qwen3-ASR 覆蓋 52 種語言與方言。每個模型家族各留一個 URL;不要併成單一「開源語音辨識」頁。

相關 BibiGPT 工具

與這次釋出搭配的轉寫與筆記工作流。

來源

本頁事實來自 IBM 自家 2026-08-25 文章。吞吐與 WER 皆為 IBM 報告值。

本頁用詞

什麼是 WER(字錯誤率)?

字錯誤率是相對參考文字稿,被替換、刪除或插入的字所占比例。5.00% WER 代表在該測試集上,每 100 個參考字約有五處錯誤。它不會告訴你錯的是人名、數字還是語助詞——而聽的人真正在意的往往是這些。

語音辨識裡的 RTFx 是什麼?

RTFx 表示系統每秒牆上時間能轉寫多少秒音訊。RTFx 12,600 代表報告的設定以 12,600 倍於即時的速度處理音訊。這是硬體與批次設定的數字,不是對筆電麥克風的承諾。

深受創作者、學生和研究人員的喜愛

看看大家為什麼每天都用 BibiGPT 把影片轉成文字。

全球 50,000+ 使用者的信賴之選

★★★★★

“貼上連結幾秒鐘就拿到乾淨的字幕文字,每週幫我省下好幾個小時的手動整理時間。”

Maya R.

內容創作者 · 二次創作短影片

★★★★★

“匯出逐字稿後我可以按自己的節奏複習生詞,再也不用反覆暫停影片了。”

Daniel K.

語言學習者 · 用真實影片學外語

★★★★★

“準確、帶時間戳的文字可以直接引用,它已經悄悄成為我日常工作流程的一部分。”

Priya S.

研究人員 · 引用公開演講

常見問題

歡迎提問!

Popular guides

跳過解碼器堆疊,直接拿文字稿

貼一條 YouTube、B 站或播客連結——或上傳檔案。BibiGPT 回傳帶時間戳的文字稿、AI 總結,以及可搜尋的筆記。最後更新 2026-09-01。