Qwen3-ASR × BibiGPT

2026-01-30,阿里雲通義千問團隊開源了 Qwen3-ASR——一組覆蓋 52 種語言與方言的語音辨識模型,提供 1.7B 與 0.6B 兩個尺寸,另配一個非自迴歸的強制對齊模型,可在 11 種語言裡把文字與音訊對齊。1.7B 在開源語音辨識裡達到當前最好水平,與最強的商業 API相當;0.6B 犧牲一點準確率換來並行 128 下約 2000 倍的吞吐。這件事的實際含義是:方言重、口音重、帶背景音樂的音訊,想要準確轉寫不再只有付費 API一條路。而把字變成能用的東西——帶時間戳的文字稿、總結、可搜尋的筆記——是 BibiGPT 從一條連結就能給你的。

開源 · 2026-01-30 52 種語言與方言 1.7B / 0.6B
將 BibiGPT 設為 Google 優先來源 在熱門報導和 AI 總覽裡看到更多 BibiGPT。

關鍵事實(90 秒讀完)

2026-01-30,阿里雲通義千問團隊開源 Qwen3-ASR——1.7B 與 0.6B 兩個尺寸的語音辨識模型,覆蓋 52 種語言與方言(30 種語言加 22 種中文方言,以及帶口音的英語),內建語種檢測與時間戳預測,另配一個覆蓋 11 種語言的非自迴歸強制對齊模型。1.7B 在開源語音辨識中達到當前最好水平,與最強商業 API相當;0.6B 在並行 128 下達到約 2000 倍吞吐。實際含義是:方言重、口音重、帶音樂的音訊要準確轉寫,不再只能走付費 API。而拿到字只是前半程——BibiGPT 負責後半程,把一條連結變成帶時間戳的文字稿、總結和可搜尋筆記。

Features

Qwen3-ASR 是什麼?

2026-01-30 由阿里雲通義千問團隊開源,Qwen3-ASR 是一組一體化語音辨識模型。提供 Qwen3-ASR-1.7B 與 Qwen3-ASR-0.6B 兩個尺寸,都能在 52 種語言與方言範圍內做語種辨識和轉寫,並內建時間戳預測。另有一個獨立的非自迴歸強制對齊模型,可在 11 種語言裡把已有文字與音訊對齊。

52 種語言與方言

覆蓋 30 種語言外加 22 種中文方言,以及多個國家和地區口音的英語。方言與口音正是多數開源語音辨識翻車的地方,而真實錄音往往就長這樣。

兩個尺寸,兩種取捨

1.7B 是開源語音辨識裡的當前最好水平,與最強的商業 API相當;0.6B 保持不錯的準確率,同時在並行 128 下達到約 2000 倍吞吐——為量而生,不是為單個完美檔案。

語音、音樂、歌聲,都帶時間戳

模型能處理語音、音樂與演唱音訊,自行判斷語種並預測時間戳。有沒有時間戳,決定了你拿到的是一堵文字牆,還是一份能跳著看的文字稿。

為什麼做影片的人該關心一次開源語音辨識釋出

文字稿是後面一切的原料——總結、搜尋、翻譯、切片、筆記。當準確的多語言轉寫變得開源且便宜,瓶頸就從「拿到字」挪到了「拿字做事」。後半程正是 BibiGPT 所在的位置。

方言重的音訊不再是死路

帶地方方言的錄音,或口音很重的英語,長期以來是轉出來一堆亂碼的那一類檔案。開源模型把方言和口音覆蓋做進來之後,「哪些音訊值得轉寫」這件事本身變了。

文字稿只是第一步

任何語音辨識吐出來的純文字,仍然要人去讀。BibiGPT 接一條連結就給你帶時間戳的文字稿,加上 AI 總結、思維導圖和筆記——兩小時錄音變成幾分鐘能掃完的東西。

只想要答案的人不該配環境

跑開源模型意味著權重、顯示卡,還有把它跑起來的一整套環境。大多數只是想補一節課的人並不想碰這些。BibiGPT 把它壓回到「瀏覽器裡貼一條連結」——結果一樣,省掉組裝。

5 條關鍵事實(90 秒讀完)

來自通義千問團隊 2026-01-30 開源 Qwen3-ASR 的核心事實。

  1. 1

    2026-01-30 開源

    阿里雲通義千問團隊把 Qwen3-ASR 作為開源模型系列釋出,而不是隻提供介面。

  2. 2

    52 種語言與方言

    30 種語言加 22 種中文方言,以及多個國家和地區口音的英語——正是多數開源語音辨識缺的那部分覆蓋。

  3. 3

    兩個尺寸:1.7B 與 0.6B

    1.7B 領先開源語音辨識基準,且能與最強商業 API一較高下;0.6B 用一點準確率換來並行 128 下約 2000 倍的吞吐。

  4. 4

    自帶語種檢測與時間戳

    模型自行判斷所說語種並預測時間戳,且覆蓋音樂與演唱內容,不只是乾淨人聲。

  5. 5

    另有 11 種語言的對齊模型

    一個非自迴歸的強制對齊模型可在 11 種語言裡把已有文字與音訊對上——做字幕和歌詞卡點需要的正是這塊。

BibiGPT 使用者的 3 個典型場景

覆蓋廣、準確率高的語音辨識,如何改變「哪些內容值得轉寫」。

一節方言口音的課

學生錄了一節老師在國語和方言之間來回切的課。拿到的不再是滿是窟窿的文字稿,而是可讀的帶時間戳文字加總結——複習從看筆記開始,而不是從重聽開始。

多語言的播客存檔

創作者手裡有幾年的節目,嘉賓來自不同國家、口音各異。每條連結都變成可搜尋的文字稿和結構化總結,讓沒人搜得動的存檔重新變成可複用的素材。

和音訊對得上的字幕

剪輯手裡有稿子和成片,就是沒有時間軸。帶時間戳的轉寫正是讓字幕落在正確那一幀的前提——BibiGPT 還能從同一份素材一次做出雙語字幕。

深受創作者、學生和研究人員的喜愛

看看大家為什麼每天都用 BibiGPT 把影片轉成文字。

全球 50,000+ 使用者的信賴之選

★★★★★

“貼上連結幾秒鐘就拿到乾淨的字幕文字,每週幫我省下好幾個小時的手動整理時間。”

Maya R.

內容創作者 · 二次創作短影片

★★★★★

“匯出逐字稿後我可以按自己的節奏複習生詞,再也不用反覆暫停影片了。”

Daniel K.

語言學習者 · 用真實影片學外語

★★★★★

“準確、帶時間戳的文字可以直接引用,它已經悄悄成為我日常工作流程的一部分。”

Priya S.

研究人員 · 引用公開演講

常見問題

歡迎提問!

Popular guides

把任意影片或播客變成能搜尋的文字稿

貼一條 B 站、YouTube 或播客連結,或上傳自己的檔案。BibiGPT 給你帶時間戳的文字稿、AI 總結,以及可以搜尋、翻譯、發去筆記軟體的筆記。不用配模型,不用顯示卡,不用命令列。