Qwen3-ASR × BibiGPT

2026-01-30,阿里云通义千问团队开源了 Qwen3-ASR——一组覆盖 52 种语言与方言的语音识别模型,提供 1.7B 与 0.6B 两个尺寸,另配一个非自回归的强制对齐模型,可在 11 种语言里把文本与音频对齐。1.7B 在开源语音识别里达到当前最好水平,与最强的商业 API相当;0.6B 牺牲一点准确率换来并发 128 下约 2000 倍的吞吐。这件事的实际含义是:方言重、口音重、带背景音乐的音频,想要准确转写不再只有付费 API一条路。而把字变成能用的东西——带时间戳的文字稿、总结、可搜索的笔记——是 BibiGPT 从一条链接就能给你的。

开源 · 2026-01-30 52 种语言与方言 1.7B / 0.6B
把 BibiGPT 设为 Google 优先来源 在热门报道和 AI 概览里看到更多 BibiGPT。

关键事实(90 秒读完)

2026-01-30,阿里云通义千问团队开源 Qwen3-ASR——1.7B 与 0.6B 两个尺寸的语音识别模型,覆盖 52 种语言与方言(30 种语言加 22 种中文方言,以及带口音的英语),内置语种检测与时间戳预测,另配一个覆盖 11 种语言的非自回归强制对齐模型。1.7B 在开源语音识别中达到当前最好水平,与最强商业 API相当;0.6B 在并发 128 下达到约 2000 倍吞吐。实际含义是:方言重、口音重、带音乐的音频要准确转写,不再只能走付费 API。而拿到字只是前半程——BibiGPT 负责后半程,把一条链接变成带时间戳的文字稿、总结和可搜索笔记。

Features

Qwen3-ASR 是什么?

2026-01-30 由阿里云通义千问团队开源,Qwen3-ASR 是一组一体化语音识别模型。提供 Qwen3-ASR-1.7B 与 Qwen3-ASR-0.6B 两个尺寸,都能在 52 种语言与方言范围内做语种识别和转写,并内置时间戳预测。另有一个独立的非自回归强制对齐模型,可在 11 种语言里把已有文本与音频对齐。

52 种语言与方言

覆盖 30 种语言外加 22 种中文方言,以及多个国家和地区口音的英语。方言与口音正是多数开源语音识别翻车的地方,而真实录音往往就长这样。

两个尺寸,两种取舍

1.7B 是开源语音识别里的当前最好水平,与最强的商业 API相当;0.6B 保持不错的准确率,同时在并发 128 下达到约 2000 倍吞吐——为量而生,不是为单个完美文件。

语音、音乐、歌声,都带时间戳

模型能处理语音、音乐与演唱音频,自行判断语种并预测时间戳。有没有时间戳,决定了你拿到的是一堵文字墙,还是一份能跳着看的文字稿。

为什么做视频的人该关心一次开源语音识别发布

文字稿是后面一切的原料——总结、搜索、翻译、切片、笔记。当准确的多语言转写变得开源且便宜,瓶颈就从「拿到字」挪到了「拿字做事」。后半程正是 BibiGPT 所在的位置。

方言重的音频不再是死路

带地方方言的录音,或口音很重的英语,长期以来是转出来一堆乱码的那一类文件。开源模型把方言和口音覆盖做进来之后,「哪些音频值得转写」这件事本身变了。

文字稿只是第一步

任何语音识别吐出来的纯文本,仍然要人去读。BibiGPT 接一条链接就给你带时间戳的文字稿,加上 AI 总结、思维导图和笔记——两小时录音变成几分钟能扫完的东西。

只想要答案的人不该配环境

跑开源模型意味着权重、显卡,还有把它跑起来的一整套环境。大多数只是想补一节课的人并不想碰这些。BibiGPT 把它压回到「浏览器里贴一条链接」——结果一样,省掉组装。

5 条关键事实(90 秒读完)

来自通义千问团队 2026-01-30 开源 Qwen3-ASR 的核心事实。

  1. 1

    2026-01-30 开源

    阿里云通义千问团队把 Qwen3-ASR 作为开源模型系列发布,而不是只提供接口。

  2. 2

    52 种语言与方言

    30 种语言加 22 种中文方言,以及多个国家和地区口音的英语——正是多数开源语音识别缺的那部分覆盖。

  3. 3

    两个尺寸:1.7B 与 0.6B

    1.7B 领先开源语音识别基准,且能与最强商业 API一较高下;0.6B 用一点准确率换来并发 128 下约 2000 倍的吞吐。

  4. 4

    自带语种检测与时间戳

    模型自行判断所说语种并预测时间戳,且覆盖音乐与演唱内容,不只是干净人声。

  5. 5

    另有 11 种语言的对齐模型

    一个非自回归的强制对齐模型可在 11 种语言里把已有文本与音频对上——做字幕和歌词卡点需要的正是这块。

BibiGPT 用户的 3 个典型场景

覆盖广、准确率高的语音识别,如何改变「哪些内容值得转写」。

一节方言口音的课

学生录了一节老师在普通话和方言之间来回切的课。拿到的不再是满是窟窿的文字稿,而是可读的带时间戳文本加总结——复习从看笔记开始,而不是从重听开始。

多语言的播客存档

创作者手里有几年的节目,嘉宾来自不同国家、口音各异。每条链接都变成可搜索的文字稿和结构化总结,让没人搜得动的存档重新变成可复用的素材。

和音频对得上的字幕

剪辑手里有稿子和成片,就是没有时间轴。带时间戳的转写正是让字幕落在正确那一帧的前提——BibiGPT 还能从同一份素材一次做出双语字幕。

深受创作者、学生和研究人员的喜爱

看看大家为什么每天都用 BibiGPT 把视频转成文字。

全球 50,000+ 用户的信赖之选

★★★★★

“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”

Maya R.

内容创作者 · 二次创作短视频

★★★★★

“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”

Daniel K.

语言学习者 · 用真实视频学外语

★★★★★

“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”

Priya S.

研究人员 · 引用公开演讲

常见问题解答

有问题?问我们!

热门文章

把任意视频或播客变成能搜索的文字稿

贴一条 B 站、YouTube 或播客链接,或上传自己的文件。BibiGPT 给你带时间戳的文字稿、AI 总结,以及可以搜索、翻译、发去笔记软件的笔记。不用配模型,不用显卡,不用命令行。