Qwen3.8-Flash 详解

截至 2026-09-01:阿里通义千问团队于 2026-08-26 开源 Qwen3.8-Flash-Next——125B 多模态 MoE,每一步 激活 6B 参数,另加 51B N-gram 嵌入。原生上下文 262K 单位,经 YaRN 可扩到 1M。若要从长视频拿章节,粘链接就行——不必自己托管 125B 权重。

开源 · 2026-08-26 125B MoE · 6B 激活 下方可试用

Get the notes, skip the architecture diagram

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

把 BibiGPT 设为 Google 优先来源 在热门报道和 AI 概览里看到更多 BibiGPT。

关键事实(90 秒读完)

截至 2026-09-01:阿里通义千问团队于 2026-08-26 开源 Qwen3.8-Flash-Next——125B 多模态 MoE,每一步 激活 6B 参数,另加 51B N-gram 嵌入,原生 262K 上下文(YaRN 可至 1M),训练成本约为 Qwen3.7-Plus 的九分之一。最近更新:2026-09-01。

Features

Qwen3.8-Flash-Next 到底是什么

2026-08-26,通义千问团队开源 Qwen3.8-Flash-Next,作为 Qwen4 的架构预览。生产 API 名称是 Qwen3.8-Flash。同一代、两种形态:开源权重 vs 托管接口。

125B MoE、6B 激活,外加 51B N-gram 嵌入

Qwen 称主模型 125B 参数,每一步 激活 6B,另有 51B N-gram 嵌入参数,可放在系统内存而不是 GPU 显存里。

原生 262K 上下文,YaRN 可至 1M

默认上下文窗口是 262,144 上下文单位。Qwen 称用 YaRN 可拉到一百万单位,适合长文件和长对话。讲座文字稿仍然需要章节;宽窗口不等于笔记本。

训练成本约为 Qwen3.7-Plus 的 1/9

Qwen 称训练 Qwen3.8-Flash-Next 的成本大约是 Qwen3.7-Plus 的九分之一,并在编码与办公任务上有提升。这是厂商的训练成本说法,不是用户单价。

做长视频的人,这件事意味着什么

更便宜的长上下文多模态模型,帮的是 API 团队。它本身不会给学生从两小时 B 站上传里直接吐出带时间戳的笔记。后半截活是 BibiGPT 的产品位。

你不该自己去托管 125B 权重

粘一条链接,拿到章节、文字稿和后续问答。BibiGPT 支持用 Qwen3.8-Flash 做长内容笔记——你不用去挑架构图。

长上下文只有留住笔记才划算

九十分钟讲座仍然需要时间戳和导出。一次便宜的 API 调用却从不归档,等于白费;带章节的总结才是下周还能搜到的文档。

这不是 Qwen 3.6,也不是 Qwen3-ASR

Qwen 3.6 是更早一代的多模态。Qwen3-ASR 是语音识别系列。本页只讲 2026-08-26 的 Flash-Next / Flash 事件。一种意图,一个 URL。

5 条关键变化(90 秒读完)

来自 Qwen 2026-08-26 Qwen3.8-Flash / Flash-Next 发布的核心事实。

  1. 1

    2026-08-26 开源权重

    Qwen 当晚在 Hugging Face 与 ModelScope 发布 Qwen3.8-Flash-Next(含 FP8 构建),定位为 Qwen4 的架构预览。

  2. 2

    125B MoE、6B 激活、51B N-gram 嵌入

    Qwen 文档写明 125B 主模型、每一步 激活 6B 参数,以及额外 51B N-gram 嵌入,可放在系统内存而不是 GPU 显存。

  3. 3

    原生 262K 上下文,YaRN 可至 1M

    默认上下文是 262,144 上下文单位。Qwen 称用 YaRN 可扩到一百万单位,适合长文件和长线程。

  4. 4

    训练成本约为 Qwen3.7-Plus 的 1/9

    Qwen 称 Flash-Next 训练成本大约是 Qwen3.7-Plus 的九分之一,编码与办公任务分数更强。这是厂商的训练成本数字。

  5. 5

    API 标价每百万单位 1 元 / 3 元

    Reuters 报道托管 Qwen3.8-Flash API 按每百万输入单位 1 元、每百万输出单位 3 元计价。做预算前请到 QwenCloud 核对。

BibiGPT 用户的 3 个典型场景

更便宜的长上下文 Qwen 模型哪里重要——以及总结器才是真正的产品位。

你已经自己在跑 Qwen

用开源权重或 Flash API 搭自己的编码与办公栈。然后再把讲完的课粘进 BibiGPT,让人拿到章节,而不是一坨生文本。

你只想从长中文视频拿笔记

两小时 B 站上传不需要一份 Qwen4 架构简报。粘 URL、导出文字稿、继续追问。这就是 BibiGPT 的路径。

你在对比 Qwen 各代

Qwen 3.6 是上一代多模态详解。Qwen3-ASR 是语音识别。本页只讲 Flash / Flash-Next。一个模型家族事件,一个 URL。

相关 BibiGPT 工具

与这次发布配套的长视频笔记工作流。

来源

本页规格来自 Qwen 2026-08-26 发布说明与 Reuters 同日报导。

  • Qwen 于 2026-08-26 开源 Qwen3.8-Flash-Next:125B 多模态 MoE、6B 激活参数、51B N-gram 嵌入、原生 262K 上下文(YaRN 可至 1M),训练成本约为 Qwen3.7-Plus 的 1/9。

    GitHub — QwenLM/Qwen3.8-Flash-Next ↗
  • Reuters 报导了 2026-08-26 发布、默认 262,144 上下文单位 窗口(可扩到 1 百万)、训练成本约为 Qwen3.7-Plus 的九分之一,以及每百万输入 / 输出 单位 1 元 / 3 元的 API 标价。

    Reuters — Alibaba's Qwen launches Qwen3.8-Flash ↗
  • IT之家同日报导了中文简讯:北京时间 23:00 在 Hugging Face 与 ModelScope 开源权重,以及 1 元 / 3 元的 API 标价。

    IT Home — Qwen3.8-Flash (Next) ↗

本页用到的术语

什么是混合专家(MoE)模型?

混合专家模型保留很大的参数池,每一步 只激活其中一部分。文档里 Qwen3.8-Flash-Next 是总计 125B、每一步 激活 6B。实际效果是容量更大,却不必在每一步 上付满稠密模型的算力账单。

262K 上下文窗口对视频笔记有什么用?

262,144 上下文单位 的窗口原则上能在一次调用里装下长文字稿加指令。它本身不会产出章节、时间戳,或下周还能搜到的导出件。那些产物是视频笔记产品该干的活。

深受创作者、学生和研究人员的喜爱

看看大家为什么每天都用 BibiGPT 把视频转成文字。

全球 50,000+ 用户的信赖之选

★★★★★

“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”

Maya R.

内容创作者 · 二次创作短视频

★★★★★

“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”

Daniel K.

语言学习者 · 用真实视频学外语

★★★★★

“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”

Priya S.

研究人员 · 引用公开演讲

常见问题解答

有问题?问我们!

热门文章

跳过 125B 权重,直接拿笔记

粘贴一条长 YouTube、Bilibili 或播客链接。BibiGPT 返回章节、文字稿和后续问答。最近更新:2026-09-01。