DeepSeek V4-Flash-Vision-Exp:视觉 Agent 接近 Opus 4.8,不等于看懂整段视频
热点解读

DeepSeek V4-Flash-Vision-Exp:视觉 Agent 接近 Opus 4.8,不等于看懂整段视频

发布于 · 作者: BibiGPT 团队
把 BibiGPT 设为 Google 优先来源 在热门报道和 AI 概览里看到更多 BibiGPT。

你刚看完四十分钟产品演示。语音纪要写得很整齐:功能、价格、下一步。然后演讲者指着一张图说「看这个趋势」。纪要里只剩四个字:见图表。你倒回去找那一帧,进度条跳到广告,图表已经换成下一页。

这件事从 2026 年 8 月 21 日起,不再只是「转录够不够」。它变成一个视觉 Agent 决策:模型能不能看见那张图,以及看见之后,能不能接到你真正要带走的产出。

多数稿会停在「接近 Opus-4.8」。本文要拆的是另一半:视觉 Agent 能看图,还不等于看懂整段视频。

目录

8 月 21 日发布了什么

截至 2026 年 8 月 22 日:DeepSeek 在 官方 changelog 上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。调用名是 deepseek-v4-flash-vision-exp。同日 DeepSeek Harness 0.1.1 内置支持。

官方自己划了两条线:

  1. 文本侧与 V4-Flash 持平:Agent、推理、世界知识不因加视觉而塌。
  2. 视觉 Agent 基准接近 Opus-4.8:相对纯文本 V4-Flash 有一次「能看见」的跃升。

API 层同样写死了成本边界:图片按 token 计费,每张最多 384 token,价格与 V4-Flash 相同;支持 Chat Completions、Messages、Responses;图可以走 base64、外链 URL,或新上的 Files API(免费上传一次,之后用 file_id 复用)。视觉入参见 API Guides - VisionThe Decoder 补充:JPEG / PNG / GIF / WebP 按文件内容识别格式,不是看扩展名。

它仍带 Exp 后缀。官方没有同步开源权重,也没有把它写成 V4 多模态的终态。

网课里那页 PPT,才是视觉模型真正该看见的东西:

从视频里抽出的课件关键帧,配上对应时段的文字 截图:课件关键帧与对应文字。来源:BibiGPT。

实用规则: 读实验模型公告,先找后缀。Exp 能试用,不能当产品承诺。

文本持平、视觉跃升:数字怎么读

官方原话是「接近 Opus-4.8」。The Next Web 把同一张表读完了:新模型在 11 项里赢了 Opus-4.8 3 项,其余 8 项落后。NL2Repo 是 57.7 对 69.7,差 12 分;DSBench-Hard 是 63.6 对 71.7。接近的项也真接近:Terminal Bench 2.1 是 83.9 对 85.0,Chartography 是 64.3 对 65.0。

相对 V4-Flash 的跃升更具体。ApexBench Pass@1 从 26.2 到 36.5,Agents’ Last Exam 从 25.2 到 27.3。DeepSeek 自己的脚注写明:这两项里,纯文本 V4-Flash「忽略其中的多模态元素」。换句话说,一部分跃升是给盲测加了一只眼睛,不是文本能力突然翻倍。

维度V4-FlashV4-Flash-Vision-Exp看完整段视频
输入文本文本 + 图链接 / 文件 + 时间轴
Agent 看图画面 + 语音一起理解
官方口径文本基线视觉 Agent 接近 Opus-4.8产品工作流,不是基准名
计费V4-Flash 价同价,图最多 384 token/张按次产出,不按「看一张图」

演示:Harness 如何把模型接到真实任务。来源:YouTube 公开讲解,对照 DeepSeek Harness

实用规则: 看见「接近 Opus」,先数它赢了几项、输了几项。赢 3 输 8 仍然可以接近,但不能写成领先。

长视频那一层,我们在 DeepSeek V4 百万上下文工作流 里写过;Harness 技能怎么装,见 dsh 音视频 skill。本文只打「视觉 Agent → 视频画面理解」。

视觉 Agent 离看懂整段视频还差哪一层

答案先说:能读图的 Agent,默认吃的是一张图、一张截图、一张表。整段视频要的是时间轴上的连续画面,再叠语音、字幕、章节。

V4-Flash-Vision-Exp 的合法场景很清楚:描述图片、读截图文字、看图表、把看见的东西接到工具调用。这已经够做 GUI Agent、报表问答、幻灯片抽检。它不够的是:四十分钟演示里图表出现了 11 秒,你要的是「第 17 分钟那张图说了什么」,而不是「我上传了这一帧」。

办公 Agent 的下一站不是更聪明的规划,是能不能把音视频喂进去。会议录像、网课、产品演示,默认仍卡在输入层。谁先把「看见的帧」接上「可检索的章节」,谁才覆盖创作者、学生、职场三条高频路径。

存量差异也在这里。百万上下文解决「一次塞得下多长」;Harness 解决「技能文件夹怎么被 runtime 发现」。视觉实验模型解决「图能不能进 Agent」。三段都必要,没有一段等于看懂视频。

关键帧分析面板:先抽出画面,再让视觉模型读每一帧 截图:关键帧分析面板。来源:BibiGPT。

实用规则: 视觉 Agent 能看图,不等于能看完整段视频。缺时间轴,就只是相册问答。

对创作者、学生、职场分别意味着什么

创作者。 你要的不是「这张封面漂亮」,是「这条 20 分钟讲解能不能拆成能发的图文」。视觉 Agent 帮你读一帧图表;视频画面内容总结 帮你看完整段,再接到 视频转图文

学生。 网课价值经常在板书和 PPT,不在老师的口头禅。视觉 Agent 适合抽检某一页;整门课要的是关键帧网格 + 对应字幕,像翻课件而不是重看四小时。

职场。 周会录像里真正不能漏的是共享屏幕上的数字。纯文本纪要会写成「见屏幕」。视觉 Agent 能读你截下来的那张;可检索的章节能让你从「第 23 分钟的表格」跳回去。已服务超过 100 万用户、累计超过 500 万次总结、覆盖 30+ 平台,差的从来不是再接一个模型名,是把看见的帧留在时间轴上。

选择过滤器只有一句:你要的是「读一张图」,还是「带走整段视频里该看见的那些图」。

实用规则: 评估视觉模型,先问产出落在哪一帧。说不清时间点,就还不是视频理解。

视觉模型选择器:同一组关键帧,可以换不同的看图模型 截图:关键帧分析的模型选择。来源:BibiGPT。

把画面理解接到工作流

判断章到此为止。产品怎么用,只放这一节。假设你手上有一条带图表的讲解视频:

  1. 粘贴 B 站 / YouTube / 播客链接,先出带时间戳的章节,不要先截图。
  2. 打开视觉化总结,让系统抽出关键帧,而不是你自己拖进度条碰运气。
  3. 对含图表、代码、板书的帧做画面分析,把「见图表」写成可读的要点。
  4. 需要二次分发时,走图文或课件视图,而不是再手抠封面。
  5. 回到原时间点核对,不把模型描述当成最终事实。

对照演示:贴一条链接,看画面怎么变成可引用的要点。

把画面变成图文笔记

AI 不只听声音,还会看画面——幻灯片、图表、屏幕上的文字,全都帮你整理成文字。

试试样例:

关键画面

画面文字: nanoGPT

Karpathy 现场敲出 bigram 模型——最简单的语言模型,用当前字符预测下一个字符。

通用总结入口仍是 AI 视频总结指南。视觉实验模型可以成为这条产线里「读图」的一环;它不是产线本身。本文发布时,产品侧尚未把该实验模型写成已接入——话题式写模型发布合法,绑定「由它驱动」不合法。

把视频链接交给画面分析,入口是链接而不是相册 截图:视频转图文入口。来源:BibiGPT。

可打脸预判

若到 2027 年 2 月,主流视觉 Agent 仍只能吃单张图 / 短截图,不能在时间轴上对齐「第 N 分钟那张表」并写出可检索章节,则「视觉 Agent 接近旗舰 ≠ 看懂整段视频」这条判断成立。若半年内出现公开、可复现的「整段视频画面理解」基准,且 Flash Vision 一类实验模型直接打平产品工作流,这条判断作废。

常见问题

V4-Flash-Vision-Exp 是不是已经对标 Opus 5? 不是。官方和第三方报道比的是 Opus-4.8。TNW 写明表里没有 Opus 5 列。

384 token 一张图贵不贵? 官方口径是与 V4-Flash 同价,单张上限 384 token,没有另开视觉专项费。Files API 免费,适合反复问同一张图。

和百万上下文那篇有何不同? 那篇打「一次塞得下多长」。本篇打「眼睛接到 Agent 之后,视频工作流还缺时间轴」。

BibiGPT 是不是已经接入这个实验模型? 没有按产品集成稿来写。发布前未接入该实验模型。用户可选的模型可以点名;系统自动决定的环节不绑「由 X 驱动」。

只想看图、不想做视频总结,还要不要这条产线? 只要读图,走视觉 API 就够。要带走整段视频里的图表、板书、演示界面,仍需要章节 + 关键帧 + 可跳回的时间戳。

读完表再决定要不要跟风。接近旗舰的是视觉 Agent 基准,不是「粘贴链接就能看懂四十分钟演示」。要把看见的帧留在时间轴上,用 BibiGPT 先跑一条你自己的链接。

立即开始,把视频画面变成可检索的要点:

BibiGPT 团队

查看「模型更新与解读」全部 47 篇 →

试试这些 AI 工具