DeepSeek 能把音频转成文字吗?
不能。DeepSeek 的 App 没有音视频上传功能,API 也没有转写接口,录音根本没地方发送。要把音频内容送进 DeepSeek,得先用一个独立的转写工具把它变成文字,再把文字粘贴或传进对话里。
DeepSeek 推理能力很强,但你没法直接甩给它一集播客。App 里没有音视频上传入口,API 也没有转写接口,所以一条播客链接或一个 mp4 文件根本没地方「喂」进去。缺的是中间这一步转换:先把录音转成文字,再让 DeepSeek 发挥所长。BibiGPT 就是这一步——粘贴链接或上传本地文件,就能拿到带时间戳的文字稿、章节摘要和笔记。自 DeepSeek 于 2026-08-13 开源其 Agent Harness 以来,你还可以把 BibiGPT 作为 Skill 装进去,让 Agent 自己完成抓取、转换、推理的全流程。
Paste a podcast, lecture or video link — the transcript and chapter summaries come back in seconds, ready to hand to DeepSeek. The live BibiGPT app loads inline; no redirect.
DeepSeek 没法自己转写音频或视频——没有上传入口,也没有转写接口可调。得先转换,再把文字交给它。BibiGPT 负责转换这一步:粘贴链接或上传本地文件,就能拿到带时间戳的文字稿、章节摘要和笔记。而且自 DeepSeek 于 2026-08-13 开源其 Agent Harness 以来,BibiGPT 还能作为 Skill 装进去,让 Agent 一口气完成抓取、转换和推理。
这不是在说模型不行,而是接口没对上:DeepSeek 能接收的输入类型,和你内容本来的格式,压根不是一回事。
DeepSeek 的对话 App 没有音视频上传入口,API 也没有开放转写接口。无论你想让它推理什么,内容都得先变成文字才能送进去。
把一条 YouTube 或播客链接粘进对话框,模型拿到的只是一串字符,而不是背后那两个小时的内容。它会很「乐意」地根据标题瞎猜——这正是你要避免的翻车现场。
有人试过写更长的指令、角色扮演,甚至让模型「仔细听」。但真正的解法在上游:先把录音转成文字,再把文字发给它。
粘贴一次,一段录音就变成推理模型真正需要的三样东西:说了什么、什么时候说的、整体结构是什么。
需要精确到时间点就导出 SRT 或 VTT,只要文字内容就选纯文本,要放进 Notion 或 Obsidian 就用 Markdown。
一段长录音会被拆成若干章节,每章都有摘要,你可以只把关心的那部分喂给 DeepSeek,而不是扔一整墙没有区分度的文字。
YouTube、Bilibili、播客、TikTok、X、小红书的链接都能直接粘贴,硬盘里的音视频文件也能直接上传。
DeepSeek Harness(dsh)是 DeepSeek 开源的 Agent Harness,MIT 协议,目前是开发者预览版,用 npx @deepseek-ai/dsh web 就能启动。下面这几步会把 BibiGPT 加进去——一条命令搞定,不用克隆仓库。
dsh plugin --profile web add "github:JimmyLv/bibigpt-skill#path:/dsh-plugin" —— 引号要保留,因为 # 在 shell 里会被当成注释开头。dsh 会把参数转交给 pnpm,而 pnpm 能直接从 git 仓库的某个子目录安装包,所以不用发布,也不用克隆。想装到其他 profile,把 --profile web 换成 --profile tui 或 --profile headless 即可。
harness 也会从磁盘读取 Skill:把 skills/bibi 文件夹复制到 ~/.agents/skills/ 下,零依赖即可被识别。这个目录是共享的,其他支持 SKILL.md 的 Agent 同样会读取,一份拷贝能同时服务 Claude Code 和 DeepSeek Harness。
重启 profile,打开命令面板,在 Skills 下就能看到 /bibi。给它一个链接,让它给摘要、文字稿或章节笔记——它会自己完成抓取、转换,再把文字交回对话里。
两条路径最终都是 DeepSeek 读到一份文字稿,区别在于你中途要碰多少个窗口。
| 步骤 | DeepSeek Harness 里的 BibiGPT Skill | 手动操作,不装 Skill |
|---|---|---|
| 拿到录音 | 把链接粘进对话 | 自己下载视频或提取音频 |
| 转成文字 | Agent 调用 Skill,等结果 | 上传到某个转写服务,等待,再下载文件 |
| 送进 DeepSeek | 已经在对话里了 | 打开文字稿,复制,粘贴,祈祷别超长 |
| 章节和时间戳 | 随文字稿一起返回 | 得自己手动重建,或者干脆没有 |
| 重复处理 20 集 | 同一条指令循环跑 | 把上面的流程重复 20 遍 |
共同点是:推理从来不是瓶颈,把录音变成可读的文字才是。
一场九十分钟的讲座会变成带时间戳、按章节拆分的文字稿。把卡住的那一段喂给 DeepSeek,跟它掰扯清楚,而不是扔一小时的原始文本祈祷它能看懂。
从一条短视频里提取文字稿,再让 DeepSeek 把它重新组织成脚本、推文串或邮件简报。文字稿保留了让这条视频出圈的措辞,而摘要会把这些细节抹平。
装上 Skill 之后,跑在 DeepSeek Harness 里的 Agent 可以自己拿到链接、转成文字并进行处理,全程不需要人工复制任何东西。这就是把一次性操作变成每晚跑一遍整个信息源的关键。
本页所有关于 DeepSeek Harness 的信息均来自该项目本身。
DeepSeek Harness——DeepSeek 开源的 Agent Harness,MIT 协议,开发者预览版,基于 Cordis 构建,于 2026-08-13 发布。
GitHub 上的 deepseek-ai/deepseek-harness ↗BibiGPT Skill 及用于注册它的 harness bundle,包括 ~/.agents/skills 这一安装路径。
GitHub 上的 JimmyLv/bibigpt-skill ↗不能。DeepSeek 的 App 没有音视频上传功能,API 也没有转写接口,录音根本没地方发送。要把音频内容送进 DeepSeek,得先用一个独立的转写工具把它变成文字,再把文字粘贴或传进对话里。
DeepSeek Harness,也叫 dsh,是 DeepSeek 开源的 Agent Harness,于 2026-08-13 在 GitHub 上发布,MIT 协议,标注为开发者预览版。它基于 Cordis 构建,整体设计是「一切皆插件」,像读取视频这样的外部能力就是通过这种方式加进去的。
一个 Skill 就是一个文件夹,里面有一份 SKILL.md,其 frontmatter 会告诉 Agent 这个 Skill 是做什么的、什么时候该用它。DeepSeek Harness 会从磁盘上发现 Skill,包括共享的 ~/.agents/skills 目录,所以同一个文件夹能同时服务多个支持 SKILL.md 的 Agent。
看看大家为什么每天都用 BibiGPT 把视频转成文字。
全球 50,000+ 用户的信赖之选
“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”
Maya R.
内容创作者 · 二次创作短视频
“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”
Daniel K.
语言学习者 · 用真实视频学外语
“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”
Priya S.
研究人员 · 引用公开演讲
常见问题
有问题?问我们!
1 2026年B站AI视频总结工具哪个最好?粘贴任意链接,几秒生成结构化总结、思维导图和重点提炼,支持30+平台、免登录。文末对比5大工具,选出最适合你的那一个。
2 给 DeepSeek Harness 装视频总结 skill 只需拷贝目录——SKILL.md 和 Claude Code 通用。也可以不装 dsh:在浏览器里粘贴 B 站或 YouTube 链接,直接出带时间戳的总结。
3 无需 App、无需下载,在浏览器里免费倒放任意视频。iPhone、Android、PC 分步教程,以及如何同步倒放音频(2026)。