Claude Video:不只读字幕,还能结合关键画面理解视频
https://github.com/bradautomates/claude-video
把一个 YouTube 链接交给 Claude,让它总结视频,很多时候得到的其实只是“字幕总结”。
只要画面里出现了字幕没有提到的代码、图表、界面操作或者广告创意,Claude 就很容易漏掉。屏幕上明明已经报错了,Transcript 里却只留下讲解者的一句“这里有点问题”。
Claude Video 想补上的正是这块短板。
它是一个开源 Agent Skill。安装以后,只要输入一条 /watch 命令,就可以把 YouTube、TikTok、X、Loom 等视频链接,或者本地 MP4、MOV、MKV、WebM 文件,拆成带时间戳的字幕和关键画面,再交给 Claude 进行联合分析。
例如:
/watch bug-repro.mov 界面从什么时候开始出错?
/watch https://youtu.be/xxx 这个视频开头用了什么钩子?
/watch https://youtu.be/xxx 去掉宣传话术,告诉我真正更新了什么
写稿时,这个项目已经获得九千多个 GitHub Star,采用 MIT 许可证。
它不再只依赖 Transcript
Claude Video 的基本思路并不复杂:
- 用
yt-dlp获取视频和平台字幕; - 用
ffmpeg提取关键帧或场景变化画面; - 字幕不存在时,把音频交给 Whisper 转写;
- 把每张图片的本地路径和时间戳,以及带时间轴的 Transcript,一起交给 Claude;
- Claude 并行读取图片,再回答用户的问题。
因此,它看到的不只是讲解者说了什么,还能看到画面上出现了什么。
分析广告时,可以同时观察开头镜头、字幕设计、产品展示和口播;分析课程时,可以读到幻灯片和代码;排查 Bug 时,可以找到界面异常出现的具体时刻。
这比单纯总结字幕更接近“看过视频以后再回答”。
但它并不是把整段视频逐帧塞给 Claude
“让 Claude 真正看视频”是一个方便理解的说法,但从实现上看,Claude Video 仍然是把视频转换成“抽样画面+文字时间轴”。
它不会默认把每一帧都交给模型。因为视频有成千上万帧,全部读取不仅慢,还会迅速耗尽上下文和图片 Token。
项目提供四种详细程度:
transcript:只读字幕,不下载视频画面,成本最低;efficient:快速读取关键帧,最多约 50 张;balanced:默认模式,优先提取场景变化,最多约 100 张;token-burner:保留全部场景变化候选帧,覆盖更完整,但 Token 消耗也更大。
它还会把图片缩放到默认 512 像素宽,并删除视觉上几乎相同的画面。长时间停留在同一张幻灯片时,不会重复把十几张近似图片交给 Claude 计费。
这套设计的重点不是“看得越多越好”,而是用有限的图片预算覆盖尽量多的关键时刻。
长视频最好先粗看,再聚焦
短视频比较适合一次分析。30 秒以内默认约提取 30 张图,三分钟以内约 60 张,三到十分钟约 80 张。
超过十分钟以后,默认的 100 张画面会分散在整条视频上,只能算稀疏扫描。对于四五十分钟的课程或访谈,Claude 可能知道整体结构,却看不清某一分钟里的连续操作。
更合适的方法是先跑一次低成本分析,找到值得关注的时间段,再指定范围重新读取:
/watch video.mp4 --start 2:15 --end 2:45
如果讲解者说“看这里”或者“注意这个变化”,还可以根据 Transcript 中的时间点,用 --timestamps 精确抓图。
所以它并不能保证替代完整观看。分析关键镜头、课程结构和 Bug 复现很有用;涉及高速动作、细微连续变化或逐帧判断时,仍然需要人工回看原视频。
支持数百个平台,实际依赖 yt-dlp
Claude Video 能处理 YouTube、TikTok、X、Instagram、Loom 等平台,是因为底层使用了 yt-dlp。
理论上,yt-dlp 支持的几百个平台都可以尝试;但这不等于每个链接都能随时下载。平台登录、地区限制、Cookie、验证码和反爬策略,都可能导致失败。TikTok、X 等平台的可用性也会随着网站变化而变化。
本地视频不受平台限制,但通常没有现成字幕,需要额外转写音频。
字幕优先免费,没有字幕才调用 Whisper
Claude Video 会先尝试获取平台的人工字幕或自动字幕。这一步不需要额外的语音识别费用。
如果视频没有字幕,它会提取单声道音频,并调用以下一种服务:
- Groq 的
whisper-large-v3; - OpenAI 的
whisper-1。
这时需要用户自己的 API Key,也会产生相应费用。如果不希望上传音频,可以使用 --no-whisper,只分析画面。
因此,“免费使用”指的是 Skill 本身采用 MIT 许可证,yt-dlp 和 ffmpeg 也可以免费使用。实际分析仍会消耗 Claude 的图片和文本 Token;没有字幕时,Whisper API 还可能产生额外费用。
它适合哪些场景
拆解爆款视频。分析开头钩子、镜头节奏、字幕设计、产品露出和口播结构,而不是只总结说了什么。
研究广告创意。找出品牌在什么时候展示产品、怎样做前后对比、如何用画面配合文案。
定位界面 Bug。把用户的屏幕录像交给 Claude,让它寻找异常开始的时间和操作路径。
整理课程教程。把视频变成带时间点的笔记,结合幻灯片、终端和代码画面补充字幕里没有的信息。
快速过滤发布会。跳过铺垫和营销话术,提取真正新增的功能以及对应演示画面。
如何安装
Claude Code 可以通过插件市场安装:
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
Codex、Cursor、Copilot、Gemini CLI 等兼容 Agent Skills 的工具,可以执行:
npx skills add bradautomates/claude-video -g
第一次运行时,Skill 会检查 yt-dlp 和 ffmpeg。macOS 可以通过 Homebrew 自动安装;Linux 和 Windows 会给出相应命令。如果需要 Whisper,它还会在本地配置目录生成 API Key 模板,密钥文件权限设为 0600。
本地视频也要注意隐私
视频下载、抽帧和音频提取主要在本机完成,但“本机处理”不等于“内容完全不离开电脑”。
Claude 读取关键帧时,图片会进入所使用模型的上下文;调用 Groq 或 OpenAI Whisper 时,音频也会发送给相应服务商。
如果是客户录屏、内部会议、未发布广告或包含账号信息的 Bug 视频,应先确认组织的数据政策。必要时只在本地抽帧,手动检查和脱敏后再交给模型,或者完全关闭 Whisper。
真正补齐的是“画面上下文”
Claude Video 没有让 Claude 获得人类一样的连续视频感知。它做的是一件更工程化、也更实用的事:
把难以直接输入模型的视频,转换成有时间关系的关键画面和字幕,再让多模态模型联合理解。
这已经足以解决很多原本只能依靠 Transcript 的局限。
以后研究竞品视频、拆解广告创意、整理课程或者分析屏幕录像,不一定要从头看到尾。可以先让 Claude Video 做一次粗看,再把真正重要的片段交给人重点检查。
AI 不一定需要像人一样连续盯着视频,才能帮我们节省大量观看时间。关键是让它看到字幕之外,画面里真正发生了什么。