跳至正文
东倒西歪玩AI
东倒西歪玩AI
  • 首页
  • 首页
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
SKILL

Claude Video:不只读字幕,还能结合关键画面理解视频

作者 ddxw
2026年7月21日 1 分钟阅读
0

https://github.com/bradautomates/claude-video

把一个 YouTube 链接交给 Claude,让它总结视频,很多时候得到的其实只是“字幕总结”。

只要画面里出现了字幕没有提到的代码、图表、界面操作或者广告创意,Claude 就很容易漏掉。屏幕上明明已经报错了,Transcript 里却只留下讲解者的一句“这里有点问题”。

Claude Video 想补上的正是这块短板。

它是一个开源 Agent Skill。安装以后,只要输入一条 /watch 命令,就可以把 YouTube、TikTok、X、Loom 等视频链接,或者本地 MP4、MOV、MKV、WebM 文件,拆成带时间戳的字幕和关键画面,再交给 Claude 进行联合分析。

例如:

/watch bug-repro.mov 界面从什么时候开始出错?
/watch https://youtu.be/xxx 这个视频开头用了什么钩子?
/watch https://youtu.be/xxx 去掉宣传话术,告诉我真正更新了什么

写稿时,这个项目已经获得九千多个 GitHub Star,采用 MIT 许可证。

它不再只依赖 Transcript

Claude Video 的基本思路并不复杂:

  1. 用 yt-dlp 获取视频和平台字幕;
  2. 用 ffmpeg 提取关键帧或场景变化画面;
  3. 字幕不存在时,把音频交给 Whisper 转写;
  4. 把每张图片的本地路径和时间戳,以及带时间轴的 Transcript,一起交给 Claude;
  5. Claude 并行读取图片,再回答用户的问题。

因此,它看到的不只是讲解者说了什么,还能看到画面上出现了什么。

分析广告时,可以同时观察开头镜头、字幕设计、产品展示和口播;分析课程时,可以读到幻灯片和代码;排查 Bug 时,可以找到界面异常出现的具体时刻。

这比单纯总结字幕更接近“看过视频以后再回答”。

但它并不是把整段视频逐帧塞给 Claude

“让 Claude 真正看视频”是一个方便理解的说法,但从实现上看,Claude Video 仍然是把视频转换成“抽样画面+文字时间轴”。

它不会默认把每一帧都交给模型。因为视频有成千上万帧,全部读取不仅慢,还会迅速耗尽上下文和图片 Token。

项目提供四种详细程度:

  • transcript:只读字幕,不下载视频画面,成本最低;
  • efficient:快速读取关键帧,最多约 50 张;
  • balanced:默认模式,优先提取场景变化,最多约 100 张;
  • token-burner:保留全部场景变化候选帧,覆盖更完整,但 Token 消耗也更大。

它还会把图片缩放到默认 512 像素宽,并删除视觉上几乎相同的画面。长时间停留在同一张幻灯片时,不会重复把十几张近似图片交给 Claude 计费。

这套设计的重点不是“看得越多越好”,而是用有限的图片预算覆盖尽量多的关键时刻。

长视频最好先粗看,再聚焦

短视频比较适合一次分析。30 秒以内默认约提取 30 张图,三分钟以内约 60 张,三到十分钟约 80 张。

超过十分钟以后,默认的 100 张画面会分散在整条视频上,只能算稀疏扫描。对于四五十分钟的课程或访谈,Claude 可能知道整体结构,却看不清某一分钟里的连续操作。

更合适的方法是先跑一次低成本分析,找到值得关注的时间段,再指定范围重新读取:

/watch video.mp4 --start 2:15 --end 2:45

如果讲解者说“看这里”或者“注意这个变化”,还可以根据 Transcript 中的时间点,用 --timestamps 精确抓图。

所以它并不能保证替代完整观看。分析关键镜头、课程结构和 Bug 复现很有用;涉及高速动作、细微连续变化或逐帧判断时,仍然需要人工回看原视频。

支持数百个平台,实际依赖 yt-dlp

Claude Video 能处理 YouTube、TikTok、X、Instagram、Loom 等平台,是因为底层使用了 yt-dlp。

理论上,yt-dlp 支持的几百个平台都可以尝试;但这不等于每个链接都能随时下载。平台登录、地区限制、Cookie、验证码和反爬策略,都可能导致失败。TikTok、X 等平台的可用性也会随着网站变化而变化。

本地视频不受平台限制,但通常没有现成字幕,需要额外转写音频。

字幕优先免费,没有字幕才调用 Whisper

Claude Video 会先尝试获取平台的人工字幕或自动字幕。这一步不需要额外的语音识别费用。

如果视频没有字幕,它会提取单声道音频,并调用以下一种服务:

  • Groq 的 whisper-large-v3;
  • OpenAI 的 whisper-1。

这时需要用户自己的 API Key,也会产生相应费用。如果不希望上传音频,可以使用 --no-whisper,只分析画面。

因此,“免费使用”指的是 Skill 本身采用 MIT 许可证,yt-dlp 和 ffmpeg 也可以免费使用。实际分析仍会消耗 Claude 的图片和文本 Token;没有字幕时,Whisper API 还可能产生额外费用。

它适合哪些场景

拆解爆款视频。分析开头钩子、镜头节奏、字幕设计、产品露出和口播结构,而不是只总结说了什么。

研究广告创意。找出品牌在什么时候展示产品、怎样做前后对比、如何用画面配合文案。

定位界面 Bug。把用户的屏幕录像交给 Claude,让它寻找异常开始的时间和操作路径。

整理课程教程。把视频变成带时间点的笔记,结合幻灯片、终端和代码画面补充字幕里没有的信息。

快速过滤发布会。跳过铺垫和营销话术,提取真正新增的功能以及对应演示画面。

如何安装

Claude Code 可以通过插件市场安装:

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

Codex、Cursor、Copilot、Gemini CLI 等兼容 Agent Skills 的工具,可以执行:

npx skills add bradautomates/claude-video -g

第一次运行时,Skill 会检查 yt-dlp 和 ffmpeg。macOS 可以通过 Homebrew 自动安装;Linux 和 Windows 会给出相应命令。如果需要 Whisper,它还会在本地配置目录生成 API Key 模板,密钥文件权限设为 0600。

本地视频也要注意隐私

视频下载、抽帧和音频提取主要在本机完成,但“本机处理”不等于“内容完全不离开电脑”。

Claude 读取关键帧时,图片会进入所使用模型的上下文;调用 Groq 或 OpenAI Whisper 时,音频也会发送给相应服务商。

如果是客户录屏、内部会议、未发布广告或包含账号信息的 Bug 视频,应先确认组织的数据政策。必要时只在本地抽帧,手动检查和脱敏后再交给模型,或者完全关闭 Whisper。

真正补齐的是“画面上下文”

Claude Video 没有让 Claude 获得人类一样的连续视频感知。它做的是一件更工程化、也更实用的事:

把难以直接输入模型的视频,转换成有时间关系的关键画面和字幕,再让多模态模型联合理解。

这已经足以解决很多原本只能依靠 Transcript 的局限。

以后研究竞品视频、拆解广告创意、整理课程或者分析屏幕录像,不一定要从头看到尾。可以先让 Claude Video 做一次粗看,再把真正重要的片段交给人重点检查。

AI 不一定需要像人一样连续盯着视频,才能帮我们节省大量观看时间。关键是让它看到字幕之外,画面里真正发生了什么。

标签:

SKILL视频
作者

ddxw

关注我
其他文章
上一个

Matt Pocock 的 22 个 Skills:不是 Vibe Coding,而是把软件工程流程交给 Agent

下一个

手绘故事视频 Skill 开源:用 Codex 做一条线稿渐渐上色的短片

暂无评论!成为第一个。

发表回复 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Copyright 2026 — 东倒西歪玩AI. All rights reserved. Blogsy WordPress Theme