
在过去一段时间里,Claude 在文本理解、代码分析、资料总结方面表现非常突出,但视频一直是它能力体系中的一个缺口。用户可以让 Claude 阅读网页、分析代码仓库、执行脚本,却无法直接理解一个视频文件里的画面变化、字幕信息以及具体发生的场景。
Anthropic 官方 Claude 本身具备强大的多模态能力,但对于视频输入,很多场景仍然需要额外处理。
软件格律诗 介绍一个 来自 GitHub 开源社区的 claude-video 通过 /watch 技能,将视频下载、关键帧提取、语音转文字以及图像理解流程串联起来,让 Claude 能够像人一样“观看”视频,然后基于真实画面和声音进行分析。

Claude Video 是什么?
Claude Video 是一个开源项目,目标非常明确:Give Claude the ability to watch any video(让 Claude 具备观看任何视频的能力)。
作为一个连接视频内容与 Claude AI 的工作流插件,通过 /watch 命令接收视频链接、本地视频文件以及用户问题,然后自动完成:
- 使用
yt-dlp下载在线视频资源; - 使用
ffmpeg提取视频关键帧; - 获取视频字幕或调用 Whisper 进行语音转录;
- 将视频画面帧和带时间戳的文本交给 Claude;
- Claude 根据真实看到的画面和听到的声音进行回答。
相比单纯读取标题或者字幕摘要,Claude Video 让模型真正获得了视频视觉上下文。
Claude Video 的核心功能特点
支持多来源视频输入
Claude Video 支持 URL 视频以及本地视频文件。
在线资源方面,只要 yt-dlp 支持的视频来源,理论上都可以处理,包括:
- YouTube;
- Loom;
- TikTok;
- X;
- Instagram;
- Vimeo 等平台。
同时也支持本地视频:
.mp4.mov.mkv.webm
用户可以直接输入:
/watch https://youtu.be/example 总结这个视频内容
也可以分析本地录屏:
/watch ~/Movies/demo.mp4 找出程序出现问题的位置
自动提取视频关键帧
视频理解最大的成本来自图像处理,如果每秒发送大量截图,不仅效率低,也会快速消耗 Claude 上下文容量。
Claude Video 采用自动化帧采样策略,根据视频长度调整提取数量:
| 视频长度 | 默认帧数量 |
|---|---|
| ≤30秒 | 约30帧 |
| 30秒-1分钟 | 约40帧 |
| 1-3分钟 | 约60帧 |
| 3-10分钟 | 约80帧 |
| 超过10分钟 | 最多100帧 |
同时限制最高 2 fps,避免长视频产生过高 Token 消耗。
如果用户只关注某个片段,还可以指定时间范围:
/watch video.mp4 --start 50 --end 60
这样 Claude 可以更加集中地分析目标区域。
自动生成带时间戳的视频文字内容
Claude Video 会优先尝试获取视频原生字幕,包括人工字幕和自动生成字幕。
如果视频没有字幕,则会调用 Whisper 进行语音识别,目前支持:
- Groq
whisper-large-v3 - OpenAI
whisper-1
其中 Groq Whisper 是项目推荐方案,具有成本较低、速度较快的特点。
对于公开视频,大部分情况下无需额外配置 API,只需要本地安装基础依赖即可运行。
视觉 + 语音联合理解
Claude Video 最大的价值在于,它不会只依赖视频标题或者文字稿。
例如分析一个教程视频时:
传统方式:
“根据字幕总结内容。”
Claude Video:
“查看视频画面,知道作者展示了什么界面,同时结合语音说明理解完整流程。”
这对于以下场景尤其有价值:
- 软件教程分析;
- 产品发布会研究;
- 视频课程整理;
- 竞品内容分析;
- UI 问题定位;
- 视频创作者内容拆解。
Claude Video 使用教程
方法一:安装 Claude Code 插件
首先安装插件:
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
安装完成后,可以直接使用:
/watch 视频地址 你的问题
例如:
/watch https://youtu.be/demo 分析这个视频前三分钟讲了什么
方法二:在 claude.ai 中使用
如果使用网页版 Claude:
- 下载项目中的
watch.skill - 打开 Claude 设置页面;
- 进入 Settings → Capabilities → Skills;
- 上传 skill 文件。
同时需要开启:
- Code execution;
- File creation。
因为 Claude Video 需要调用 ffmpeg 和 yt-dlp 完成视频处理。
方法三:用于 Codex 或其他兼容环境
执行:
git clone https://github.com/bradautomates/claude-video.git ~/.codex/skills/watch
即可加载技能。
实际使用体验
我认为 Claude Video 解决了 AI 使用中的一个实际痛点:很多时候我们并不缺总结能力,而是不想花几十分钟观看大量视频内容。
例如看到一个热门 YouTube 教程,以往需要完整观看,再自己整理重点。使用 Claude Video 后,可以直接丢给 Claude:
“这个视频核心观点是什么?”
“作者展示的软件流程有哪些?”
“前三分钟为什么吸引用户?”
Claude 会结合画面和字幕进行回答。
对于科技内容创作者来说,这个工具尤其适合做选题研究。我平时关注大量 AI 工具、开发项目和产品发布视频,不可能全部观看,通过 Claude Video 可以快速筛选值得深入研究的内容。
不过它也有一定限制。超过 10 分钟的视频虽然可以处理,但项目本身建议针对重点区域分析,因为长视频会受到 Token 消耗和帧数量限制影响。如果只是普通播客或者访谈类视频,字幕分析已经足够;如果涉及 UI 操作、产品演示、视觉变化,那么开启完整视频分析效果更明显。
总结
Claude Video 是一个非常符合 AI Agent 时代需求的小工具,它通过工程方式补齐 Claude 在视频理解流程上的短板。
对于普通用户,它可以快速总结长视频;对于开发者,它可以分析演示录像和 Bug 复现过程;对于内容创作者,它可以帮助研究热门视频结构。
随着 AI 从“阅读文字”逐渐走向“理解现实世界”,类似 Claude Video 这样的工具会越来越重要。它让 AI 不再只是回答文本问题,而是真正开始理解我们每天接触的大量视频信息。
官方网站
https://github.com/bradautomates/claude-video







