Claude Video – 让 Claude AI 自动观看视频并进行智能分析丨支持字幕提取、关键帧识别和 AI 总结

在过去一段时间里,Claude 在文本理解、代码分析、资料总结方面表现非常突出,但视频一直是它能力体系中的一个缺口。用户可以让 Claude 阅读网页、分析代码仓库、执行脚本,却无法直接理解一个视频文件里的画面变化、字幕信息以及具体发生的场景。

Anthropic 官方 Claude 本身具备强大的多模态能力,但对于视频输入,很多场景仍然需要额外处理。

软件格律诗 介绍一个 来自 GitHub 开源社区的 claude-video 通过 /watch 技能,将视频下载、关键帧提取、语音转文字以及图像理解流程串联起来,让 Claude 能够像人一样“观看”视频,然后基于真实画面和声音进行分析。

Claude Video 是什么?

Claude Video 是一个开源项目,目标非常明确:Give Claude the ability to watch any video(让 Claude 具备观看任何视频的能力)

作为一个连接视频内容与 Claude AI 的工作流插件,通过 /watch 命令接收视频链接、本地视频文件以及用户问题,然后自动完成:

  • 使用 yt-dlp 下载在线视频资源;
  • 使用 ffmpeg 提取视频关键帧;
  • 获取视频字幕或调用 Whisper 进行语音转录;
  • 将视频画面帧和带时间戳的文本交给 Claude;
  • Claude 根据真实看到的画面和听到的声音进行回答。

相比单纯读取标题或者字幕摘要,Claude Video 让模型真正获得了视频视觉上下文。

Claude Video 的核心功能特点

支持多来源视频输入

Claude Video 支持 URL 视频以及本地视频文件。

在线资源方面,只要 yt-dlp 支持的视频来源,理论上都可以处理,包括:

  • YouTube;
  • Loom;
  • TikTok;
  • X;
  • Instagram;
  • Vimeo 等平台。

同时也支持本地视频:

  • .mp4
  • .mov
  • .mkv
  • .webm

用户可以直接输入:

/watch https://youtu.be/example 总结这个视频内容

也可以分析本地录屏:

/watch ~/Movies/demo.mp4 找出程序出现问题的位置

自动提取视频关键帧

视频理解最大的成本来自图像处理,如果每秒发送大量截图,不仅效率低,也会快速消耗 Claude 上下文容量。

Claude Video 采用自动化帧采样策略,根据视频长度调整提取数量:

视频长度默认帧数量
≤30秒约30帧
30秒-1分钟约40帧
1-3分钟约60帧
3-10分钟约80帧
超过10分钟最多100帧

同时限制最高 2 fps,避免长视频产生过高 Token 消耗。

如果用户只关注某个片段,还可以指定时间范围:

/watch video.mp4 --start 50 --end 60

这样 Claude 可以更加集中地分析目标区域。

自动生成带时间戳的视频文字内容

Claude Video 会优先尝试获取视频原生字幕,包括人工字幕和自动生成字幕。

如果视频没有字幕,则会调用 Whisper 进行语音识别,目前支持:

  • Groq whisper-large-v3
  • OpenAI whisper-1

其中 Groq Whisper 是项目推荐方案,具有成本较低、速度较快的特点。

对于公开视频,大部分情况下无需额外配置 API,只需要本地安装基础依赖即可运行。

视觉 + 语音联合理解

Claude Video 最大的价值在于,它不会只依赖视频标题或者文字稿。

例如分析一个教程视频时:

传统方式:

“根据字幕总结内容。”

Claude Video:

“查看视频画面,知道作者展示了什么界面,同时结合语音说明理解完整流程。”

这对于以下场景尤其有价值:

  • 软件教程分析;
  • 产品发布会研究;
  • 视频课程整理;
  • 竞品内容分析;
  • UI 问题定位;
  • 视频创作者内容拆解。

Claude Video 使用教程

方法一:安装 Claude Code 插件

首先安装插件:

/plugin marketplace add bradautomates/claude-video

/plugin install watch@claude-video

安装完成后,可以直接使用:

/watch 视频地址 你的问题

例如:

/watch https://youtu.be/demo 分析这个视频前三分钟讲了什么

方法二:在 claude.ai 中使用

如果使用网页版 Claude:

  1. 下载项目中的 watch.skill
  2. 打开 Claude 设置页面;
  3. 进入 Settings → Capabilities → Skills;
  4. 上传 skill 文件。

同时需要开启:

  • Code execution;
  • File creation。

因为 Claude Video 需要调用 ffmpegyt-dlp 完成视频处理。

方法三:用于 Codex 或其他兼容环境

执行:

git clone https://github.com/bradautomates/claude-video.git ~/.codex/skills/watch

即可加载技能。

实际使用体验

我认为 Claude Video 解决了 AI 使用中的一个实际痛点:很多时候我们并不缺总结能力,而是不想花几十分钟观看大量视频内容。

例如看到一个热门 YouTube 教程,以往需要完整观看,再自己整理重点。使用 Claude Video 后,可以直接丢给 Claude:

“这个视频核心观点是什么?”

“作者展示的软件流程有哪些?”

“前三分钟为什么吸引用户?”

Claude 会结合画面和字幕进行回答。

对于科技内容创作者来说,这个工具尤其适合做选题研究。我平时关注大量 AI 工具、开发项目和产品发布视频,不可能全部观看,通过 Claude Video 可以快速筛选值得深入研究的内容。

不过它也有一定限制。超过 10 分钟的视频虽然可以处理,但项目本身建议针对重点区域分析,因为长视频会受到 Token 消耗和帧数量限制影响。如果只是普通播客或者访谈类视频,字幕分析已经足够;如果涉及 UI 操作、产品演示、视觉变化,那么开启完整视频分析效果更明显。

总结

Claude Video 是一个非常符合 AI Agent 时代需求的小工具,它通过工程方式补齐 Claude 在视频理解流程上的短板。

对于普通用户,它可以快速总结长视频;对于开发者,它可以分析演示录像和 Bug 复现过程;对于内容创作者,它可以帮助研究热门视频结构。

随着 AI 从“阅读文字”逐渐走向“理解现实世界”,类似 Claude Video 这样的工具会越来越重要。它让 AI 不再只是回答文本问题,而是真正开始理解我们每天接触的大量视频信息。

官方网站

https://github.com/bradautomates/claude-video

相关推荐

JameCling

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。