claude-video 是什么?

Claude Video 的 `/watch` 技能把视频 URL 或本地文件转换为时间戳字幕和抽样 JPEG 帧,再交给支持图像读取的代理回答问题。它优先用 yt-dlp 获取字幕,必要时才调用 Groq 或 OpenAI Whisper;当前技能版本为 0.2.0。

⭐ 7,672 Stars 🍴 861 Forks Python MIT 作者: bradautomates
来源:github.com/bradautomates/claude-video;https://github.com/bradautomate… 查看 GitHub 仓库 → 📘 使用教程 →

为什么值得关注

这只是小样本,不能外推稳定趋势。保留依据是 v0.2.0 在 2026-07-01 发布,并加入四档细节、去重、Whisper 分块和跨 Agent Skills 宿主安装。

来源:github.com/bradautomates/claude-video/releases/tag/v0.2.0;https://git…

核心功能

字幕优先、Whisper 回退

先从视频来源取人工或自动字幕;没有字幕时把音频交给 Groq whisper-large-v3 或 OpenAI whisper-1。

来源:github.com/bradautomates/claude-video/blob/main/README.md
四档帧预算

transcript 不取常规帧,efficient 最多 50 帧,balanced 默认最多 100 帧,token-burner 保留全部场景候选。

来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…
时间窗口与定点帧

可用 start/end 聚焦片段,并用 timestamps 抽取明确时刻,减少长视频的稀疏扫描。

来源:github.com/bradautomates/claude-video/blob/main/README.md
近重复帧过滤

默认把帧缩成 16×16 灰度图,以相邻差异过滤静止画面,节省图像 token。

来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…

技术架构

自包含的 skills/watch 目录保存 SKILL.md 和 Python 脚本。watch.py 调度 yt-dlp 下载或取字幕,ffmpeg 抽帧与音频,frames.py 处理场景采样和去重,Whisper 客户端做无字幕回退。脚本输出带时间标记的帧路径和转录,宿主代理再读取图像并组织回答。

来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…

项目知识图谱

知识图谱:项目核心节点(中心)+ 核心功能(内环六边形)+ 关键技术依赖(外环 chip) Python 3 ffmpeg yt-dlp 可选 GROQ_API_KEY 或 OPENAI_API_KEY可选 GROQ_API_… 支持 Agent Skills 的宿主支持 Agent Ski… 字幕优先、Whisper 回退 四档帧预算 时间窗口与定点帧 近重复帧过滤 claude-video 项目本体 核心功能 关键依赖

技术栈

语言Python 脚本 + Agent Skill Markdown框架yt-dlp 下载/字幕、ffmpeg 抽帧/音频、宿主代理图像读取
Python 3ffmpegyt-dlp可选 GROQ_API_KEY 或 OPENAI_API_KEY支持 Agent Skills 的宿主
macOS 首次运行可通过 Homebrew 安装依赖;Linux/Windows 按脚本打印的命令安装;claude.ai 需要启用代码执行与文件创建
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…

快速上手

Claude Code 可从官方插件市场安装 watch;Codex、Cursor 等可运行 `npx skills add bradautomates/claude-video -g`。先用自己拥有的一段 20–30 秒测试视频运行 `/watch <path> 总结画面和对白`,保持默认 balanced,核对帧时间戳和字幕。长视频先加 start/end,不要一上来使用无上限的 token-burner。
来源:github.com/bradautomates/claude-video/blob/main/README.md

使用场景

适合分析短演示、定位屏幕录制中的操作、从公开视频字幕与关键帧做摘要,或针对某个时间点提问。涉及受版权保护、私密或含人脸和账号信息的视频时,要先确认下载、转录、第三方 API 上传和保存临时文件的权限。

来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…

优势与局限

优势

  • 字幕与画面一起进入分析,不只依赖标题或转录
  • 可按片段、时间点和最大帧数控制成本
  • 近重复帧过滤减少静态画面浪费
  • v0.2.0 把 skill 与脚本打包为可跨宿主安装的单元

局限

  • 默认 balanced 在超过约 10 分钟的视频上会稀疏扫描
  • 无字幕时使用 Whisper 会把音频发送给所选 API 提供方
  • 下载视频受来源条款、登录状态、DRM 与版权限制
  • 帧抽样可能漏掉快速动作或帧间文字
  • 本轮没有下载、解码、转录或读取任何视频
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…

最新版本

最新正式版为 v0.2.0,CHANGELOG 日期为 2026-06-29,GitHub Release 发布于 2026-07-01。主要新增四档 detail、默认帧去重、Whisper 超过 25 MB 时自动分块、定点 timestamps、no-whisper,并重组为自包含 skill 以支持更多 Agent Skills 宿主。

来源:github.com/bradautomates/claude-video/releases/tag/v0.2.0;https://git…

实测与证据

status: official_docs_checked_not_run  |  checked_at: 2026-09-23  |  environment: 核对官方 README、skills/watch/SKILL.md、CHANGELOG 与 v0.2.0 Release  |  limitations: 未安装 skill、ffmpeg 或 yt-dlp;未下载视频、抽帧、调用 Groq/OpenAI Whisper、读取图像或复核 token/时间成本  |  observed_output: SKILL frontmatter 标注 0.2.0;README 列出 ffmpeg、yt-dlp、四档 detail 与首次安装流程;CHANGELOG 日期为 2026-06-29,GitHub Release 发布于 2026-07-01

来源:github.com/bradautomates/claude-video/blob/main/skills/watch/SKILL.md…

同类项目对比

Google Gemini API 官方支持直接提交视频,静态模式按 1 FPS 和音频处理,也提供长视频的 agentic 模式;上传、解析和推理由托管 API 完成。Claude Video 在本地用 yt-dlp 与 ffmpeg 预处理,再把选出的帧和字幕交给宿主代理,可直接控制时间窗与帧预算,但要自己维护依赖和处理下载权限。想用托管原生视频输入可评估 Gemini API;想给现有编码代理增加可检查的本地预处理流程可评估 Claude Video。

来源:ai.google.dev/gemini-api/docs/video-understanding;https://github.com/…

总结评价

Claude Video 的价值在于把字幕、帧选择和时间戳做成可见的预处理链。首次使用选自有短视频,核对实际帧与字幕后再处理长视频;对私密内容,应先弄清宿主代理和 Whisper 提供方会接收哪些数据。

来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…

常见问题

Claude Video v0.2.0 一定需要 Whisper API key 吗?

不一定。它先尝试用 yt-dlp 获取来源字幕;只有没有可用字幕且需要转录时,才需要 Groq 或 OpenAI 的 key。

分析十分钟以上视频应该选哪个 detail?

默认 balanced 会把最多 100 帧铺到全片,官方会提示稀疏扫描。已知关注片段时先用 start/end;只有接受更高图像 token 成本时才用 token-burner。

为什么静止画面会被 Claude Video 删除?

默认去重会比较缩小后的相邻帧,删除变化很小的画面,把有限帧预算留给不同场景。需要逐帧保留时可关闭去重。

Claude Video 会把本地视频上传到哪里?

帧由本地 ffmpeg 生成并交给宿主代理读取;若没有字幕并启用 Whisper 回退,提取的音频会发送给配置的 Groq 或 OpenAI 服务。具体数据处理还取决于宿主代理。

资料与核验范围
本文依据项目公开资料整理。版本、安装命令和功能边界可能随上游更新,请以所列来源和项目当前版本为准。 资料核对时间: 2026-09-23 13:55.

参考材料:README、GitHub API、依赖文件