Claude Video 的 `/watch` 技能把视频 URL 或本地文件转换为时间戳字幕和抽样 JPEG 帧,再交给支持图像读取的代理回答问题。它优先用 yt-dlp 获取字幕,必要时才调用 Groq 或 OpenAI Whisper;当前技能版本为 0.2.0。
来源:github.com/bradautomates/claude-video;https://github.com/bradautomate… 查看 GitHub 仓库 → 📘 使用教程 →这只是小样本,不能外推稳定趋势。保留依据是 v0.2.0 在 2026-07-01 发布,并加入四档细节、去重、Whisper 分块和跨 Agent Skills 宿主安装。
来源:github.com/bradautomates/claude-video/releases/tag/v0.2.0;https://git…先从视频来源取人工或自动字幕;没有字幕时把音频交给 Groq whisper-large-v3 或 OpenAI whisper-1。
来源:github.com/bradautomates/claude-video/blob/main/README.mdtranscript 不取常规帧,efficient 最多 50 帧,balanced 默认最多 100 帧,token-burner 保留全部场景候选。
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…可用 start/end 聚焦片段,并用 timestamps 抽取明确时刻,减少长视频的稀疏扫描。
来源:github.com/bradautomates/claude-video/blob/main/README.md默认把帧缩成 16×16 灰度图,以相邻差异过滤静止画面,节省图像 token。
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…自包含的 skills/watch 目录保存 SKILL.md 和 Python 脚本。watch.py 调度 yt-dlp 下载或取字幕,ffmpeg 抽帧与音频,frames.py 处理场景采样和去重,Whisper 客户端做无字幕回退。脚本输出带时间标记的帧路径和转录,宿主代理再读取图像并组织回答。
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…Python 3ffmpegyt-dlp可选 GROQ_API_KEY 或 OPENAI_API_KEY支持 Agent Skills 的宿主适合分析短演示、定位屏幕录制中的操作、从公开视频字幕与关键帧做摘要,或针对某个时间点提问。涉及受版权保护、私密或含人脸和账号信息的视频时,要先确认下载、转录、第三方 API 上传和保存临时文件的权限。
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…最新正式版为 v0.2.0,CHANGELOG 日期为 2026-06-29,GitHub Release 发布于 2026-07-01。主要新增四档 detail、默认帧去重、Whisper 超过 25 MB 时自动分块、定点 timestamps、no-whisper,并重组为自包含 skill 以支持更多 Agent Skills 宿主。
来源:github.com/bradautomates/claude-video/releases/tag/v0.2.0;https://git…status: official_docs_checked_not_run | checked_at: 2026-09-23 | environment: 核对官方 README、skills/watch/SKILL.md、CHANGELOG 与 v0.2.0 Release | limitations: 未安装 skill、ffmpeg 或 yt-dlp;未下载视频、抽帧、调用 Groq/OpenAI Whisper、读取图像或复核 token/时间成本 | observed_output: SKILL frontmatter 标注 0.2.0;README 列出 ffmpeg、yt-dlp、四档 detail 与首次安装流程;CHANGELOG 日期为 2026-06-29,GitHub Release 发布于 2026-07-01
来源:github.com/bradautomates/claude-video/blob/main/skills/watch/SKILL.md…Google Gemini API 官方支持直接提交视频,静态模式按 1 FPS 和音频处理,也提供长视频的 agentic 模式;上传、解析和推理由托管 API 完成。Claude Video 在本地用 yt-dlp 与 ffmpeg 预处理,再把选出的帧和字幕交给宿主代理,可直接控制时间窗与帧预算,但要自己维护依赖和处理下载权限。想用托管原生视频输入可评估 Gemini API;想给现有编码代理增加可检查的本地预处理流程可评估 Claude Video。
来源:ai.google.dev/gemini-api/docs/video-understanding;https://github.com/…Claude Video 的价值在于把字幕、帧选择和时间戳做成可见的预处理链。首次使用选自有短视频,核对实际帧与字幕后再处理长视频;对私密内容,应先弄清宿主代理和 Whisper 提供方会接收哪些数据。
来源:github.com/bradautomates/claude-video/blob/main/README.md;https://git…不一定。它先尝试用 yt-dlp 获取来源字幕;只有没有可用字幕且需要转录时,才需要 Groq 或 OpenAI 的 key。
默认 balanced 会把最多 100 帧铺到全片,官方会提示稀疏扫描。已知关注片段时先用 start/end;只有接受更高图像 token 成本时才用 token-burner。
默认去重会比较缩小后的相邻帧,删除变化很小的画面,把有限帧预算留给不同场景。需要逐帧保留时可关闭去重。
帧由本地 ffmpeg 生成并交给宿主代理读取;若没有字幕并启用 Whisper 回退,提取的音频会发送给配置的 Groq 或 OpenAI 服务。具体数据处理还取决于宿主代理。