你把一段教程或故障录像发给 Claude,它原本只能猜标题,或读一份漏掉画面信息的字幕。开源项目 Claude Video 把这件事压缩成一条 /watch 命令:给出视频链接或本地文件,再附上问题,Claude 就能结合画面和对白回答。
它并不是让语言模型直接“播放”视频,而是替 Agent——能调用工具、分步骤办事的 AI 程序——接好一条流水线。项目先用 yt-dlp 查找字幕并按需下载,再用 FFmpeg 抽帧,也就是从视频里取出代表性画面;字幕缺失时,才调用 Whisper 把语音转成带时间戳的文字。最后,它把画面和转写结果注入 Claude 当前可读的上下文。作者称,Claude 会并行读取各帧,因此可以回答“30 秒处发生了什么”,也能检查录屏里的故障、分析视频开场或整理长视频。
值得注意的不是又多了一个视频总结器,而是视频理解被封装成可复用的 Agent 工具:Claude Code 之外,项目也面向 Codex、Cursor、Copilot、Gemini CLI 等技能宿主。实际效果目前主要来自项目作者自述,仓库材料没有提供独立评测。