AI 看懂一段视频,三条完全不同的路:claude-video 为什么绕开原生多模态

阅读时长:13分钟

Claude Code 用户装 claude-video,其实是被逼的

先说一个 Claude Code 老用户经常遇到的场景。

你录了一段 5 分钟的屏幕录像,想让 Claude 帮你定位一个 UI 卡顿到底发生在第几秒、点了什么按钮之后。你把 .mp4 塞进去,Claude 一脸茫然:我只能读文件的字节流。

Claude 官方的 claude.ai 网页版能上传图片,但视频这条路,长期以来是 Claude 生态的一个巨大盲区。而同期 Gemini 2.5 / 3 已经把视频作为一等公民,1 FPS 拆帧、原生看画面、听声音,一次调用搞定。

claude-video 就是被这个盲区催生出来的补丁工具,也是 HelloGitHub 8 月 4 日的今日推荐。作者是 bradautomates,用 Claude Skill 的标准形态发布:一个 SKILL.md + 一条 yt-dlp + FFmpeg + Whisper 的组合拳,绕开 Claude 不能原生吃视频这件事。

但真正有意思的是,绕的方法不止一种。今天要拆的,就是 AI 处理视频的 三条完全不同的路径——它们的架构、成本、精度差得离谱,选错了,钱包和结果都要挨打。

三条路径的底层世界观

  • 原生多模态派:Gemini、Qwen-VL、GPT-4o。视频进来,模型自己拆帧、听音、融合,一次推理输出结论。押注的是 感官融合——模型自己看,才是真理。
  • 分层观察派claude-videowatch-video-skill、以及一堆 Claude Code 里的 Skill。视频先被 yt-dlp 拉下来,FFmpeg 拆关键帧和字幕,字幕缺了就 Whisper 转录,最后把结构化文本 + 关键帧图片塞给 Claude。押注的是 分层观察——模型不用全看,看关键的。
  • 动作捕捉派:Anthropic 自家的 Record a Skill,视频里那个"人"在做什么才是重点。录屏 + 讲解,模型学的是操作流,不是像素。

同一个视频,三条路径回答的问题都不一样。搞清楚这个,才知道自己该走哪条。

路径一:Gemini 原生视频,简单粗暴,明码标价

Gemini 是目前把视频原生化做得最狠的。你甩一段视频进去,它按 1 FPS 采样,每帧算成一堆 token 一起吃。

看一下明面上的价格,一切按 token 走。对 Gemini 3 Pro 系列:

  • 默认分辨率:每帧 258 token
  • 高分辨率 MEDIA_RESOLUTION_HIGH:每帧 280 token
  • 低分辨率 MEDIA_RESOLUTION_LOW:每帧 66 ~ 70 token

一段 10 分钟的 720p 视频,1 FPS 采样就是 600 帧。默认分辨率算下来大约 600 × 258 ≈ 15.5 万 token,光是视频输入这一块就烧掉 15 万上下文。Gemini 3 Pro 的 API 价目里,视频输入按 $0.00079/帧 计,10 分钟视频光输入约 $0.47。Flash Lite 那档便宜一半,$0.000395/帧

表面看很贵,但你要买的是"模型自己看画面 + 听声音 + 融合语义"这个能力。声音里那个"啊,我按错了",Gemini 能听懂并挂在时间轴上——这是 claude-video 派需要多步骤才能凑出来的。

Gemini 派的优势

  • 一次调用,端到端。工程复杂度 = 零。
  • 声画同频。模型能对齐音轨里的"这里"和画面里的按钮位置。
  • 长视频扛得住。1M 上下文塞得下 2 小时 720p。

Gemini 派的痛点

  • 视频得先上传到 Google,隐私敏感的场景直接劝退。
  • 定价按帧走,长视频费用增长是线性的,一场 2 小时会议随手就是十几美元。
  • 你没法追问"第 03:42 秒那颗按钮里的文字是什么"这种像素级细节,模型看到的是采样过的关键帧,不是原始录像。默认 1 FPS 意味着 超过 1 秒的动作可能被吞掉半帧

路径二:claude-video 的分层观察,绕开 Claude 的多模态短板

claude-video 的架构可以画成一条流水线:

输入(URL / 本地文件)
   
yt-dlp 下载(YouTube/B站/本地都能吃)
   
FFmpeg 拆关键帧 + 抽字幕
   ↓  (字幕存在?)
   ├─ 是 → 直接用官方字幕
   └─ 否 → Whisper 本地转录
   
关键帧图片(base64) + 时间轴字幕(JSON)
   
喂给 Claude Code

这条流水线的核心哲学,是把"看视频"拆成 三个独立可优化的观察层

  1. 像素层:FFmpeg 只挑关键帧(场景切换、I 帧、人为间隔),一段 10 分钟视频通常拆出 20-60 张图。
  2. 语义层:字幕负责讲清楚"发生了什么"。有官方字幕就白嫖,没有就 Whisper 兜底。
  3. 推理层:Claude 读到的其实是"文本 + 稀疏图像"的组合,它擅长的正是这种结构化推理。

watch-video-skill 是这条路径上一个有意思的分叉。它在 Brad 的引擎上加了 4 层,其中最实用的一层是 改成 slash-only 触发——原版 Brad 的默认是"看到任何视频 URL 或 watch this video 就自动开火",长视频一不小心烧掉几万 token。改成 /watch-video 显式触发,把成本控制权还给用户。

分层观察派的算账方式

假设同一段 10 分钟 720p 视频:

  • yt-dlp 下载:本地成本,几乎为零。
  • FFmpeg 拆 30 张关键帧:本地 CPU,几秒钟。
  • Whisper 转录(没字幕情况):本地 GPU 或 API whisper-1$0.006/分钟,10 分钟 = $0.06
  • Claude 推理:30 张图算图像输入,加上字幕文本约 2000 字,Claude Sonnet 4.5 输入价 $3/M token,一次调用约 $0.10 ~ $0.15

总成本约 $0.20 上下,比 Gemini 直传便宜一半多。而且——所有原始数据没离开你的机器,Whisper 走本地 GPU 甚至连 API 都不用。

分层观察派的优势

  • 成本可控,长视频更省。
  • 隐私守得住,视频不上传第三方。
  • 中间态可复用。同一段视频,拆出来的关键帧和字幕缓存到磁盘,第二次问同一个视频免费。
  • Claude 的推理能力直接吃到,你不必换模型生态。

分层观察派的痛点

  • FFmpeg 拆帧策略决定天花板。关键帧算法看走眼,Claude 也看不见细节。
  • 声画对齐靠字幕的时间戳,Whisper 时间戳精度一般在 200ms 上下——查"第 43.2 秒到底按了什么"这种事,比 Gemini 直看还是差一截。
  • 依赖链长。yt-dlp、FFmpeg、Whisper 任何一个环境炸了,整条流水线断掉。

路径三:Anthropic 自家的 Record a Skill,学的是"人在做什么"

第三条路是 Anthropic 官方在 Claude Cowork 里推的 Record a Skill(Pro/Max/Team 计划才有)。逻辑跟前两条完全不一样:

你不是把视频交给 Claude 分析内容,你是让 Claude 看着你干一次活,然后把这个动作序列压成一个 Skill,下次它自己重放。

比如你录一段 “怎么在 Notion 里写周报模板”,Claude 学到的不是"这一帧像素是什么颜色",而是——

  • 打开 Notion 主页
  • 找到"周报"文件夹
  • 点右上角"新建"
  • 按 H1 输入标题
  • 按 Callout 分块

学完之后,Skill 就固化下来了。下次你说"帮我写周报",它按这个模板复现。

这条路径押注的是:视频最有价值的信息,不是画面本身,而是"某个人在这个视频里的操作意图"。这是 动作捕捉 + 操作抽象 的思路,属于 Skill 生态的原教旨玩法。

适用场景

  • 反复重复的操作流程(比如每周走一次的报表流程)
  • 你自己会做,但懒得写文档
  • 需要 Claude Cowork 桌面端支持

不适用场景

  • 分析别人的视频内容
  • 学一段没有明确"人在操作"的画面(比如监控录像、纪录片)

三条路的选择矩阵:一张表决定你走哪条

场景决定路径,别反过来。

场景 首选 理由
一次性看懂一段公开视频(B 站教程、YouTube 演讲) claude-video 便宜、可缓存、隐私可控
长视频精读,需要声画对齐(法庭录像、访谈复盘) Gemini 3 Pro 原生多模态,时间戳精度到帧
分析涉密录屏(内部会议、公司系统操作) claude-video 本地流水线 视频不出机器
教 AI 走一遍固定 SOP Record a Skill 学的是动作不是内容
视频里的具体像素细节(第 42 秒按钮上的水印) Gemini + MEDIA_RESOLUTION_HIGH 提取式流水线拆帧会漏
大批量视频归档摘要(自动打标签、写简介) claude-video + 缓存复用 单价可预测,可跑批

独立判断:为什么"分层观察派"在 Skill 生态里能长期活下去

写到这里应该有人要问:Gemini 都能一次搞定了,claude-video 这种流水线是不是过渡态?

我的判断是——至少两年内不会死。原因有三条:

第一,隐私边界。 只要企业客户和涉密数据存在,“视频不出机房"就是硬需求。原生多模态方案再便宜,都过不了合规这一关。

第二,中间态资产化。 claude-video 拆出的关键帧和字幕是可存储、可复用、可搜索的中间产物。一场会议的字幕可以再喂给别的 Skill 做纪要,可以做 embedding 检索,可以做知识库。Gemini 那次推理产出的答案,是一次性消费品。

第三,Skill 生态的架构偏好。 Skill 派押的是"AI 自己不用什么都会,但会调工具”。yt-dlp、FFmpeg、Whisper 都是被验证了十年的成熟工具,Skill 只需要负责编排。这种"AI + 老工具"的组合,工程稳定性远高于依赖单一供应商的黑盒多模态。

反过来,Gemini 派押的是"感官融合就是最优路径"。这个赌局赢或输,取决于原生视频推理的成本能不能持续下降。目前看,Google 一直在压价,但架不住视频输入的 token 数是天文数字——一小时 720p 视频等于近百万 token,架构上就不占便宜。

上手 claude-video 的最小闭环

如果你打算今晚就试,最短路径是这样:

# 1. 装 Claude Code(如未装)
npm install -g @anthropic-ai/claude-code

# 2. 装依赖
brew install yt-dlp ffmpeg
pip install openai-whisper   # 或走 API 版

# 3. 装 claude-video 这个 Skill
claude install claude-video    # 或从 GitHub 下 SKILL.md 手动加载

# 4. 试跑
claude "watch this video and summarize:https://www.youtube.com/watch?v=xxxxx"

第一次跑,注意看它到底拆了多少张关键帧、走没走 Whisper。如果你的场景不需要自动触发,直接换成 watch-video-skill 的 slash-only 版本,避免长视频误开火烧 token。

Tip:把 ~/.claude/skills/claude-video/ 里的关键帧提取阈值调紧一点。默认可能给你拆 60 张,很多都是重复画面。生产用途下 scene detection threshold 调到 0.4 通常够用,能砍掉一半 token。

说到底,选路径就是选世界观

三条路径的技术栈可以列一张表,但真正决定你选哪条的,是你相信 AI 的下一站是"感官融合"还是"工具编排"

  • 押感官融合,你会喜欢 Gemini 这种原生多模态。
  • 押工具编排,你会喜欢 claude-video 这种 Skill 流水线。
  • 押动作抽象,你会喜欢 Anthropic 自家的 Record a Skill。

这三种世界观不冲突,也不会互相取代——就像今天摄像头、麦克风、键盘同时存在一样,未来 AI 的"看"也会分工。今天挑一个上手,别为难自己。

相关阅读

© 2026 softon.top

本站已稳定运行 263 天 9 小时 · 122 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-09-21 17:06:46 CST