video-understand
通过 Gemini 模型快速分析视频内容、镜头、人物动作、场景和字幕信息。Use when 用户发送视频文件、本地视频路径或视频链接,并询问“这个视频讲了什么”“帮我分析这个视频”“总结一下镜头内容”“提炼卖点/步骤/剧情”等需要快速视频理解的场景。优先用于一次性内容总结、镜头理解和简短分析;若用户需要异步长流程、分镜级报告、批量处理、截图留档或更重的工作流编排,优先考虑 video-analysis-workflow。
适合你,如果经常需要快速了解视频内容
/ 通过 npx 安装 校验哈希
npx oh-my-skill add qianleigood/crawclaw/video-understand/ 通过 bash 安装
curl -fsSL https://oh-my-skill.com/install.sh | bash -s -- qianleigood/crawclaw/video-understand/ 已经装过?验证本机副本,不用重装
npx oh-my-skill verify qianleigood/crawclaw/video-understand安装目标可用 --agent / --scope 或 --to 明确指定;省略时只会在唯一已存在的 agent 目录上自动选择,零命中或多命中会停止并提示。content_hash 缺失或不一致均拒装。
30GitHub stars
~1.5K最小装载
~3.7K含声明引用
~3.7K文本包总量
索引托管
怎么用
商店整理自技能原文 · 版本 f27e175 · 表述以原文为准它做什么
装上后,Claude 能用 Gemini 模型分析用户提供的视频文件或链接,返回镜头内容、景别机位、运镜方式、人物动作、场景道具、字幕声音、氛围作用等结构化结果。
什么时候触发
当用户发送视频文件、本地路径或链接,并要求“分析这个视频”“总结镜头内容”“提炼卖点/步骤/剧情”时触发。
装好后可以这样说
触发详细镜头分析
提取视频中的关键步骤
获取视频内容概要
技能原文 SKILL.md
视频理解技能
使用 Gemini 模型理解视频内容。
工作流程
用户发送视频文件或视频 URL → 如果是本地文件:先检查上传缓存,再上传到文件 API → 如果本来就是 URL:直接复用 URL → 调用视频理解 API → 返回分析结果
当前主入口
- 主脚本:
video_analyzer.py - 推荐入口:
run.sh(自动使用技能目录下的.venv)
推荐通过 run.sh 调用:
# 基础用法 ./run.sh <视频文件路径或URL> # 自定义问题 ./run.sh ./video.mp4 -q "这个视频的教学步骤是什么?"
配置文件
主配置文件:config.json
{
"api_key": "${VIDEO_UNDERSTAND_API_KEY}",
"api_url": "https://api.whatai.cc/v1/chat/completions",
"model": "gemini-3-flash-preview-nothinking",
"default_question": "请分析这个视频镜头,并按以下结构输出:\n\n1. 镜头内容:这一镜头拍到了什么\n2. 景别与机位:远景/中景/近景,平视/俯拍/仰拍等\n3. 运镜方式:固定、推、拉、摇、移、跟拍等;如无法判断请说明\n4. 人物与动作:人物状态、动作、互动\n5. 场景与道具:环境、物件、视觉元素\n6. 字幕与声音:字幕文案、旁白、音乐、环境声\n7. 氛围与作用:这个镜头传达的情绪,以及在整体内容中的作用\n\n要求:\n- 用中文输出\n- 不要编造细节\n- 看不清就明确说明\n- 保持简洁、客观、可用于后续汇总成分镜脚本",
"stream": false
}
配置说明
api_key:API 密钥,建议通过环境变量VIDEO_UNDERSTAND_API_KEY注入api_url:API 端点 URLmodel:模型名称,默认gemini-3-flash-preview-nothinkingdefault_question:默认提问stream:是否按配置透传到视频理解 API
目录边界
- 主链路源码:
SKILL.md、config.json、run.sh、video_analyzer.py - 本地私有配置:
.env - 本地运行环境:
.venv/ - 运行缓存:
runtime/upload_cache.json
可用模型
gemini-3-flash-preview-nothinking(当前默认,速度快)- 其他兼容视觉/视频理解的 Gemini 模型(按你的 API 服务支持情况调整)
触发场景
- 用户发送视频链接并问“视频讲了什么”
- 用户说“分析这个视频”
- 用户发送视频 URL 并询问内容
- 用户自定义问题(如“这个视频里的人在做什么?”)
注意事项
- 本地文件分析需要有效的
VIDEO_UNDERSTAND_API_KEY - 建议始终通过
./run.sh调用,以确保使用技能目录内的.venv - 本地文件会先走上传缓存;URL 输入不会触发本地上传
- 当前脚本对本地上传文件设置了 20MB 限制;超过该大小会直接返回上传失败
- 上传缓存统一位于
runtime/upload_cache.json;旧根目录缓存会在读取时自动迁移 .env属于本地私有配置,不应提交- 建议通过
run.sh而不是直接切换解释器运行,减少环境漂移
返回处理
API 返回 JSON,默认提取 choices[0].message.content 作为回答。 如果上游接口报错,脚本会直接返回错误文本,便于在命令行快速定位问题。
子代理执行策略
- 默认执行模式:优先使用子代理独立执行;主会话负责接单、补齐必要上下文、控制范围,并在最后整合结果回报给用户。
- 适合交给子代理的任务:预计超过 30 秒的处理、多步骤流水线、多文件/多产物生成、批处理、审计、转写、总结、离线分析。
- 主会话保留职责:只在必要时追问关键缺口、确认边界、挑选最终结果,并把输出改写成面向用户的完成答复。
- 不建议默认交给子代理的情况:一次性极短任务、需要高频来回确认的对话、强依赖当前聊天即时上下文的动作。
- 回报节点:默认只保留“已受理 / 已开始 / 已完成 / 已失败”四类关键节点,避免刷屏。
按 MIT 许可原样转载,未经改动 · 在 GitHub 查看 →
评论
登录即可评论;带「已验证安装」的,是发布者名下有本店的安装或持有记录。
…