gemini-visionlisted
Install: claude install-skill zouerdong/gemini-vision
# Gemini 多模态桥接
为 GLM / DeepSeek 等无原生多模态的主模型补齐视觉/听觉能力。通过 Gemini API 分析视频、图片、音频文件。
## 前置条件
- Node.js ≥ 18(零外部依赖,用原生 fetch)
- skill 根目录的 `.env` 中已配置 `GEMINI_API_KEY`
- 网络可访问 `generativelanguage.googleapis.com`(中国大陆需 TUN 模式代理,详见 README;Node ≥ 24 也可设 `NODE_USE_ENV_PROXY=1` 走系统代理)
## 用法
```bash
# 基础用法
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "path/to/video.mp4" --question "分析这个广告视频的节奏和视觉风格"
# 多文件对比
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "v1.mp4" --file "v2.mp4" --question "对比两个版本的差异,哪个更好?为什么?"
# 生成后质量核验
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "output.mp4" --question "对比以下提示词,逐条检查视频是否满足要求:<原始提示词>"
# 提取可复用框架
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "reference.mp4" --question "提炼这个视频的分镜节奏、运镜手法、色彩方案,输出可复用的制作框架"
# 输出 JSON(给 Agent 消费,responseMimeType 保证干净 JSON,可直接 parse)
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "video.mp4" --question "..." --json
# 同时输出 Markdown 报告文件
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "video.mp4" --question "..." --output "./analysis_report.md"
# 使用 Pro 模型(深度分析)
node ~/.claude/skills/gemini-vision/scripts/gemini-vision.mjs --file "video.mp4" --question "..." --model gemini-3.1-pro-preview
```
## 支持的格式
| 类型 | 格式 |
|------|------|
| 视频 | mp4, mov, avi, webm |
| 图片 | png, jpg, webp, gif, bmp |
| 音频 | mp3, wav, m4a |
## 模型降级链
默认模型 `gemini-3.7-flash`,遇到 503/429 时自动降级:
1. `gemini-3.7-fla