llm-image-bridgelisted
Install: claude install-skill tt-bltn/llm-image-bridge
# LLM 图像识别桥接(DeepSeek / GLM 等纯文本模型通用)
## 触发条件
同时满足以下条件时**必须**使用本 Skill:
1. **当前模型不具备图像视觉能力**,属于纯文本模型,例如:
- DeepSeek 系列:`deepseek-v4-pro`、`deepseek-v4-flash`、`deepseek-r1` 等
- GLM 系列:`glm-5.3`、`glm-5.2` 等(注意:带 `V` 后缀的视觉版本如 `glm-4.6v` 本身具备视觉能力,不需要本桥接)
- 其他你确认无法直接"看"图片的文本模型
2. 用户提供了图片输入:本地图片路径、截图、粘贴的图片、或要求"看这张图/识别图片/分析图片/截图里有什么"
## 为什么
DeepSeek、GLM 等纯文本模型无法直接理解图片像素。本 Skill 调用一个 **OpenAI 兼容协议的视觉模型**(默认千问 Qwen3-VL,可切换为智谱 GLM-4.6V、GPT-5.5、Gemini 3 等任意兼容服务)识别图片,把图片内容转为**文字描述**,再基于该描述回答用户的问题——从而让当前模型获得图片理解能力,并保持答案来自用户当前使用的模型上下文。
## 使用步骤
1. **定位图片路径**:
- 用户给了本地路径 → 直接用该路径
- 用户粘贴/引用了图片(截图) → 找到图片实际落地路径(通常在会话临时目录或用户指定位置)
- 无法定位图片路径时 → 询问用户图片的确切路径
2. **调用识别脚本**(路径随 Agent 的 skills 安装位置而定,以 Claude Code 的用户级目录为例):
```bash
python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py <图片路径> [--prompt "针对图片的具体问题"]
```
示例:
```bash
python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py /path/to/screenshot.png
python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py /path/to/img.jpg --prompt "截图里报了什么错误?请逐字读出错误文案"
python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py /path/to/img.jpg --provider zhipu
```
3. 脚本调用配置的视觉模型,在 stdout 输出图片的**文字描述**;错误信息输出到 stderr(配置缺失/网络失败/图片无法读取等)。
4. 基于脚本返回的描述回答用户的问题。回答时**说明图片来源**:例如"已通过千问 Qwen3-VL 识别图片,以下是识别结果与我的分析:"——让用户知道图片理解来自桥接模型(具体模型名以配置为准)。
## 配置(选择视觉服务商)
**当用户说"帮我配置/安装这个 skill"时**:先运行 `--list-providers` 向用户展示可选服务商与申请入口,询问用户选择哪家、拿到 API Key 后写入 config.json(见