← ClaudeAtlas

llm-image-bridgelisted

纯文本模型(DeepSeek/GLM 等)图像识别桥接。当当前模型不具备多模态视觉能力(如 deepseek-v4-pro、deepseek-v4-flash、glm-5.3、glm-5.2 等)且用户输入图片(路径/截图/粘贴图片/要求"看这张图")时,自动调用 OpenAI 兼容协议的视觉模型(千问 Qwen3-VL、智谱 GLM-4.6V、GPT-5.5、Gemini 3 等,可在配置中切换)识别图片内容,将文字描述作为上下文供当前模型使用。适用于 Claude Code、Codex 等任意支持 Skills 或能执行脚本的 AI Agent。触发词:图片、截图、看这张图、识别图片、分析图片。
tt-bltn/llm-image-bridge · ★ 1 · AI & Automation · score 72
Install: claude install-skill tt-bltn/llm-image-bridge
# LLM 图像识别桥接(DeepSeek / GLM 等纯文本模型通用) ## 触发条件 同时满足以下条件时**必须**使用本 Skill: 1. **当前模型不具备图像视觉能力**,属于纯文本模型,例如: - DeepSeek 系列:`deepseek-v4-pro`、`deepseek-v4-flash`、`deepseek-r1` 等 - GLM 系列:`glm-5.3`、`glm-5.2` 等(注意:带 `V` 后缀的视觉版本如 `glm-4.6v` 本身具备视觉能力,不需要本桥接) - 其他你确认无法直接"看"图片的文本模型 2. 用户提供了图片输入:本地图片路径、截图、粘贴的图片、或要求"看这张图/识别图片/分析图片/截图里有什么" ## 为什么 DeepSeek、GLM 等纯文本模型无法直接理解图片像素。本 Skill 调用一个 **OpenAI 兼容协议的视觉模型**(默认千问 Qwen3-VL,可切换为智谱 GLM-4.6V、GPT-5.5、Gemini 3 等任意兼容服务)识别图片,把图片内容转为**文字描述**,再基于该描述回答用户的问题——从而让当前模型获得图片理解能力,并保持答案来自用户当前使用的模型上下文。 ## 使用步骤 1. **定位图片路径**: - 用户给了本地路径 → 直接用该路径 - 用户粘贴/引用了图片(截图) → 找到图片实际落地路径(通常在会话临时目录或用户指定位置) - 无法定位图片路径时 → 询问用户图片的确切路径 2. **调用识别脚本**(路径随 Agent 的 skills 安装位置而定,以 Claude Code 的用户级目录为例): ```bash python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py <图片路径> [--prompt "针对图片的具体问题"] ``` 示例: ```bash python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py /path/to/screenshot.png python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py /path/to/img.jpg --prompt "截图里报了什么错误?请逐字读出错误文案" python3 ~/.claude/skills/llm-image-bridge/scripts/recognize_image.py /path/to/img.jpg --provider zhipu ``` 3. 脚本调用配置的视觉模型,在 stdout 输出图片的**文字描述**;错误信息输出到 stderr(配置缺失/网络失败/图片无法读取等)。 4. 基于脚本返回的描述回答用户的问题。回答时**说明图片来源**:例如"已通过千问 Qwen3-VL 识别图片,以下是识别结果与我的分析:"——让用户知道图片理解来自桥接模型(具体模型名以配置为准)。 ## 配置(选择视觉服务商) **当用户说"帮我配置/安装这个 skill"时**:先运行 `--list-providers` 向用户展示可选服务商与申请入口,询问用户选择哪家、拿到 API Key 后写入 config.json(见