shijuefenxilisted
Install: claude install-skill hnweiyi/deepseek-vision-helper
# DeepSeek(通用)视觉助手(原 shijuefenxi / 视觉分析)
把本地/远程图片交给视觉大模型,返回结构化中文描述;也可读取网页文字并识别其图片。**半自动路由引擎**:你只需判断任务类型,脚本自动完成“选模型 → 调模型 → 失败分类降级/熔断换路 → 额度熔断 → 多模型汇总 → 任务类型校验”,结果自带**答案缓存**与**安全提示**。默认 7 家启用(魔搭 Qwen3-VL ×3 / 智谱 GLM ×3 / Agnes ×1)+ 可选 InternAI 第 8 家(默认关闭模板)。本技能与 DeepSeek 官方无关联,仅为 DeepSeek 等纯文本模型补充视觉能力。
## 何时用
- 用户让你看某张图、分析截图、识别报错、理解手绘草稿、读图表/UI/文档照片、比较前后截图等。
- 用户给一个网页 URL,想让你“读网页 + 看里面的图”并给出综合信息。
- 只要需要从图像中获取信息,就先走本技能,**不要靠猜**。
## 核心流程(主模型只做一件事:判断 --task)
1. 判断用户需求类型,选择 `--task`(11 类):
- `ocr` 逐字提取文字;`document` 长文档结构化;`error` 报错定位;
- `math_stem` 数学/科学题;`chart` 图表解读;`detail` 高精度细节;
- `ui` 界面/截图转代码;`general` 通用描述;`compare` 多图对比;
- `video` 视频帧/截图;`unknown` 兜底(等同 general)。
2. 拿到图片的**本地路径**或 http(s) URL。
3. 调用脚本(脚本自动按任务路由到最合适的模型组合):
```bash
python "<本技能目录>/scripts/analyze.py" "<图片路径或URL>" --task ocr -f "<关注点>"
```
4. 读取返回的结构化文字(关键任务已由 agnes 汇总成**一份**),据此回复用户。
## 自动路由与多模型汇总(核心)
- **厂商分组**:按 `providers[].group` 自动聚合(魔搭 / 智谱 / Agnes / internai 等),不是写死的三家;`groups.<组>.multi` 与 `providers[].multi` 双层控制是否参与多模型并发(都开才并发,仅影响 multi,单模型链不受影响)。
- **质量优先默认链**(`default_chain`,通用任务):235b → internai(默认关,自动跳过) → glm(4.6v) → glm-thinking(4.1v) → 8b-thinking → 8b → glm4v → agnes。
- **特化覆盖**:`math_stem` / `chart` 首选 glm-thinking(GLM-4.1V-Thinking 数学/图表专项强项)。
- **失败按原因分类 + 熔断换路**:404/模型不存在→同组换模型(或 provider 的候选数组);额度尽→跨组换厂商;429/5xx/网络→立即换下一供应商并�� Retry-After 冷却(无需干预)。
- **关键任务自动多模型**:`multi_tasks = error / math_stem / detail / compare` 按 `groups.multi=true` 的分组且 `providers[].multi