← ClaudeAtlas

image-qalisted

通用图像问答与元素定位:描述一张图、回答关于图片的问题、定位图中的元素、 对比两张图、判断照片/文档/示意图内容。任何"看图说话"类请求的兜底场景。 用户说"这是什么图/图里有什么/描述一下/找一下图中X/对比这两张图/判断这 个截图"并给图时自动触发;不属于 UI 评审 / OCR 提取 / 图表读取的看图请求 都落这里。
awslew/ds-vision-kit · ★ 1 · Testing & QA · score 73
Install: claude install-skill awslew/ds-vision-kit
# image-qa(场景层:图像问答与元素定位) 底座命令(glance/ground/detect/crop/trace/pixel-diff)已覆盖通用识图能力, 本场景把它们组织成一个一致的流程和输出格式,作为看图类请求的**兜底场景**。 没有单独的新能力——是"验证底座已满足 + 统一调用方式"。 ## 触发场景 - 描述照片/场景/示意图:"这张图是什么 / 描述一下" - 关于图片的问答:"图里有几个人 / 这个页面有没有广告 / 路上是什么车" - 定位元素:"烟囱在哪里 / 找出图中所有红色物体" - 对比:"这两张图有什么区别" - 判断性问答:"这个证书是真是假 / 这截图是哪个软件" ## 工作流 **Pass 1 — 先问清楚再回答** - 对"是什么/描述/内容判断"类:`glance "<图>" -q "<问题>"`(或直接 --ocr 若问题只是读字) - 对"对比"类:`glance "<图1>" "<图2>" -q "<问题>"` —— **一张调用里传两张图**,别分开调用 - 对"是否变化"类:先 `pixel-diff "<图1>" "<图2>"` 拿到差异框,再对差异框 `glance --region` 读内容。模型答"变了没变"是抛硬币,pixel-diff 是像素级的。 **Pass 2 — 定位与放大** - 问"在哪里":`ground "<图>" "<目标描述>"` → 得到 `x1,y1,x2,y2` 像素框 - **"第几个同类"(如第 3 根柱)别直接 ground**:序数定位模型不稳。先 `detect "<图>" "<种类>"` 全量枚举(每个带坐标),按坐标/标签挑目标,再对框放大。实测范例:`detect 图 "bars"` 精确返回 Q1@165-255、Q2@327-417、Q3@489-579、Q4@651-741,按 x 范围即知第 3 根是 489-579。 - 框内细节看不清:`glance "<图>" --region X1,Y1,X2,Y2 -q "<问题>"`(上传裁剪放大) - 要数"所有同类":`detect "<图>" "<种类>"`(枚举清单 + 坐标) - 框要反复用:`crop "<图>" --region ... -o "<局部>.png"` 切出来 **Pass 3 — 交叉验证像素级事实** - 颜色、精确尺寸、小偏移:别信 prose。用 `palette` 取色号,用 `trace`/`crop` 量几何。 ## 输出格式 ```markdown ## 图像问答结果 **图片**:<路径> **问题**:<用户问题> ### 回答 <直接回答,引用图上的具体证据> ### 证据(坐标 / 局部) - 目标位置:`x1,y1,x2,y2` - 相关局部:<crop 出的文件,供主模型/用户复���> ### 不确定点 - <哪里看不清、哪些是推测、哪些需要原图确认> ``` ## 工具与能力边界(实测记录) | 需求 | 工具 | 实测表现 | |---|---|---| | 描述/问答 | glance -q | 强:照片场景光线/主体/细节都能说清 | | 读字 | glance --ocr | 强:正文/代码逐字转录 | | 元素定位 | ground | 可用;"第几个同类"易错位,改用 detect 枚举再缩小 | | 元素枚举 | detect | 强:图例/刻度/组件全枚举+坐标