DeepSeek Harness(DSH)把智能体能力拆成可插拔的插件,但不少开发者日常用的仍是纯文本模型:对话里不能直接贴图,报错截图只能手打路径,长截图里的聊天记录得自己 OCR,想从设计稿还原前端页面更是无从谈起。社区目录里有一款星标超过 800 的插件 dsh-vision-toolkit(维护者 Anionex),目标很明确:给 DSH 里的文本模型装上「眼睛」,并把看图、定位、裁剪、像素对比等能力收进一套可组合的工具箱。
需要说明的是:DSH 的核心理念是「一切皆插件」,而 SkillHub 插件库 等社区目录由第三方维护,与 DeepSeek / 幻方并无官方从属关系;安装前建议自行查阅源码与 MIT 许可证,并记住插件以当前 dsh 进程权限运行。
这是什么¶
dsh-vision-toolkit 是上游项目 agent-vision-toolkit 面向 DeepSeek Harness 的原生集成。它不只是把图片丢给多模态模型做一段泛泛描述,而是围绕当前任务提取证据——例如「报错在哪」「按钮坐标是多少」——并配合本地图像处理与 vision-skills Skill,让 Agent 知道何时看图、何时定位、何时做像素 diff。
项目提供两层能力:
- 10 个视觉工具 + vision-skills Skill:覆盖问答、OCR、UI 还原、GUI 操作等 playbook。
- DSH 原生接入:与 Profile、会话、Settings、Artifacts 和 Web UI 打通;粘贴图片可自动路由到
(Vision Toolkit)变体(2026-08-19 起默认开启「透明变体路由」,模型列表可只保留原名一项)。
在 SkillHub 目录中,该插件归类为「模型推理」;GitHub 仓库当前约 821 star、34 fork,npm 包版本 0.1.38,许可证 MIT。
核心功能与亮点¶
粘贴图片,直接提问¶
在 DSH Web 中粘贴截图,纯文本模型可自动切换到对应的 Vision Toolkit 变体,保留缩略图、会话历史与工作区路径,无需手动复制文件路径或换模型。
任务导向的看图,而非万能描述¶
多数视觉桥接会让多模态模型生成通用描述再交给文本模型,多一层语义损失。Vision Toolkit 把用户消息或 Agent 调用原因作为 focus hint 传给视觉模型,输出围绕当前步骤的重点信息,token 更少、针对性更强。
十项工具,可单独调用也可串联¶
| 工具 | 典型问题 | 主要结果 |
|---|---|---|
vision_glance |
图里发生了什么? | 针对性回答、OCR、多图比较 |
vision_ground |
目标在哪? | 原图像素坐标、可选框选预览 |
vision_detect |
有哪些按钮/图标? | 编号元素清单与坐标 |
vision_crop |
裁出某块区域 | PNG/JPEG 裁剪图 |
vision_trace |
图形变矢量 | SVG |
vision_pixel_diff |
实现与参考差在哪? | 差异比例、热力图、JSON |
vision_long_screenshot_ocr |
读完长截图 | Markdown、分块与审计输出 |
vision_extract_foreground |
抠出主体 | 透明 PNG |
vision_dominant_colors |
主色是什么? | 色板或候选色排序 |
vision_html_screenshot |
渲染本地页面截图 | PNG,可选 pageHeight |
坐标统一为原图像素 x1,y1,x2,y2,可直接交给裁剪或后续自动化。
vision-skills:带方法论的操作手册¶
随插件附带的 Skill 携带上游 playbook,例如:长截图 OCR、截图还原 UI、图标/Logo 矢量化、草图转结构化代码(Mermaid/Graphviz)、基于截图的 GUI 操作等。提示词里加上「使用 vision-skills」即可引导 Agent 按步骤选工具并验证结果。
典型场景演示(来自官方 README)¶
- 截图 → 可编辑 HTML:左为参考页,右为 HTML/CSS 还原,并可继续截图渲染 + 像素对比迭代。
- 手绘稿 → 可用界面:草图直接变成可交互前端页面。
- 快速 UI 还原:约三分钟内产出布局近似的首版截图(允许颜色与图标库近似)。
安装与启用¶
官方 README 推荐通过 npm 包名安装到指定 Profile(web / headless / desktop 等,按你实际使用的 profile 名替换):
dsh plugin --profile web add @anionex/dsh-vision-toolkit
Headless Profile:
dsh plugin --profile headless add @anionex/dsh-vision-toolkit
DSH Desktop 用户需从托盘打开 DSH 终端,在桌面版自带 CLI 中执行(桌面版不写入系统 PATH):
dsh plugin --profile desktop add @anionex/dsh-vision-toolkit
DeepSeek Harness 插件库 目录页给出的另一种写法是从 GitHub 解析安装:
dsh plugin add github:Anionex/dsh-vision-toolkit
需要可复现安装时,可在命令后固定 commit 哈希,例如 dsh plugin add github:Anionex/dsh-vision-toolkit#commit。
安装后重启对应 Profile,打开 设置 → 视觉工具,配置视觉模型提供方(API Key 存为 DSH Credential),并运行 测试视觉模型 确认连通。首次启动会准备隔离 Python 运行时:优先使用系统 Python 3.11+,否则从国内镜像下载约 35MB 的托管 Python(失败时回退 GitHub 发布源),并安装 Pillow、NumPy、vtracer 等锁定依赖。
典型用法示例¶
在会话中粘贴截图,或将图片放入工作区后调用 /vision-skills,可直接用自然语言描述目标:
看看这张截图,告诉我报错原因和最值得先修的地方。
找到右上角的登录按钮,返回原图像素坐标并生成带框预览图。
把这个图标裁出来并转成 SVG。
按照 reference.png 还原页面,每轮截图后做像素对比,直到主要差异消失。
带 Skill 引导的 UI 还原示例:
(使用 vision-skills)把这张图片还原成 HTML。
也可在 Profile patch 中配置视觉提供方(OpenAI Chat Completions 兼容或 Anthropic Messages):
- id: vision-toolkit
config:
provider:
baseUrl: https://api.example.com/v1
credential: MY_VISION_KEY
model: your-vision-model
protocol: openai
官方文档提供了 AIHubMix 申请 API Key 并配置 Gemini 3.7 Flash 识图 的图文教程。
适用场景与注意事项¶
适合谁:
- 日常用纯文本模型写代码、排错,却希望获得接近多模态的「贴图即问」体验。
- 需要从长截图提取聊天/文档、从设计稿或截图还原 UI、做图标矢量化、GUI 截图操作等更高价值视觉任务。
- 希望在 DSH Web / Headless / Desktop 间统一使用同一套视觉工具链的 Harness 用户。
注意事项:
- 插件以 当前 dsh 进程权限 运行,安装前请阅读源码与许可证,勿在未审计的仓库上盲目安装。
- 视觉能力依赖你配置的多模态端点;每次检查只发送必要意图与图片,调用间不累积上下文,额外成本通常可控;也可用本地小型多模态侧模型进一步降本。
- HTML 页面截图需要本机 Chrome/Chromium/Edge;缺失时仅该功能不可用,其余工具仍可用。
- 本地 OpenAI 兼容服务(LM Studio、Ollama 等)的
baseUrl需带/v1前缀,否则模型测试可能报incompatible response structure。 - DSH Desktop 2.0.1 内置插件市场存在已知安装问题,建议优先用终端命令安装。
小结¶
如果你已经在用 DeepSeek Harness,却常被「模型不能看图」卡住,dsh-vision-toolkit 值得列入短名单:一行命令接入、粘贴图片即可提问、十项工具覆盖从 OCR 到 UI 还原的完整链路,再配 vision-skills 把经验固化成 Agent 可执行的操作手册。
- SkillHub 目录页:https://www.skillhub.cn/plugins/Anionex/dsh-vision-toolkit
- GitHub 仓库:https://github.com/Anionex/dsh-vision-toolkit
- 上游工具箱:https://github.com/Anionex/agent-vision-toolkit
- 项目网站:https://agent-vision.anionex.me