使用 dsh-vision-toolkit 给 DeepSeek Harness 纯文本模型补上视觉能力

前言

DeepSeek Harness(简称 dsh)把模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都做成可替换插件,官方说法是「一切皆插件」。装好 Node.js 之后,可以用下面这条命令拉起网页界面:

npx @deepseek-ai/dsh web

Harness 解决的是「智能体怎么在真实环境里持续干活」。但很多日常任务并不是纯文本:报错弹窗、设计稿、长网页截图、手绘线框,都得先看图。DeepSeek 这类纯文本模型本身接不了图片,粘贴截图会被拒绝;即便接上通用看图接口,得到的也常常是一段笼统描述——按钮在哪、报错写了什么、实现和参考图差在哪,仍然没法直接动手。

社区目录把这类能力归在「界面增强」。dsh-vision-toolkit 的做法不是换一个多模态主模型,而是给当前文本 Agent 挂上一套视觉工具和 Skill:看图带着当前问题的意图,定位返回原图像素坐标,长截图可以分块 OCR,UI 还原还能拿像素差异做下一轮修正。本文按社区目录详情页、GitHub 仓库 README / 中文说明 / package.json / CHANGELOG.md / MIT 许可证、npm 包页,以及 DeepSeek Harness 官方仓库 交叉核对后整理。

需要先说清楚来源:社区插件目录 deepseek-harness-plugin.com 是独立站点,与 DeepSeek / 幻方没有官方从属关系,不要把它当成官方应用商店。截至 2026-08-17,GitHub 仓库 Anionex/dsh-vision-toolkit 为 539 星;目录页标注 386 星、分类为「界面增强」,并标为精选。npm 包 @anionex/dsh-vision-toolkit 当前版本为 0.1.20,许可证为 MIT。

这是什么

一句话:它是 agent-vision-toolkit 面向 DeepSeek Harness 的原生接入,给 Web 和 Headless Profile 里的纯文本模型补上图片问答、定位、OCR、裁剪、描摹和像素级验证。

维护者是 Anionex。仓库主要语言是 TypeScript。视觉能力来自打包并固定版本的上游工具箱快照,插件自己负责安装、会话级工具暴露、Credential、路径校验、超时取消、结果文件和 Web 展示;运行时不会在后台拉取上游 mainpackage.json 里记录的上游快照为 v0.1.0+snapshot.bc9803d

它分两层:

  1. 视觉工具和 vision-tools Skill:让 Agent 判断何时该看图、定位、OCR、裁剪、描摹或做像素对比。
  2. DSH 原生接入:把这些能力放进 Profile、会话、Settings、Artifacts 和 Web 界面,并提供安装后即可使用的免费视觉服务。

对宿主明确标记为纯文本的模型,插件会注册名为 <模型名> (Vision Toolkit) 的变体。默认情况下,在 DSH Web 里粘贴图片会切到这个变体,并把工作区路径以及围绕当前问题的视觉描述一起交给文本模型。

核心功能

仓库 README 列出 10 个可以单独调用、也可以串成工作流的工具。坐标统一用原图像素 x1,y1,x2,y2,定位结果可以直接交给裁剪、描摹或后续自动化。

1、带着意图看图。 vision_glance 不是写一篇看图作文,而是围绕「报错在哪里」「提交按钮是什么颜色」提取证据。多图比较也走这条工具。

2、定位和清点界面元素。 vision_ground 回答「我要找的东西在哪」,返回像素框,可选带框预览。vision_detect 清点按钮、图标等元素,给出编号清单和坐标。

3、从截图里拿出可继续用的素材。 vision_crop 裁出 PNG 或 JPEG;vision_trace 把图形描成可编辑 SVG;vision_extract_foreground 抠主体得到透明 PNG;vision_dominant_colors 给出主色板或候选色排序。README 写明:裁剪、像素对比、颜色分析、前景提取、SVG 描摹和 HTML 截图在本地完成,不消耗视觉 API 请求。

4、长截图 OCR。 vision_long_screenshot_ocr 会分块读取,并保留 Markdown、分块图、清单和审计结果,失败后也能继续,用来处理容易漏行、重复的长网页截图。

5、UI 还原闭环。 vision_html_screenshot 按指定视口渲染本地页面;长文档可传 fullPage=true,生成覆盖整页的 PNG,并以 CSS 像素返回 pageHeightvision_pixel_diff 对比参考图和实现截图,给出差异比例、重点区域、热力图和 JSON。仓库内置了可复现的 UI 还原示例:先渲染参考图和实现,再用差异结果指导下一轮修正。

6、Web 侧粘贴即用。 粘贴后保留原生缩略图、会话记录和工作区路径;Web 可以预览产物,Headless 继续使用同一份结构化结果。

安装与启用

目录页给出的安装命令是:

dsh plugin add github:Anionex/dsh-vision-toolkit

如需可复现安装,目录页建议固定 commit 哈希:

dsh plugin add github:Anionex/dsh-vision-toolkit#commit

#commit 换成实际提交哈希。仓库 README 另外给出 npm 包写法,并要求指定 Profile,当前版本更贴近这条路径:

dsh plugin --profile web add @anionex/dsh-vision-toolkit

Headless Profile 可以单独装:

dsh plugin --profile headless add @anionex/dsh-vision-toolkit

升级和卸载:

dsh plugin --profile web update @anionex/dsh-vision-toolkit
dsh plugin --profile web remove @anionex/dsh-vision-toolkit

如果是从已停止发布的 @dsh-external/dsh-vision-toolkit 迁过来,README 要求先移除旧包,再安装 @anionex/dsh-vision-toolkit

安装后需要重启正在运行的 Web Profile,打开 设置 → 视觉工具。默认免费服务已经配好,可以直接点 测试视觉模型。这个测试会走真实看图请求,而不是只打通 /models。首次启动会准备隔离的 Python 运行时,因此需要能访问 Python 包缓存或网络;普通安装不需要再克隆 agent-vision-toolkit,也不需要填本地路径。

运行要求以 README 和 package.json 为准:

  • DeepSeek Harness Web 或 Headless Profile;对等依赖声明为 @deepseek-ai/dsh-agent ^0.1.0-rc.6 及同线包。
  • Node.js ^22.19.0>=24.0.0
  • Python 3.11+;插件默认自动创建隔离环境。CHANGELOG 在 0.1.13 起支持 Windows 上的 Microsoft Store Python。
  • 只有 vision_html_screenshot 需要 Chrome、Chromium 或 Edge。
  • 图片需为 PNG、JPEG、GIF 或 WebP,并位于会话工作区或明确允许的目录中。

典型用法

重启并确认设置页连通之后,在会话里粘贴截图,或把图片放进会话工作区,然后调用 /vision-tools。README 给出的示例包括:

看看这张截图,告诉我报错原因和最值得先修的地方。
找到右上角的登录按钮,返回原图像素坐标并生成带框预览图。
把这个图标裁出来并转成 SVG。
按照 reference.png 还原页面,每轮截图后做像素对比,直到主要差异消失。

常见任务可以按仓库推荐的工作流来组合工具:

任务 推荐工作流
图片问答 / 截图排障 看图 → 围绕当前问题回答 → 必要时继续定位
找按钮、图标或文字区域 定位目标 → 返回像素框 → 生成标注预览
提取截图里的图标 定位 → 裁剪 → 描摹为 SVG
读取长网页截图 自动分块 → OCR → 合并 Markdown → 检查边界
复刻网页或组件 参考图 → 实现 → HTML 截图 → 像素对比 → 继续修正
提取品牌视觉 裁剪区域 → 主色分析 → 前景提取 → 导出透明 PNG

粘贴后如果仍提示模型不支持图片,README 的处理顺序是:重启 Web Profile 并刷新页面,确认当前模型已切到带 (Vision Toolkit) 后缀的变体;也可以先把图片放进会话工作区,再调用 /vision-tools

配置、限制与注意事项

默认免费视觉服务的入口是:

Base URL: https://vision.anionex.me/v1
Model:    qwen/qwen3.6-27b

这是共享入口,不是无限量私有端点。CHANGELOG 写明 0.1.14 起默认后端切到 Groq Qwen3.6。README 记录的请求保护规则为:单次最多 5 张图、单张不超过 4 MiB、单张解码像素不超过 20,000,000、单次输出最多 4,096 tokens。共享容量用尽时会返回带 Retry-After429,而不是含糊的模型失败。

需要更高额度、私有端点或其他模型时,在 设置 → 视觉工具 里改提供方,并把 API Key 存成 DSH Credential。Settings 只保存 Credential 引用,不会把密钥回显到浏览器。也可以在 Profile patch 里写:

- id: vision-toolkit
  config:
    provider:
      baseUrl: https://api.example.com/v1
      credential: MY_VISION_KEY
      model: your-vision-model
      protocol: openai

支持 OpenAI Chat Completions 兼容端点和 Anthropic Messages。临时禁用可以在同一处设置 disabled: true。重新启用或升级 Web 插件后,需要重启 Web Profile 并刷新页面。

当前版本的能力边界也写在 README 里:专注截图理解、视觉定位、OCR、素材提取、UI 还原和像素级验证;不是视频、音频或摄像头输入系统,也不会自动点击 GUI。交互式框选编辑、远程服务集群、模型投票和跨会话视觉缓存都不在当前范围。

目录页有一条需要单独看的安全说明:插件以当前 dsh 进程的权限运行,安装时可能执行代码。安装前应检查源代码仓库和许可证;生产或可复现环境建议固定 commit。找不到 Chrome 时,只有 HTML 截图不可用,其他工具不受影响。图片过大时先裁剪或缩放,错误会标明是字节限制还是像素限制。

小结

纯文本模型缺的往往不是「再写一段图片描述」,而是能定位、能裁、能读长图、能用像素差验证还原结果的工具链。dsh-vision-toolkit 把这套流程接到 DeepSeek Harness 的 Web / Headless Profile 里,粘贴图片后切到 (Vision Toolkit) 变体,本地图像处理和远程看图可以在同一次 Agent 工作流里衔接。

目录页:https://deepseek-harness-plugin.com/zh-CN/plugins/dsh-vision-toolkit/

GitHub:https://github.com/Anionex/dsh-vision-toolkit

上游工具箱:https://github.com/Anionex/agent-vision-toolkit

项目站点:https://agent-vision.anionex.me

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜