dsh-pseudo-vision:给 DeepSeek Harness 的 text-only provider 补本地视觉证据

前言

在 DeepSeek Harness(DSH)里,有些模型路由可以原生处理图片,有些 text-only provider 则不能直接把图片作为输入。对智能体开发者来说,这意味着图片附件里的文字、布局和颜色信息无法进入模型上下文。

下面介绍 dsh-pseudo-vision。它给 DSH 的 text-only provider 补一层“工具层视觉”:把图片附件转成 OCR 文字、颜色统计、像素扫描和元信息,让纯文本模型可以基于这些证据继续处理。所有图片处理都在本机完成,没有外部视觉 API。

这是什么

dsh-pseudo-vision 是一个 DSH 插件,由 DDDFXYqiming 维护,许可证为 MIT。

它的主要作用是为 text-only provider 生成 image-capable 兄弟路由:

dsh-pseudo-vision/<provider>

插件本地提供四个工具:

vision_ocr
vision_color_stats
vision_pixel_scan
vision_meta

其中,vision_ocr 使用 tesseract.js,支持 chi_simengvision_color_statsvision_pixel_scan 使用 sharp。装上后,deepseek-official 路由自动支持图片;原生视觉模型保持直接透传。

核心能力

插件围绕“把图片变成纯文本模型可读取的证据”展开。

  • 为指定 provider 生成兄弟路由,使 text-only 路由支持图片输入。
  • 将图片附件转成本地证据:OCR 文字、颜色统计、像素扫描、元信息。
  • 证据按轮次分层:最近轮次走全量管线;更早轮次降级为紧凑证据,并保留 vision_ocr 回读指针。
  • 单请求支持 maxImagesmaxTotalEvidenceChars 限制;超限时保留未转换占位符和图片处理摘要。
  • 所有处理在本机完成,不依赖外部视觉 API。

安装与启用

插件要求 Node.js >=22.19packageManagerpnpm@10.33.4

GitHub 安装

推荐从 GitHub 安装,需要网络:

dsh plugin --profile web add github:DDDFXYqiming/dsh-pseudo-vision

这条命令用于把 dsh-pseudo-vision 添加到当前 web profile。

本地路径安装

如果 Windows 遇到 schannel/pnpm 拦截,可以改用本地路径安装:

git clone https://github.com/DDDFXYqiming/dsh-pseudo-vision.git
cd dsh-pseudo-vision && pnpm install && pnpm build
dsh plugin --profile web add <本机绝对路径>

先 clone 并构建,再把本机绝对路径添加给 DSH。

pnpm 构建授权

pnpm >=10 首次 add 会拒绝运行 prepare 构建脚本。需要把包键写入 profile 的 pnpm-workspace.yaml allowBuilds,例如:

allowBuilds:
  dsh-pseudo-vision: true

写入后重新执行安装命令。这项授权应视为「允许该包代码在安装时于本机执行」。如果想固定安装内容,可以锁定 commit:

github:DDDFXYqiming/dsh-pseudo-vision#<sha>

典型用法

插件装上即生效,无需额外配置。deepseek-official 路由会自动支持图片。如果其他 provider 需要生成兄弟路由,要通过 bridgeProvidersbridgeOtherProviders 开启。

指定 provider

例如只给 kimi-for-coding 生成兄弟路由:

- id: dsh-pseudo-vision
  config:
    bridgeProviders: ["kimi-for-coding"]

这段配置只允许 kimi-for-coding 获得 dsh-pseudo-vision 的桥接路由。

批量桥接其他 provider

也可以设置 bridgeOtherProviders,一次性桥接除 excludeProviders 外的所有 provider:

    bridgeOtherProviders: true

注意:bridgeOtherProviders 会使每个模型在选择器中多出一份条目。开启前需要先确认选择器中的路由数量是否符合预期。

常见配置项

插件支持以下配置项:

bridgeProviders
bridgeOtherProviders
ocrBudget
ocrNoResize
evidenceMaxChars
maxImages
maxTotalEvidenceChars
fullEvidenceTurns

其中,maxImages 的范围是 1-32maxTotalEvidenceChars 的范围是 16000-320000fullEvidenceTurns 的范围是 1-8

适用场景与注意

这个插件适合以下情况:你在 DSH 中使用 text-only provider,希望模型能读取图片中的文字、颜色、扫描和元信息,同时不想引入外部视觉 API。

使用前注意:

  • 插件以当前 dsh 进程权限运行。安装前应检查源码、构建脚本和 MIT 许可证。
  • allowBuilds 会允许该包代码在安装时于本机执行;如担心后续安装内容变化,建议锁定 commit。
  • bridgeOtherProviders: true 会增加模型选择器中的路由条目,建议先确认路由数量。
  • 单请求超限时,未转换的图片会留下占位符和图片处理摘要。

链接

GitHub 仓库:

https://github.com/DDDFXYqiming/dsh-pseudo-vision

DSH 社区目录是独立站点,本文不附未核实的目录页 URL,可从插件目录入口查看。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye