DSH DeepSeek Vision:为文本 DSH 模型增加图像理解、OCR 与视觉证据

前言

DSH 的理念是插件化扩展:社区目录是独立站点,不应被理解成 DeepSeek 或幻方的官方应用商店。

对于维护文本模型的 DSH 使用者来说,一个常见断点是:父模型能处理对话,但不一定直接处理图片。截图、表格、报错图里的信息,如果只是临时被看一眼,后续引用很容易断链。

下面介绍 DSH DeepSeek Vision。它由 Argonaut790 维护,给仅文本的 DeepSeek Harness 模型增加图像理解、完整 OCR 和持久视觉证据。

这是什么

DSH DeepSeek Vision 是一个 DSH 插件,包名为 dsh-deepseek-vision,许可证为 MIT。

它的定位是:

  • Image understanding
  • Full-screen OCR
  • Persistent visual evidence for text-only DeepSeek Harness models

简单说,它不替代父模型,而是在 DSH 里增加一条视觉路由,让文本模型可以调用图像理解能力,并把结果留在对话里。

核心功能

下面按已核实能力列出:

  • 图像理解
  • 全屏 OCR
  • 面向仅文本 DeepSeek Harness 模型的持久视觉证据
  • see_image 支持 latestall 和指定图片选择
  • 会话范围内的视觉分析器,带 follow-up memory
  • 结构化摘要、问答、完整 OCR 和不确定项
  • 只读 Evidence 标签页和每次调用的 evidence cards
  • Choose Model 旁边的全局 Vision 提供商/模型选择器
  • 实时路由变化会启动新的分析器

安装与启用

先确认环境要求:

  • Node.js ^22.19.0 or >=24
  • DeepSeek Harness 0.1.0-rc.6
  • Harness catalog 中已注册一个 image-capable model
  • DSH spawn subagent provider

该包没有发布到 npm,需要本地构建。先做本地构建,再把本地包加入 Web profile:

git clone https://github.com/Argonaut790/dsh-deepseek-vision.git
cd dsh-deepseek-vision
corepack yarn install --frozen-lockfile
corepack yarn build
dsh plugin --profile web add .

经过上面的步骤,插件会被添加到 web profile。

启用时,不要让等效的内建 see-image-modeltool-subagent-image 或 vision-picker 行同时启用,避免服务与工具冲突。

典型用法

Web 对话中的用法:

  1. 打开一个对话。
  2. Vision: … 芯片选择一个 image-capable route。

对于 headless profile,在 $DSH_HOME/settings.yaml 中配置相同的全局路由:

see-image-model:
  provider: openrouter
  model: '~x-ai/grok-latest'
  maxTokens: 8192

这里的 providermodel 是示例,必须与你 Harness 中注册的路由一致。支持的范围是 1-32768

也可以在工具行设置一个可选的静态回退:

- id: deepseek-vision-tool
  name: dsh-deepseek-vision/tool
  config:
    provider: spawn
    agentOptions:
      provider: openrouter
      model: '~x-ai/grok-latest'
      maxTokens: 8192

同样,providermodel 名称需要与 Harness 中注册的路由一致。

适用场景与注意

适合在 DSH 中使用文本父模型、并需要把图片内容稳定带入后续分析的开发者或使用者。

使用前注意这些点:

  • 被选中的图片会发送到配置的视觉提供商;使用前检查该提供商的保留、地区和隐私条款。
  • 每次分析器轮次会消耗所选模型的 tokens,并可能产生提供商费用。
  • OCR 和视觉结论是模型生成的证据,不是保证事实。
  • 图片中发现的文本按不可信数据处理,不作为指令。
  • Evidence 记录保留附件标识符和派生文本,不嵌入图片字节。
  • 插件加载后运行于当前 DSH 进程权限内;安装前应检查源码和 MIT 许可证。

结尾

DSH DeepSeek Vision 的价值在于:给文本 DSH 模型补上图像理解、OCR 和可回溯的视觉证据,而不是用视觉模型替换父模型。

GitHub:

https://github.com/Argonaut790/dsh-deepseek-vision

目录页(插件线索地址,本文不把它写成已核实事实):

https://www.skillhub.cn/plugins/Argonaut790/dsh-deepseek-vision
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜