dsh-vision:为 DeepSeek Harness 补上近原生的图像理解

前言

DeepSeek Harness(DSH)把模型、工具、路由都做成可插拔组件,主模型选 deepseek-official 这类纯文本模型时,Composer 里拖入的图片往往无法被直接理解。常见做法是手动 OCR,或换用另一套支持多模态的客户端,任务上下文也要跟着改。

下面介绍社区插件 oil-oil/dsh-vision。它在不替换 Harness 主模型的前提下,为文本模型接上独立的视觉识别链路;若主模型本身支持图像,则原图直传,不做额外预处理。

这是什么

dsh-visionoil-oil 维护,归类为模型推理,MIT 许可,当前版本 0.1.2。仓库:github.com/oil-oil/dsh-vision,SkillHub 目录页:skillhub.cn/plugins/oil-oil/dsh-vision

一句话定位:Near-native image understanding for DeepSeek Harness——让 Harness 在文本主模型下也能处理图片附件,体验尽量接近原生多模态。

核心功能

路由逻辑

插件按主模型能力分流,不替换 Harness 里选定的主模型:

主模型 图片路径 最终回答
支持图像 原图直传,无预处理或 OCR 当前模型
deepseek-official 或其他纯文本模型 配置的视觉模型观察原图,输出作为不可信附件上下文注入 DeepSeek
云端视觉不可用 回退到 macOS Vision 或 Tesseract DeepSeek

多张图片会一起分析,便于对比和综合证据;用户任务原文转发,不套固定报告模板。

视觉后端配置

安装后,Settings → Plugins → Plugin configuration 会出现 Vision Recognition 卡片。可选 ZenMux、Alibaba Cloud Model Studio、TokenDance、OpenRouter,填写 API Key,并可改模型 ID、API 端点、图片数量上限。

API Key 经 Harness 官方凭证服务存储,浏览器端只写不读:插件能报告 Key 是否存在,但不会把 Key 读回页面、对话、设置文档或会话日志。

Automatic 则跳过插件管理的云端凭证,依次尝试 Harness 里已配置的多模态模型、see 兼容的私有配置,以及本地 OCR。Harness 自定义模型须声明 image 输入模态,否则仍视为文本模型。

see-skill 兼容与本地回退

Harness 没有可用视觉模型时,插件会读取 ~/.config/see/config.env,支持 ZenMux、Alibaba Cloud Model Studio、OpenRouter、TokenDance;环境变量可覆盖私有配置文件:

export SEE_PROVIDER=zenmux
export ZENMUX_API_KEY=your-key

无云端 Key 或全部云端路由失败时:

  • macOS:内置 Vision OCR,无额外依赖
  • Linux / Windows:Tesseract(需安装对应语言包)

本地回退以 OCR 为主,不等同于完整多模态理解。

安全边界

  • 原图仅发往用户配置的视觉服务
  • 视觉输出标记为不可信观察数据,图中指令不获得系统权限
  • 生成的视觉上下文只影响当前模型请求,不重写消息历史
  • API Key 经 Harness 凭证或 see 私有配置解析,不写入插件仓库

安装与启用

DeepSeek Harness 仍处于 Developer Preview。本插件支持 0.1.0-rc.60.1.0-rc.7

用 Harness 内置插件管理器安装:

npx @deepseek-ai/dsh plugin --profile web add github:oil-oil/dsh-vision

重启 Harness 后,在 Composer 中照常粘贴或拖入图片即可。插件会替换官方 deepseek-official 适配器,同时保留其模型目录、设置与凭证。

典型用法

界面配置(推荐)

  1. 执行上述安装命令并重启 Harness
  2. 打开 Settings → Plugins → Plugin configuration → Vision Recognition
  3. 选择视觉后端并填写 API Key(或选 Automatic 走 Harness 已有路由)
  4. 回到 Composer,拖入图片并输入任务,例如「对比这两张截图里的表格差异」

多张附件会一并送入视觉链路,主模型仍是你选定的 DeepSeek 文本模型。

高级文件配置

多数场景用 UI 即可。等效的非密钥字段写在 $DSH_HOME/settings.yamlllm-deepseek 段:

llm-deepseek:
  visionBackend: zenmux
  visionBackendModel: qwen/qwen3.7-plus
  visionBackendBaseURL: https://zenmux.ai/api/v1
  maxImages: 8

不要把 API Key 写进该文件;在 Vision Recognition 卡片保存,或设置对应环境变量。修改后无需重启。

适用场景与注意

适合谁

  • 主模型固定为 deepseek-official 或其他纯文本 DeepSeek 模型,但对话里经常带截图、图表、照片
  • 已在 Harness 或 see 生态里配置了 ZenMux、Model Studio 等视觉后端,希望复用同一套 Key
  • 需要多张图片联合分析,又不想换客户端或手写 OCR 流程

使用前请知悉

  • 插件以当前 DSH 进程权限运行;安装前请阅读 源码MIT 许可证
  • SkillHub 为社区目录,与 DeepSeek / 幻方无官方从属关系
  • 本地 OCR 回退能力有限,复杂视觉推理仍依赖云端多模态模型
  • 开发环境要求 Node >=22.19(见 package.json

结尾

dsh-vision 把「文本主模型 + 独立视觉桥接 + 原生多模态直传」三条路径收进一个 Harness 插件:该直传时直传,该桥接时用不可信观察上下文补全,云端不可用时还有本地 OCR 兜底。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜