前言¶
DeepSeek Harness(DSH)把模型、工具、路由都做成可插拔组件,主模型选 deepseek-official 这类纯文本模型时,Composer 里拖入的图片往往无法被直接理解。常见做法是手动 OCR,或换用另一套支持多模态的客户端,任务上下文也要跟着改。
下面介绍社区插件 oil-oil/dsh-vision。它在不替换 Harness 主模型的前提下,为文本模型接上独立的视觉识别链路;若主模型本身支持图像,则原图直传,不做额外预处理。
这是什么¶
dsh-vision 由 oil-oil 维护,归类为模型推理,MIT 许可,当前版本 0.1.2。仓库:github.com/oil-oil/dsh-vision,SkillHub 目录页:skillhub.cn/plugins/oil-oil/dsh-vision。
一句话定位:Near-native image understanding for DeepSeek Harness——让 Harness 在文本主模型下也能处理图片附件,体验尽量接近原生多模态。
核心功能¶
路由逻辑¶
插件按主模型能力分流,不替换 Harness 里选定的主模型:
| 主模型 | 图片路径 | 最终回答 |
|---|---|---|
| 支持图像 | 原图直传,无预处理或 OCR | 当前模型 |
deepseek-official 或其他纯文本模型 |
配置的视觉模型观察原图,输出作为不可信附件上下文注入 | DeepSeek |
| 云端视觉不可用 | 回退到 macOS Vision 或 Tesseract | DeepSeek |
多张图片会一起分析,便于对比和综合证据;用户任务原文转发,不套固定报告模板。
视觉后端配置¶
安装后,Settings → Plugins → Plugin configuration 会出现 Vision Recognition 卡片。可选 ZenMux、Alibaba Cloud Model Studio、TokenDance、OpenRouter,填写 API Key,并可改模型 ID、API 端点、图片数量上限。
API Key 经 Harness 官方凭证服务存储,浏览器端只写不读:插件能报告 Key 是否存在,但不会把 Key 读回页面、对话、设置文档或会话日志。
选 Automatic 则跳过插件管理的云端凭证,依次尝试 Harness 里已配置的多模态模型、see 兼容的私有配置,以及本地 OCR。Harness 自定义模型须声明 image 输入模态,否则仍视为文本模型。
see-skill 兼容与本地回退¶
Harness 没有可用视觉模型时,插件会读取 ~/.config/see/config.env,支持 ZenMux、Alibaba Cloud Model Studio、OpenRouter、TokenDance;环境变量可覆盖私有配置文件:
export SEE_PROVIDER=zenmux
export ZENMUX_API_KEY=your-key
无云端 Key 或全部云端路由失败时:
- macOS:内置 Vision OCR,无额外依赖
- Linux / Windows:Tesseract(需安装对应语言包)
本地回退以 OCR 为主,不等同于完整多模态理解。
安全边界¶
- 原图仅发往用户配置的视觉服务
- 视觉输出标记为不可信观察数据,图中指令不获得系统权限
- 生成的视觉上下文只影响当前模型请求,不重写消息历史
- API Key 经 Harness 凭证或 see 私有配置解析,不写入插件仓库
安装与启用¶
DeepSeek Harness 仍处于 Developer Preview。本插件支持 0.1.0-rc.6 与 0.1.0-rc.7。
用 Harness 内置插件管理器安装:
npx @deepseek-ai/dsh plugin --profile web add github:oil-oil/dsh-vision
重启 Harness 后,在 Composer 中照常粘贴或拖入图片即可。插件会替换官方 deepseek-official 适配器,同时保留其模型目录、设置与凭证。
典型用法¶
界面配置(推荐)¶
- 执行上述安装命令并重启 Harness
- 打开 Settings → Plugins → Plugin configuration → Vision Recognition
- 选择视觉后端并填写 API Key(或选 Automatic 走 Harness 已有路由)
- 回到 Composer,拖入图片并输入任务,例如「对比这两张截图里的表格差异」
多张附件会一并送入视觉链路,主模型仍是你选定的 DeepSeek 文本模型。
高级文件配置¶
多数场景用 UI 即可。等效的非密钥字段写在 $DSH_HOME/settings.yaml 的 llm-deepseek 段:
llm-deepseek:
visionBackend: zenmux
visionBackendModel: qwen/qwen3.7-plus
visionBackendBaseURL: https://zenmux.ai/api/v1
maxImages: 8
不要把 API Key 写进该文件;在 Vision Recognition 卡片保存,或设置对应环境变量。修改后无需重启。
适用场景与注意¶
适合谁
- 主模型固定为
deepseek-official或其他纯文本 DeepSeek 模型,但对话里经常带截图、图表、照片 - 已在 Harness 或 see 生态里配置了 ZenMux、Model Studio 等视觉后端,希望复用同一套 Key
- 需要多张图片联合分析,又不想换客户端或手写 OCR 流程
使用前请知悉
- 插件以当前 DSH 进程权限运行;安装前请阅读 源码 与 MIT 许可证
- SkillHub 为社区目录,与 DeepSeek / 幻方无官方从属关系
- 本地 OCR 回退能力有限,复杂视觉推理仍依赖云端多模态模型
- 开发环境要求 Node
>=22.19(见package.json)
结尾¶
dsh-vision 把「文本主模型 + 独立视觉桥接 + 原生多模态直传」三条路径收进一个 Harness 插件:该直传时直传,该桥接时用不可信观察上下文补全,云端不可用时还有本地 OCR 兜底。