前言¶
在 DeepSeek Harness(DSH)里使用 DeepSeek-V3 或 DeepSeek-R1 时,如果对话中经常遇到截图、图表、附件图片,纯文本模型本身不一定能稳定完成“看图并回答”。dsh-ext-vision-proxy 做的事情比较直接:把外部 OpenAI-compatible 视觉 API 接进 DSH,让文本模型通过工具调用获得图片理解结果。
下面介绍它的定位、核心能力、安装启用方式和典型用法。
这是什么¶
dsh-ext-vision-proxy 是面向 DeepSeek Harness 的外部视觉代理插件,由 jin123-alpha 维护,许可证为 MIT。
一句话定位:
External vision proxy plugin for DeepSeek Harness,
enabling text-only models (DeepSeek-V3 / R1) to analyze and understand images
via OpenAI-compatible vision APIs.
它主要解决的是:在 DSH 会话中,让 DeepSeek-V3 / DeepSeek-R1 这类 text-only 模型能够借助外部视觉模型分析图片、截图、图表和附件。
需要额外准备:
OpenAI-compatible Vision API Base URL
API Key
核心能力¶
1. 给文本模型暴露视觉描述工具¶
插件会让模型可以调用工具来查看和回答图片相关问题。关键工具名是:
vision_describe
它适用于图片、截图、图表、附件等视觉内容的分析场景。
2. 在聊天输入栏加入开关和模型选择¶
插件会接入聊天输入栏的左侧区域:
conversation.input.left
这里会加入一个 pill-shaped toggle switch,以及一个 model dropdown selector,方便在会话中快速切换视觉代理状态和选择视觉模型。
3. 在 Settings 页面提供配置面板¶
插件提供 Settings 页面配置项,支持:
custom Base URLs
API Keys
vision model filtering
one-click connectivity testing
这意味着不需要每次都手动改文件,可以在页面里配置并测试外部视觉 API 是否可用。
4. 定义 4-state session matrix¶
插件会区分多模态模型和 text-only 模型,并结合开关状态形成 4 种会话状态:
Multimodal LLM + switch ON
Multimodal LLM + switch OFF
Text-only LLM + switch ON
Text-only LLM + switch OFF
其中已明确的一个状态是:
Text-only LLM + switch OFF
此时行为与未安装该插件一致。
5. 解析多种附件形式¶
插件支持解析以下图片资源形式:
sha256:...
local file paths
HTTP/HTTPS URLs
并会使用 binary magic bytes 检测 MIME type。
安装与启用¶
已核实资料里没有给出一个标准的 dsh plugin add 命令,因此这里不按单一插件安装命令理解。资料中出现的命令包括:
npm install
npm run build
npm pack
dsh web
先安装依赖:
npm install
如果需要本地构建和打包:
npm run build
npm pack
然后启动 DSH Web:
dsh web
插件依赖方面,资料中列出的 peer dependencies 为:
@deepseek-ai/cordis
@deepseek-ai/dsh-tools
react ^19.0.0
典型用法¶
下面流程来自已核实用法示例,可按顺序执行。
1. 启动 DSH Web¶
dsh web
2. 打开视觉代理设置页¶
访问本地地址:
http://127.0.0.1:3080
进入:
Settings -> 视觉代理 (Vision Proxy)
3. 填写 OpenAI-compatible 视觉 API 配置¶
填写 Base URL 和 API Key。Base URL 可以是:
https://api.openai.com/v1
也可以是本地 endpoint。
4. 获取模型列表¶
点击:
获取模型列表 (Fetch Models)
然后选择默认视觉模型,例如:
gpt-4o
gemini-2.5-flash
qwen-vl-max
5. 测试连通性¶
点击:
测试连通性 (Test Connection)
确认外部 API 可用后,保存配置。
6. 在会话中使用¶
在 DeepSeek-V3 或 DeepSeek-R1 会话中打开:
视觉代理
然后上传或粘贴一张图片,并提出问题。
此时模型会在后台调用:
vision_describe
再根据返回结果继续回答。
适用场景与注意¶
适合谁¶
如果你的 DSH 会话里经常出现图片、截图、图表、附件,而且希望让 text-only 模型也能参与分析和回答,这个插件比较合适。
它特别适合这种工作流:
用户上传图片
-> 模型判断需要看图
-> 调用 vision_describe
-> 外部视觉 API 返回图片理解结果
-> 文本模型继续组织回答
使用前注意¶
第一,它依赖外部 OpenAI-compatible Vision API。因此需要配置:
Base URL
API Key
第二,API Key 会进入你的本地 DSH 配置和运行环境。建议只在可信环境中配置,并定期检查权限。
第三,插件会运行在当前 dsh 进程权限内。安装前建议检查源码、依赖和许可证。
已核实许可证信息:
MIT
MIT © 2026 Fan Yuejin
第四,不要把它理解成 DSH 官方应用商店里的官方插件。这里的插件目录页是独立社区站点,与 DeepSeek / 幻方没有官方从属关系。
结尾¶
dsh-ext-vision-proxy 的价值不在于替换模型,而在于把外部视觉能力接入 DSH 会话,让 DeepSeek-V3 / DeepSeek-R1 这类 text-only 模型也能通过 vision_describe 工具处理图片。
如果你需要在 DSH 中稳定处理截图、图表和附件图片,可以按上面的步骤配置 Base URL、API Key,并测试连通性后再进入正式会话。
参考链接:
https://www.skillhub.cn/plugins/jin123-alpha/dsh-ext-vision-proxy
https://github.com/jin123-alpha/dsh-ext-vision-proxy