前言¶
如果你已经有一条可用的 DeepSeek Harness(DSH)文本模型路线,下一步常见问题是:纯文本模型无法直接处理图片。常见做法是本地部署视觉语言模型(VLM),或者更换原有的推理模型;这会引入 GPU、模型下载和推理路由变更。
dsh-vision-sidecar 提供另一条路:把图片发给 OpenAI-compatible 视觉端点,把得到的描述作为普通文本交回已配置的推理模型。
这是什么¶
dsh-vision-sidecar 是 DSH 插件,由 121103qwq 维护,MIT 许可证,当前包版本 0.1.4。
它的主要定位是:为 DSH 的纯文本模型提供托管视觉感知,同时保留已配置的推理模型。默认使用 LLM7.io 匿名 default 视觉路线,无需本地 VLM、GPU、账户或视觉 API key。
视觉路线必须支持 OpenAI Chat Completions;Responses 和 Anthropic 协议不能直接作为该插件的视觉端点。
核心功能¶
下面介绍已核实的能力:
- 为 DeepSeek Harness 的纯文本模型提供托管视觉感知,不替换推理模型。
- 默认使用 LLM7.io 匿名
default视觉路线,无需本地 VLM、GPU、账户或视觉 API key。 - 将视觉模型输出作为持久 DSH 会话消息提交,并在后续轮次重用为普通文本。
- 仅在存在未描述图片时联系视觉提供方。
- 可将推理目标配置为
targetProvider和targetModel。 - 对缺失凭证、超时、限流和提供方失败保持类型化错误,不静默将图片转发给纯文本模型。
- 支持通过 DSH Models 页面添加自定义 OpenAI 兼容视觉提供方和模型。
- 将图片中检测到的文本明确标记为不可信数据后再提供给推理模型。
- 仓库提供原生 ESM JavaScript,Git 安装无需 pnpm 运行 prepare 脚本。
安装与启用¶
先确认环境满足要求:
- DSH
0.1.0-rc.6或更高,且在0.1.x线内。 - Node.js
22.19+或24+。
假设你已经有一个能调用文本模型的 DSH Web profile。安装并启动插件:
dsh plugin --profile web add github:121103qwq/dsh-vision-sidecar#v0.1.4
dsh --profile web
在 POSIX shell 中无需导出视觉 key。插件会添加并选择 deepseek-vision/deepseek-with-vision。
典型用法¶
使用默认匿名视觉¶
上面的安装命令启用默认的 LLM7.io 视觉路线。
文档中的匿名限额为:
500,000 tokens/day
60 requests/hour
10 requests/minute
1 request/second
这些限制和模型可用性可能变化。如果你已经有 LLM7 token,可以通过环境变量启用认证访问:
- id: vision-sidecar
config:
visionBaseURL: https://api.llm7.io/v1
visionModel: default
visionApiKeyEnv: LLM7_API_KEY
包中故意不包含共享或内嵌 API key;可选认证 key 归用户所有,且不会存储在本包。
使用 OVHcloud 替代视觉端点¶
如果希望使用 OVHcloud 的视觉端点,可以改成:
- id: vision-sidecar
config:
visionBaseURL: https://oai.endpoints.kepler.ai.cloud.ovh.net/v1
visionModel: Qwen2.5-VL-72B-Instruct
visionApiKeyEnv: OVH_AI_ENDPOINTS_ACCESS_TOKEN
添加自定义 OpenAI-compatible 提供方¶
DSH Desktop 已经包含模型设置页,插件会复用这个入口,不单独增加一套凭据表单。
打开 DSH Settings → Models,在 llm-pi-ai 下选择 Add custom provider:
1、填写 Provider ID。
2、填写 Base URL。
3、选择 openai-completions,并添加至少一个视觉模型 ID。
4、填入自己的 API key,然后应用。
保存后,在 vision-sidecar 配置中指向该 provider:
- id: vision-sidecar
config:
visionProvider: my-vision
visionModel: default
visionModel: default 会选择该路线中的第一个模型;也可以直接填写具体模型 ID。
使用 OpenRouter¶
如果改用 OpenRouter,需要在 profile 的 cordis.patch.yml 中添加 vision-sidecar 行,并提供 OPENROUTER_API_KEY。
该路线仍然需要满足 OpenAI Chat Completions 的要求。
适用场景与注意¶
适合已经能用 DSH 调用文本模型,并希望给会话增加图片理解、但不想替换推理模型的开发者。
它比较适合的用法包括:
- 使用默认 LLM7.io 匿名视觉路线。
- 使用自定义 OpenAI-compatible 视觉提供方。
- 保留现有
targetProvider和targetModel推理路线。 - 让视觉描述进入 DSH 会话,而不是只做临时改写。
使用前注意:
- 远程视觉提供方会接收完整图片。除非提供方条款可接受,否则不要发送个人、机密或受监管图片。
- 默认 LLM7.io 的限额是文档值,限制和模型可用性可能变化。
- 资料中的免费选项于 2026-08-14 检查,使用前应核对当前限制和隐私条款。
- 将图片中检测到的文本标记为不可信数据是提示注入加固,不保证模型级提示注入可消除。
- 插件会随当前 dsh 进程运行。安装前建议检查源码与 MIT 许可证。
- DSH 社区目录是独立站点,不是官方应用商店,与 DeepSeek / 幻方无官方从属关系。
目录与源码¶
- 目录页:
https://www.skillhub.cn/plugins/121103qwq/dsh-vision-sidecar - GitHub:
https://github.com/121103qwq/dsh-vision-sidecar