dsh-vision-sidecar:为 DeepSeek Harness 增加托管视觉感知

前言

如果你已经有一条可用的 DeepSeek Harness(DSH)文本模型路线,下一步常见问题是:纯文本模型无法直接处理图片。常见做法是本地部署视觉语言模型(VLM),或者更换原有的推理模型;这会引入 GPU、模型下载和推理路由变更。

dsh-vision-sidecar 提供另一条路:把图片发给 OpenAI-compatible 视觉端点,把得到的描述作为普通文本交回已配置的推理模型。

这是什么

dsh-vision-sidecar 是 DSH 插件,由 121103qwq 维护,MIT 许可证,当前包版本 0.1.4

它的主要定位是:为 DSH 的纯文本模型提供托管视觉感知,同时保留已配置的推理模型。默认使用 LLM7.io 匿名 default 视觉路线,无需本地 VLM、GPU、账户或视觉 API key。

视觉路线必须支持 OpenAI Chat Completions;Responses 和 Anthropic 协议不能直接作为该插件的视觉端点。

核心功能

下面介绍已核实的能力:

  • 为 DeepSeek Harness 的纯文本模型提供托管视觉感知,不替换推理模型。
  • 默认使用 LLM7.io 匿名 default 视觉路线,无需本地 VLM、GPU、账户或视觉 API key。
  • 将视觉模型输出作为持久 DSH 会话消息提交,并在后续轮次重用为普通文本。
  • 仅在存在未描述图片时联系视觉提供方。
  • 可将推理目标配置为 targetProvidertargetModel
  • 对缺失凭证、超时、限流和提供方失败保持类型化错误,不静默将图片转发给纯文本模型。
  • 支持通过 DSH Models 页面添加自定义 OpenAI 兼容视觉提供方和模型。
  • 将图片中检测到的文本明确标记为不可信数据后再提供给推理模型。
  • 仓库提供原生 ESM JavaScript,Git 安装无需 pnpm 运行 prepare 脚本。

安装与启用

先确认环境满足要求:

  • DSH 0.1.0-rc.6 或更高,且在 0.1.x 线内。
  • Node.js 22.19+24+

假设你已经有一个能调用文本模型的 DSH Web profile。安装并启动插件:

dsh plugin --profile web add github:121103qwq/dsh-vision-sidecar#v0.1.4
dsh --profile web

在 POSIX shell 中无需导出视觉 key。插件会添加并选择 deepseek-vision/deepseek-with-vision

典型用法

使用默认匿名视觉

上面的安装命令启用默认的 LLM7.io 视觉路线。

文档中的匿名限额为:

500,000 tokens/day
60 requests/hour
10 requests/minute
1 request/second

这些限制和模型可用性可能变化。如果你已经有 LLM7 token,可以通过环境变量启用认证访问:

- id: vision-sidecar
  config:
    visionBaseURL: https://api.llm7.io/v1
    visionModel: default
    visionApiKeyEnv: LLM7_API_KEY

包中故意不包含共享或内嵌 API key;可选认证 key 归用户所有,且不会存储在本包。

使用 OVHcloud 替代视觉端点

如果希望使用 OVHcloud 的视觉端点,可以改成:

- id: vision-sidecar
  config:
    visionBaseURL: https://oai.endpoints.kepler.ai.cloud.ovh.net/v1
    visionModel: Qwen2.5-VL-72B-Instruct
    visionApiKeyEnv: OVH_AI_ENDPOINTS_ACCESS_TOKEN

添加自定义 OpenAI-compatible 提供方

DSH Desktop 已经包含模型设置页,插件会复用这个入口,不单独增加一套凭据表单。

打开 DSH Settings → Models,在 llm-pi-ai 下选择 Add custom provider:

1、填写 Provider ID。

2、填写 Base URL。

3、选择 openai-completions,并添加至少一个视觉模型 ID。

4、填入自己的 API key,然后应用。

保存后,在 vision-sidecar 配置中指向该 provider:

- id: vision-sidecar
  config:
    visionProvider: my-vision
    visionModel: default

visionModel: default 会选择该路线中的第一个模型;也可以直接填写具体模型 ID。

使用 OpenRouter

如果改用 OpenRouter,需要在 profile 的 cordis.patch.yml 中添加 vision-sidecar 行,并提供 OPENROUTER_API_KEY

该路线仍然需要满足 OpenAI Chat Completions 的要求。

适用场景与注意

适合已经能用 DSH 调用文本模型,并希望给会话增加图片理解、但不想替换推理模型的开发者。

它比较适合的用法包括:

  • 使用默认 LLM7.io 匿名视觉路线。
  • 使用自定义 OpenAI-compatible 视觉提供方。
  • 保留现有 targetProvidertargetModel 推理路线。
  • 让视觉描述进入 DSH 会话,而不是只做临时改写。

使用前注意:

  • 远程视觉提供方会接收完整图片。除非提供方条款可接受,否则不要发送个人、机密或受监管图片。
  • 默认 LLM7.io 的限额是文档值,限制和模型可用性可能变化。
  • 资料中的免费选项于 2026-08-14 检查,使用前应核对当前限制和隐私条款。
  • 将图片中检测到的文本标记为不可信数据是提示注入加固,不保证模型级提示注入可消除。
  • 插件会随当前 dsh 进程运行。安装前建议检查源码与 MIT 许可证。
  • DSH 社区目录是独立站点,不是官方应用商店,与 DeepSeek / 幻方无官方从属关系。

目录与源码

  • 目录页:https://www.skillhub.cn/plugins/121103qwq/dsh-vision-sidecar
  • GitHub:https://github.com/121103qwq/dsh-vision-sidecar
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜