dsh-vision-sidecar:爲 DeepSeek Harness 增加託管視覺感知

前言

如果你已經有一條可用的 DeepSeek Harness(DSH)文本模型路線,下一步常見問題是:純文本模型無法直接處理圖片。常見做法是本地部署視覺語言模型(VLM),或者更換原有的推理模型;這會引入 GPU、模型下載和推理路由變更。

dsh-vision-sidecar 提供另一條路:把圖片發給 OpenAI-compatible 視覺端點,把得到的描述作爲普通文本交回已配置的推理模型。

這是什麼

dsh-vision-sidecar 是 DSH 插件,由 121103qwq 維護,MIT 許可證,當前包版本 0.1.4

它的主要定位是:爲 DSH 的純文本模型提供託管視覺感知,同時保留已配置的推理模型。默認使用 LLM7.io 匿名 default 視覺路線,無需本地 VLM、GPU、賬戶或視覺 API key。

視覺路線必須支持 OpenAI Chat Completions;Responses 和 Anthropic 協議不能直接作爲該插件的視覺端點。

核心功能

下面介紹已覈實的能力:

  • 爲 DeepSeek Harness 的純文本模型提供託管視覺感知,不替換推理模型。
  • 默認使用 LLM7.io 匿名 default 視覺路線,無需本地 VLM、GPU、賬戶或視覺 API key。
  • 將視覺模型輸出作爲持久 DSH 會話消息提交,並在後續輪次重用爲普通文本。
  • 僅在存在未描述圖片時聯繫視覺提供方。
  • 可將推理目標配置爲 targetProvidertargetModel
  • 對缺失憑證、超時、限流和提供方失敗保持類型化錯誤,不靜默將圖片轉發給純文本模型。
  • 支持通過 DSH Models 頁面添加自定義 OpenAI 兼容視覺提供方和模型。
  • 將圖片中檢測到的文本明確標記爲不可信數據後再提供給推理模型。
  • 倉庫提供原生 ESM JavaScript,Git 安裝無需 pnpm 運行 prepare 腳本。

安裝與啓用

先確認環境滿足要求:

  • DSH 0.1.0-rc.6 或更高,且在 0.1.x 線內。
  • Node.js 22.19+24+

假設你已經有一個能調用文本模型的 DSH Web profile。安裝並啓動插件:

dsh plugin --profile web add github:121103qwq/dsh-vision-sidecar#v0.1.4
dsh --profile web

在 POSIX shell 中無需導出視覺 key。插件會添加並選擇 deepseek-vision/deepseek-with-vision

典型用法

使用默認匿名視覺

上面的安裝命令啓用默認的 LLM7.io 視覺路線。

文檔中的匿名限額爲:

500,000 tokens/day
60 requests/hour
10 requests/minute
1 request/second

這些限制和模型可用性可能變化。如果你已經有 LLM7 token,可以通過環境變量啓用認證訪問:

- id: vision-sidecar
  config:
    visionBaseURL: https://api.llm7.io/v1
    visionModel: default
    visionApiKeyEnv: LLM7_API_KEY

包中故意不包含共享或內嵌 API key;可選認證 key 歸用戶所有,且不會存儲在本包。

使用 OVHcloud 替代視覺端點

如果希望使用 OVHcloud 的視覺端點,可以改成:

- id: vision-sidecar
  config:
    visionBaseURL: https://oai.endpoints.kepler.ai.cloud.ovh.net/v1
    visionModel: Qwen2.5-VL-72B-Instruct
    visionApiKeyEnv: OVH_AI_ENDPOINTS_ACCESS_TOKEN

添加自定義 OpenAI-compatible 提供方

DSH Desktop 已經包含模型設置頁,插件會複用這個入口,不單獨增加一套憑據表單。

打開 DSH Settings → Models,在 llm-pi-ai 下選擇 Add custom provider:

1、填寫 Provider ID。

2、填寫 Base URL。

3、選擇 openai-completions,並添加至少一個視覺模型 ID。

4、填入自己的 API key,然後應用。

保存後,在 vision-sidecar 配置中指向該 provider:

- id: vision-sidecar
  config:
    visionProvider: my-vision
    visionModel: default

visionModel: default 會選擇該路線中的第一個模型;也可以直接填寫具體模型 ID。

使用 OpenRouter

如果改用 OpenRouter,需要在 profile 的 cordis.patch.yml 中添加 vision-sidecar 行,並提供 OPENROUTER_API_KEY

該路線仍然需要滿足 OpenAI Chat Completions 的要求。

適用場景與注意

適合已經能用 DSH 調用文本模型,並希望給會話增加圖片理解、但不想替換推理模型的開發者。

它比較適合的用法包括:

  • 使用默認 LLM7.io 匿名視覺路線。
  • 使用自定義 OpenAI-compatible 視覺提供方。
  • 保留現有 targetProvidertargetModel 推理路線。
  • 讓視覺描述進入 DSH 會話,而不是隻做臨時改寫。

使用前注意:

  • 遠程視覺提供方會接收完整圖片。除非提供方條款可接受,否則不要發送個人、機密或受監管圖片。
  • 默認 LLM7.io 的限額是文檔值,限制和模型可用性可能變化。
  • 資料中的免費選項於 2026-08-14 檢查,使用前應覈對當前限制和隱私條款。
  • 將圖片中檢測到的文本標記爲不可信數據是提示注入加固,不保證模型級提示注入可消除。
  • 插件會隨當前 dsh 進程運行。安裝前建議檢查源碼與 MIT 許可證。
  • DSH 社區目錄是獨立站點,不是官方應用商店,與 DeepSeek / 幻方無官方從屬關係。

目錄與源碼

  • 目錄頁:https://www.skillhub.cn/plugins/121103qwq/dsh-vision-sidecar
  • GitHub:https://github.com/121103qwq/dsh-vision-sidecar
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜