前言¶
如果你已經有一條可用的 DeepSeek Harness(DSH)文本模型路線,下一步常見問題是:純文本模型無法直接處理圖片。常見做法是本地部署視覺語言模型(VLM),或者更換原有的推理模型;這會引入 GPU、模型下載和推理路由變更。
dsh-vision-sidecar 提供另一條路:把圖片發給 OpenAI-compatible 視覺端點,把得到的描述作爲普通文本交回已配置的推理模型。
這是什麼¶
dsh-vision-sidecar 是 DSH 插件,由 121103qwq 維護,MIT 許可證,當前包版本 0.1.4。
它的主要定位是:爲 DSH 的純文本模型提供託管視覺感知,同時保留已配置的推理模型。默認使用 LLM7.io 匿名 default 視覺路線,無需本地 VLM、GPU、賬戶或視覺 API key。
視覺路線必須支持 OpenAI Chat Completions;Responses 和 Anthropic 協議不能直接作爲該插件的視覺端點。
核心功能¶
下面介紹已覈實的能力:
- 爲 DeepSeek Harness 的純文本模型提供託管視覺感知,不替換推理模型。
- 默認使用 LLM7.io 匿名
default視覺路線,無需本地 VLM、GPU、賬戶或視覺 API key。 - 將視覺模型輸出作爲持久 DSH 會話消息提交,並在後續輪次重用爲普通文本。
- 僅在存在未描述圖片時聯繫視覺提供方。
- 可將推理目標配置爲
targetProvider和targetModel。 - 對缺失憑證、超時、限流和提供方失敗保持類型化錯誤,不靜默將圖片轉發給純文本模型。
- 支持通過 DSH Models 頁面添加自定義 OpenAI 兼容視覺提供方和模型。
- 將圖片中檢測到的文本明確標記爲不可信數據後再提供給推理模型。
- 倉庫提供原生 ESM JavaScript,Git 安裝無需 pnpm 運行 prepare 腳本。
安裝與啓用¶
先確認環境滿足要求:
- DSH
0.1.0-rc.6或更高,且在0.1.x線內。 - Node.js
22.19+或24+。
假設你已經有一個能調用文本模型的 DSH Web profile。安裝並啓動插件:
dsh plugin --profile web add github:121103qwq/dsh-vision-sidecar#v0.1.4
dsh --profile web
在 POSIX shell 中無需導出視覺 key。插件會添加並選擇 deepseek-vision/deepseek-with-vision。
典型用法¶
使用默認匿名視覺¶
上面的安裝命令啓用默認的 LLM7.io 視覺路線。
文檔中的匿名限額爲:
500,000 tokens/day
60 requests/hour
10 requests/minute
1 request/second
這些限制和模型可用性可能變化。如果你已經有 LLM7 token,可以通過環境變量啓用認證訪問:
- id: vision-sidecar
config:
visionBaseURL: https://api.llm7.io/v1
visionModel: default
visionApiKeyEnv: LLM7_API_KEY
包中故意不包含共享或內嵌 API key;可選認證 key 歸用戶所有,且不會存儲在本包。
使用 OVHcloud 替代視覺端點¶
如果希望使用 OVHcloud 的視覺端點,可以改成:
- id: vision-sidecar
config:
visionBaseURL: https://oai.endpoints.kepler.ai.cloud.ovh.net/v1
visionModel: Qwen2.5-VL-72B-Instruct
visionApiKeyEnv: OVH_AI_ENDPOINTS_ACCESS_TOKEN
添加自定義 OpenAI-compatible 提供方¶
DSH Desktop 已經包含模型設置頁,插件會複用這個入口,不單獨增加一套憑據表單。
打開 DSH Settings → Models,在 llm-pi-ai 下選擇 Add custom provider:
1、填寫 Provider ID。
2、填寫 Base URL。
3、選擇 openai-completions,並添加至少一個視覺模型 ID。
4、填入自己的 API key,然後應用。
保存後,在 vision-sidecar 配置中指向該 provider:
- id: vision-sidecar
config:
visionProvider: my-vision
visionModel: default
visionModel: default 會選擇該路線中的第一個模型;也可以直接填寫具體模型 ID。
使用 OpenRouter¶
如果改用 OpenRouter,需要在 profile 的 cordis.patch.yml 中添加 vision-sidecar 行,並提供 OPENROUTER_API_KEY。
該路線仍然需要滿足 OpenAI Chat Completions 的要求。
適用場景與注意¶
適合已經能用 DSH 調用文本模型,並希望給會話增加圖片理解、但不想替換推理模型的開發者。
它比較適合的用法包括:
- 使用默認 LLM7.io 匿名視覺路線。
- 使用自定義 OpenAI-compatible 視覺提供方。
- 保留現有
targetProvider和targetModel推理路線。 - 讓視覺描述進入 DSH 會話,而不是隻做臨時改寫。
使用前注意:
- 遠程視覺提供方會接收完整圖片。除非提供方條款可接受,否則不要發送個人、機密或受監管圖片。
- 默認 LLM7.io 的限額是文檔值,限制和模型可用性可能變化。
- 資料中的免費選項於 2026-08-14 檢查,使用前應覈對當前限制和隱私條款。
- 將圖片中檢測到的文本標記爲不可信數據是提示注入加固,不保證模型級提示注入可消除。
- 插件會隨當前 dsh 進程運行。安裝前建議檢查源碼與 MIT 許可證。
- DSH 社區目錄是獨立站點,不是官方應用商店,與 DeepSeek / 幻方無官方從屬關係。
目錄與源碼¶
- 目錄頁:
https://www.skillhub.cn/plugins/121103qwq/dsh-vision-sidecar - GitHub:
https://github.com/121103qwq/dsh-vision-sidecar