前言¶
在 DeepSeek Harness(DSH)裏用純文本主模型(如 DeepSeek)聊天時,常見問題是主模型不認圖:要麼換多模態模型,要麼手動把截圖內容敲進對話。dsh-vision-opencode 走另一條路——聊天裏發圖時,先交給可配置的視覺模型轉成文字,主模型照常回復,不必切換主模型。
下面介紹這個插件的定位、能力與安裝配置方式。資料來自 SkillHub 目錄頁 與 GitHub 倉庫(維護者 poiuyjie,MIT 許可證,當前版本 0.4.2)。
這是什麼¶
dsh-vision-opencode 是 DSH 的 Web 端插件,分類爲模型推理。一句話定位:通過任意視覺模型,把圖片自動轉成文字,供純文本 LLM 使用。
插件會自動識別純文本主模型並接管圖片;若主模型本身支持多模態,則保留 DSH 原生鏈路,無需改模型目錄。
核心功能¶
聊天發圖自動轉換¶
在對話裏發送圖片時,插件將圖片交給所選識圖模型(如 MiMo-V2.5)轉成文字描述,再交給主模型繼續推理。輸入框右側提供「識圖模型」下拉,自動列出各供應商中支持圖片的模型。
Vision 設置與工具¶
在 設置 → Vision 可獨立管理識圖模型。插件還提供:
vision_read_image工具vision-image-analysisskill
可用於 OCR、圖表、截圖理解等場景。
異常兜底¶
單次請求 60 秒超時;失敗重試 1 次;重試耗盡後降級爲佔位文本,避免拖垮整個回合。
渠道狀態與推理策略¶
設置 → Vision 中,各渠道(提供方分組)名稱旁有狀態圓點,邏輯與官方「模型」頁一致:
- 已配置 API 密鑰(宿主路由的
apiKeyEnv或插件寫入的<PROVIDER>_API_KEY任一可用)顯示爲綠點 - 明確未配置密鑰顯示爲紅點
- 不顯示錶示狀態未知(如憑據服務不可用)
每個識圖模型可單獨設置「推理」策略:
| 選項 | 含義 |
|---|---|
| 默認 | 跟隨供應商默認檔位 |
| 關閉 | 不思考,更快更省;僅當供應商真實聲明 off 時提供 |
| 強制關閉 | 盡力關掉思考(如 reasoning_effort:"none"),不保證成功 |
各供應商對「關閉思考」的字段聲明不一致,插件只能盡力區分「關閉」與「強制關閉」並試參數,不保證每個供應商都能真正關掉。
安裝與啓用¶
推薦用 DSH 原生命令安裝:
dsh plugin --profile web add -w github:poiuyjie/dsh-vision-opencode
也可用一鍵腳本(Ubuntu 用 install.sh,Windows 用 install.ps1):
curl -fsSL https://raw.githubusercontent.com/poiuyjie/dsh-vision-opencode/main/scripts/install.sh | bash
安裝完成後重啓 dsh,在輸入框右側選擇識圖模型即可啓用。
卸載命令:
dsh plugin --profile web remove -w dsh-vision-opencode
也可使用倉庫中的 uninstall.sh。卸載前建議備份包含圖片的會話——卸載後這些舊會話可能無法再發給純文本主模型。
配置¶
編輯 ~/.dsh/settings.yaml,或在 設置 → Vision 圖形化管理:
vision-opencode:
provider: '' # 識圖模型供應商;空 = 未選擇
model: '' # 識圖模型 id;空 = 未選擇
autoConvert: true # 發圖自動轉換開關;出問題可改 false 關掉
若只想保留工具和選擇器、關閉自動轉換,將 autoConvert 設爲 false 後重啓即可。
典型用法¶
1、安裝插件並重啓 dsh。
2、在 設置 → Vision 選擇識圖模型的供應商與模型 id,或直接在輸入框右側「識圖模型」下拉中選擇。
3、確認對應渠道的 API 密鑰已配置(狀態圓點爲綠)。
4、在對話中發送圖片。插件自動調用識圖模型轉成文字,主模型基於轉換結果繼續回覆。
5、需要主動識圖時,可調用 vision_read_image 工具或使用 vision-image-analysis skill。
適用場景與注意¶
適合誰:
- 主模型固定爲純文本模型,但對話中偶爾需要發截圖、圖表、文檔圖片
- 希望識圖模型與主模型分離配置,按供應商切換而無需改主模型目錄
- 需要在 DSH 內做 OCR 或截圖理解,且希望通過工具 / skill 複用同一套識圖能力
注意事項:
- 插件以當前
dsh進程權限運行,安裝前應檢查 源碼 與 MIT 許可證 - 需要 Node.js >= 20.3;依賴
@deepseek-ai/dsh-llm、dsh-tools、dsh-settings等 peer 包(rc.6 及以上) - 圖片轉換異常或選擇器不出現,多半是識圖模型未選或版本差異,可查看瀏覽器控制檯報錯並在 GitHub 提 issue
- 純文本與多模態主模型會自動區分,切換供應商一般無需再改配置
鏈接¶
- 目錄頁:https://www.skillhub.cn/plugins/poiuyjie/dsh-vision-opencode
- GitHub:https://github.com/poiuyjie/dsh-vision-opencode
SkillHub 是面向中國用戶的 Skills 社區目錄,與 DeepSeek / 幻方無官方從屬關係。dsh-vision-opencode 的價值在於:在不換主模型的前提下,給純文本 LLM 補上可配置的識圖能力。