dsh-vision-opencode:爲純文本主模型配置可切換的識圖模型

前言

在 DeepSeek Harness(DSH)裏用純文本主模型(如 DeepSeek)聊天時,常見問題是主模型不認圖:要麼換多模態模型,要麼手動把截圖內容敲進對話。dsh-vision-opencode 走另一條路——聊天裏發圖時,先交給可配置的視覺模型轉成文字,主模型照常回復,不必切換主模型。

下面介紹這個插件的定位、能力與安裝配置方式。資料來自 SkillHub 目錄頁GitHub 倉庫(維護者 poiuyjie,MIT 許可證,當前版本 0.4.2)。

這是什麼

dsh-vision-opencode 是 DSH 的 Web 端插件,分類爲模型推理。一句話定位:通過任意視覺模型,把圖片自動轉成文字,供純文本 LLM 使用。

插件會自動識別純文本主模型並接管圖片;若主模型本身支持多模態,則保留 DSH 原生鏈路,無需改模型目錄。

核心功能

聊天發圖自動轉換

在對話裏發送圖片時,插件將圖片交給所選識圖模型(如 MiMo-V2.5)轉成文字描述,再交給主模型繼續推理。輸入框右側提供「識圖模型」下拉,自動列出各供應商中支持圖片的模型。

Vision 設置與工具

在 設置 → Vision 可獨立管理識圖模型。插件還提供:

  • vision_read_image 工具
  • vision-image-analysis skill

可用於 OCR、圖表、截圖理解等場景。

異常兜底

單次請求 60 秒超時;失敗重試 1 次;重試耗盡後降級爲佔位文本,避免拖垮整個回合。

渠道狀態與推理策略

設置 → Vision 中,各渠道(提供方分組)名稱旁有狀態圓點,邏輯與官方「模型」頁一致:

  • 已配置 API 密鑰(宿主路由的 apiKeyEnv 或插件寫入的 <PROVIDER>_API_KEY 任一可用)顯示爲綠點
  • 明確未配置密鑰顯示爲紅點
  • 不顯示錶示狀態未知(如憑據服務不可用)

每個識圖模型可單獨設置「推理」策略:

選項 含義
默認 跟隨供應商默認檔位
關閉 不思考,更快更省;僅當供應商真實聲明 off 時提供
強制關閉 盡力關掉思考(如 reasoning_effort:"none"),不保證成功

各供應商對「關閉思考」的字段聲明不一致,插件只能盡力區分「關閉」與「強制關閉」並試參數,不保證每個供應商都能真正關掉。

安裝與啓用

推薦用 DSH 原生命令安裝:

dsh plugin --profile web add -w github:poiuyjie/dsh-vision-opencode

也可用一鍵腳本(Ubuntu 用 install.sh,Windows 用 install.ps1):

curl -fsSL https://raw.githubusercontent.com/poiuyjie/dsh-vision-opencode/main/scripts/install.sh | bash

安裝完成後重啓 dsh,在輸入框右側選擇識圖模型即可啓用。

卸載命令:

dsh plugin --profile web remove -w dsh-vision-opencode

也可使用倉庫中的 uninstall.sh。卸載前建議備份包含圖片的會話——卸載後這些舊會話可能無法再發給純文本主模型。

配置

編輯 ~/.dsh/settings.yaml,或在 設置 → Vision 圖形化管理:

vision-opencode:
  provider: ''       # 識圖模型供應商;空 = 未選擇
  model: ''          # 識圖模型 id;空 = 未選擇
  autoConvert: true  # 發圖自動轉換開關;出問題可改 false 關掉

若只想保留工具和選擇器、關閉自動轉換,將 autoConvert 設爲 false 後重啓即可。

典型用法

1、安裝插件並重啓 dsh

2、在 設置 → Vision 選擇識圖模型的供應商與模型 id,或直接在輸入框右側「識圖模型」下拉中選擇。

3、確認對應渠道的 API 密鑰已配置(狀態圓點爲綠)。

4、在對話中發送圖片。插件自動調用識圖模型轉成文字,主模型基於轉換結果繼續回覆。

5、需要主動識圖時,可調用 vision_read_image 工具或使用 vision-image-analysis skill。

適用場景與注意

適合誰:

  • 主模型固定爲純文本模型,但對話中偶爾需要發截圖、圖表、文檔圖片
  • 希望識圖模型與主模型分離配置,按供應商切換而無需改主模型目錄
  • 需要在 DSH 內做 OCR 或截圖理解,且希望通過工具 / skill 複用同一套識圖能力

注意事項:

  • 插件以當前 dsh 進程權限運行,安裝前應檢查 源碼 與 MIT 許可證
  • 需要 Node.js >= 20.3;依賴 @deepseek-ai/dsh-llmdsh-toolsdsh-settings 等 peer 包(rc.6 及以上)
  • 圖片轉換異常或選擇器不出現,多半是識圖模型未選或版本差異,可查看瀏覽器控制檯報錯並在 GitHub 提 issue
  • 純文本與多模態主模型會自動區分,切換供應商一般無需再改配置

鏈接

SkillHub 是面向中國用戶的 Skills 社區目錄,與 DeepSeek / 幻方無官方從屬關係。dsh-vision-opencode 的價值在於:在不換主模型的前提下,給純文本 LLM 補上可配置的識圖能力。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜