dsh-vision-provider:在 DeepSeek Harness Web UI 中選擇視覺模型組合

前言

在 DeepSeek Harness(DSH)的插件擴展方式中,Web UI 裏的模型選擇通常圍繞單個模型展開。做智能體流程時,常見訴求是讓 DeepSeek 負責推理、工具調用和最終回答,同時用外部視覺模型處理圖像輸入。dsh-vision-provider 是 DeepSeek Harness 的社區插件,由 libinyam 維護,採用 MIT 許可。它把已配置的視覺模型暴露爲 DeepSeek + Vision 下的可選組合:視覺模型做圖像分析,DeepSeek 繼續負責最終回答。

下面介紹它的定位、核心能力、安裝方式、配置項、典型用法和注意事項。

這是什麼

dsh-vision-provider 是一個 DeepSeek Harness adapter。它會讀取 Settings > Models 中聲明瞭 image 輸入的視覺模型,並讓每個視覺模型成爲 Web UI 中單獨可選的 DeepSeek 組合。

這不是 DeepSeek 的原生像素輸入,而是一個 two-model bridge。最終回答質量同時依賴視覺 sidecar 和 DeepSeek。視覺模型不作爲最終回答模型,DeepSeek 負責推理、工具調用和最終回答。

核心功能

  • DeepSeek + Vision provider 下提供可選擇的視覺模型組合。
  • 讀取 Settings > Models 中聲明 image 輸入的模型,並讓每個視覺模型成爲單獨可選的 DeepSeek 組合。
  • 純文本請求直接發送到 deepseek-official/deepseek-v4-flash
  • 帶圖像的請求由 Web UI 中選擇的視覺模型分析;視覺分析結果替換原始圖像後再交給 DeepSeek。
  • DeepSeek 負責推理、工具調用和最終回答。
  • 當前進程內重複工具步驟會複用已緩存的圖像分析。
  • 支持通過 Settings > Models 添加第三方視覺模型。
  • 支持直連 OpenAI-compatible 視覺端點 fallback。
  • 支持通過 DSH_VISION_USE_LEGACYDSH_VISION_BASE_URLDSH_VISION_MODELDSH_VISION_MODEL_NAMEDSH_VISION_API_KEY_ENV 環境變量配置直連端點。

安裝與啓用

先確認環境滿足以下條件:

  • DeepSeek Harness 0.1.0-rc.5 或兼容版本。
  • Node.js >=22.19.0
  • 已配置 DeepSeek API key。
  • Settings > Models 中至少有一個聲明 textimage 的模型,或可用直連 OpenAI-compatible 視覺端點。
  • pnpmdsh plugin 可用。

插件管理和啓動始終使用同一個 DSH_HOME

如果已有 installed dsh 命令,先設置 DSH_HOME,再添加插件並啓動 Web:

$env:DSH_HOME = "D:\dsh-home"

dsh plugin --profile web add github:libinyam/dsh-vision-provider
dsh web

如果從 DeepSeek Harness 源碼目錄運行,先設置 DSH_HOME,再通過 pnpm dsh 添加插件:

Set-Location D:\deepseek-harness
$env:DSH_HOME = "D:\dsh-home"

pnpm dsh plugin --profile web add github:libinyam/dsh-vision-provider
pnpm dsh web

配置密鑰

這個組合最終會使用兩類憑據:

  1. DeepSeek key:在 Settings > Models 中按 Harness 的 provider 配置方式配置。
  2. Vision key:直連 sidecar fallback 默認使用 VISION_OPENAI_API_KEY

在當前 PowerShell 窗口設置視覺 key 後啓動 Web:

$env:VISION_OPENAI_API_KEY = "your-vision-api-key"
pnpm dsh web

API key 不會寫入該倉庫或被插件記錄。插件會先向 Harness credential service 查詢配置引用,再回退到啓動進程環境。不要把密鑰本身寫入 settings.yaml

典型用法

發起帶圖提問

經過上面的安裝和配置後,按下面的步驟使用:

  1. 啓動或重啓 Web profile。
  2. 創建新會話。
  3. 選擇 DeepSeek + Vision
  4. 選擇你要使用的視覺模型,例如 GLM-4.6V-Flash
  5. 將圖片粘貼或拖入 composer。
  6. 輸入問題併發送。

純文本消息會完全跳過視覺端點,直接走 DeepSeek。

添加第三方視覺模型

如果需要新增一個可被選擇的視覺模型,可以在 Web UI 中維護模型配置:

  1. 打開 Settings > Models
  2. 添加或編輯第三方 provider。
  3. 填寫 provider ID、display name、protocol、endpoint 和 credential reference。
  4. 添加精確的視覺模型 ID 和 display name。
  5. 保存,然後打開 DeepSeek + Vision

插件只把聲明瞭 image 輸入能力的模型納入視覺目錄。自定義模型如果保持默認 input: [text],會被有意排除在視覺目錄外。

直連 OpenAI-compatible 視覺端點

也可以不依賴 Settings > Models 中的 provider 註冊,通過環境變量配置直連端點。啓動 Harness 前設置直連端點變量,再啓動 Web:

$env:DSH_VISION_USE_LEGACY = "your-value"
$env:DSH_VISION_BASE_URL = "your-base-url"
$env:DSH_VISION_MODEL = "your-model-id"
$env:DSH_VISION_MODEL_NAME = "your-display-name"
$env:DSH_VISION_API_KEY_ENV = "YOUR_API_KEY_ENV"
$env:YOUR_API_KEY_ENV = "your-api-key"
pnpm dsh web

這裏的直連 fallback 使用 fetch 直連,不經過 Harness provider retries 或 llm/stream middleware。

升級

如果需要更新插件,可以運行:

pnpm dsh plugin --profile web update dsh-vision-provider

適用場景與注意

適合使用 DSH Web profile 的開發者:希望 DeepSeek 保持最終回答模型,同時通過可選擇的視覺模型處理圖像輸入。

使用前注意:

  • 這是社區項目,不是 DeepSeek 或 OpenAI 官方包。
  • 這是 two-model bridge,不是 DeepSeek 原生像素輸入。
  • 最終回答質量同時依賴視覺 sidecar 和 DeepSeek。
  • 視覺模型不作爲最終回答模型,DeepSeek 負責最終回答。
  • 純文本消息完全跳過視覺端點。
  • 不要刪除仍希望選擇其視覺模型的 provider。
  • 不要把密鑰本身寫入 settings.yaml
  • 插件以當前 dsh 進程權限運行,安裝前應檢查源碼與許可證。
  • DSH 社區目錄是獨立站點,與 DeepSeek / 幻方無官方從屬關係。

鏈接

  • 目錄頁:https://www.skillhub.cn/plugins/libinyam/dsh-vision-provider
  • GitHub:https://github.com/libinyam/dsh-vision-provider
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜