dsh-vision:爲 DeepSeek Harness 補上近原生的圖像理解

前言

DeepSeek Harness(DSH)把模型、工具、路由都做成可插拔組件,主模型選 deepseek-official 這類純文本模型時,Composer 裏拖入的圖片往往無法被直接理解。常見做法是手動 OCR,或換用另一套支持多模態的客戶端,任務上下文也要跟着改。

下面介紹社區插件 oil-oil/dsh-vision。它在不替換 Harness 主模型的前提下,爲文本模型接上獨立的視覺識別鏈路;若主模型本身支持圖像,則原圖直傳,不做額外預處理。

這是什麼

dsh-visionoil-oil 維護,歸類爲模型推理,MIT 許可,當前版本 0.1.2。倉庫:github.com/oil-oil/dsh-vision,SkillHub 目錄頁:skillhub.cn/plugins/oil-oil/dsh-vision

一句話定位:Near-native image understanding for DeepSeek Harness——讓 Harness 在文本主模型下也能處理圖片附件,體驗儘量接近原生多模態。

核心功能

路由邏輯

插件按主模型能力分流,不替換 Harness 裏選定的主模型:

主模型 圖片路徑 最終回答
支持圖像 原圖直傳,無預處理或 OCR 當前模型
deepseek-official 或其他純文本模型 配置的視覺模型觀察原圖,輸出作爲不可信附件上下文注入 DeepSeek
雲端視覺不可用 回退到 macOS Vision 或 Tesseract DeepSeek

多張圖片會一起分析,便於對比和綜合證據;用戶任務原文轉發,不套固定報告模板。

視覺後端配置

安裝後,Settings → Plugins → Plugin configuration 會出現 Vision Recognition 卡片。可選 ZenMux、Alibaba Cloud Model Studio、TokenDance、OpenRouter,填寫 API Key,並可改模型 ID、API 端點、圖片數量上限。

API Key 經 Harness 官方憑證服務存儲,瀏覽器端只寫不讀:插件能報告 Key 是否存在,但不會把 Key 讀回頁面、對話、設置文檔或會話日誌。

Automatic 則跳過插件管理的雲端憑證,依次嘗試 Harness 裏已配置的多模態模型、see 兼容的私有配置,以及本地 OCR。Harness 自定義模型須聲明 image 輸入模態,否則仍視爲文本模型。

see-skill 兼容與本地回退

Harness 沒有可用視覺模型時,插件會讀取 ~/.config/see/config.env,支持 ZenMux、Alibaba Cloud Model Studio、OpenRouter、TokenDance;環境變量可覆蓋私有配置文件:

export SEE_PROVIDER=zenmux
export ZENMUX_API_KEY=your-key

無雲端 Key 或全部雲端路由失敗時:

  • macOS:內置 Vision OCR,無額外依賴
  • Linux / Windows:Tesseract(需安裝對應語言包)

本地回退以 OCR 爲主,不等同於完整多模態理解。

安全邊界

  • 原圖僅發往用戶配置的視覺服務
  • 視覺輸出標記爲不可信觀察數據,圖中指令不獲得系統權限
  • 生成的視覺上下文隻影響當前模型請求,不重寫消息歷史
  • API Key 經 Harness 憑證或 see 私有配置解析,不寫入插件倉庫

安裝與啓用

DeepSeek Harness 仍處於 Developer Preview。本插件支持 0.1.0-rc.60.1.0-rc.7

用 Harness 內置插件管理器安裝:

npx @deepseek-ai/dsh plugin --profile web add github:oil-oil/dsh-vision

重啓 Harness 後,在 Composer 中照常粘貼或拖入圖片即可。插件會替換官方 deepseek-official 適配器,同時保留其模型目錄、設置與憑證。

典型用法

界面配置(推薦)

  1. 執行上述安裝命令並重啓 Harness
  2. 打開 Settings → Plugins → Plugin configuration → Vision Recognition
  3. 選擇視覺後端並填寫 API Key(或選 Automatic 走 Harness 已有路由)
  4. 回到 Composer,拖入圖片並輸入任務,例如「對比這兩張截圖裏的表格差異」

多張附件會一併送入視覺鏈路,主模型仍是你選定的 DeepSeek 文本模型。

高級文件配置

多數場景用 UI 即可。等效的非密鑰字段寫在 $DSH_HOME/settings.yamlllm-deepseek 段:

llm-deepseek:
  visionBackend: zenmux
  visionBackendModel: qwen/qwen3.7-plus
  visionBackendBaseURL: https://zenmux.ai/api/v1
  maxImages: 8

不要把 API Key 寫進該文件;在 Vision Recognition 卡片保存,或設置對應環境變量。修改後無需重啓。

適用場景與注意

適合誰

  • 主模型固定爲 deepseek-official 或其他純文本 DeepSeek 模型,但對話裏經常帶截圖、圖表、照片
  • 已在 Harness 或 see 生態裏配置了 ZenMux、Model Studio 等視覺後端,希望複用同一套 Key
  • 需要多張圖片聯合分析,又不想換客戶端或手寫 OCR 流程

使用前請知悉

  • 插件以當前 DSH 進程權限運行;安裝前請閱讀 源碼MIT 許可證
  • SkillHub 爲社區目錄,與 DeepSeek / 幻方無官方從屬關係
  • 本地 OCR 回退能力有限,複雜視覺推理仍依賴雲端多模態模型
  • 開發環境要求 Node >=22.19(見 package.json

結尾

dsh-vision 把「文本主模型 + 獨立視覺橋接 + 原生多模態直傳」三條路徑收進一個 Harness 插件:該直傳時直傳,該橋接時用不可信觀察上下文補全,雲端不可用時還有本地 OCR 兜底。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜