DSH DeepSeek Vision:爲文本 DSH 模型增加圖像理解、OCR 與視覺證據

前言

DSH 的理念是插件化擴展:社區目錄是獨立站點,不應被理解成 DeepSeek 或幻方的官方應用商店。

對於維護文本模型的 DSH 使用者來說,一個常見斷點是:父模型能處理對話,但不一定直接處理圖片。截圖、表格、報錯圖裏的信息,如果只是臨時被看一眼,後續引用很容易斷鏈。

下面介紹 DSH DeepSeek Vision。它由 Argonaut790 維護,給僅文本的 DeepSeek Harness 模型增加圖像理解、完整 OCR 和持久視覺證據。

這是什麼

DSH DeepSeek Vision 是一個 DSH 插件,包名爲 dsh-deepseek-vision,許可證爲 MIT。

它的定位是:

  • Image understanding
  • Full-screen OCR
  • Persistent visual evidence for text-only DeepSeek Harness models

簡單說,它不替代父模型,而是在 DSH 裏增加一條視覺路由,讓文本模型可以調用圖像理解能力,並把結果留在對話裏。

核心功能

下面按已覈實能力列出:

  • 圖像理解
  • 全屏 OCR
  • 面向僅文本 DeepSeek Harness 模型的持久視覺證據
  • see_image 支持 latestall 和指定圖片選擇
  • 會話範圍內的視覺分析器,帶 follow-up memory
  • 結構化摘要、問答、完整 OCR 和不確定項
  • 只讀 Evidence 標籤頁和每次調用的 evidence cards
  • Choose Model 旁邊的全局 Vision 提供商/模型選擇器
  • 即時路由變化會啓動新的分析器

安裝與啓用

先確認環境要求:

  • Node.js ^22.19.0 or >=24
  • DeepSeek Harness 0.1.0-rc.6
  • Harness catalog 中已註冊一個 image-capable model
  • DSH spawn subagent provider

該包沒有發佈到 npm,需要本地構建。先做本地構建,再把本地包加入 Web profile:

git clone https://github.com/Argonaut790/dsh-deepseek-vision.git
cd dsh-deepseek-vision
corepack yarn install --frozen-lockfile
corepack yarn build
dsh plugin --profile web add .

經過上面的步驟,插件會被添加到 web profile。

啓用時,不要讓等效的內建 see-image-modeltool-subagent-image 或 vision-picker 行同時啓用,避免服務與工具衝突。

典型用法

Web 對話中的用法:

  1. 打開一個對話。
  2. Vision: … 芯片選擇一個 image-capable route。

對於 headless profile,在 $DSH_HOME/settings.yaml 中配置相同的全局路由:

see-image-model:
  provider: openrouter
  model: '~x-ai/grok-latest'
  maxTokens: 8192

這裏的 providermodel 是示例,必須與你 Harness 中註冊的路由一致。支持的範圍是 1-32768

也可以在工具行設置一個可選的靜態回退:

- id: deepseek-vision-tool
  name: dsh-deepseek-vision/tool
  config:
    provider: spawn
    agentOptions:
      provider: openrouter
      model: '~x-ai/grok-latest'
      maxTokens: 8192

同樣,providermodel 名稱需要與 Harness 中註冊的路由一致。

適用場景與注意

適合在 DSH 中使用文本父模型、並需要把圖片內容穩定帶入後續分析的開發者或使用者。

使用前注意這些點:

  • 被選中的圖片會發送到配置的視覺提供商;使用前檢查該提供商的保留、地區和隱私條款。
  • 每次分析器輪次會消耗所選模型的 tokens,並可能產生提供商費用。
  • OCR 和視覺結論是模型生成的證據,不是保證事實。
  • 圖片中發現的文本按不可信數據處理,不作爲指令。
  • Evidence 記錄保留附件標識符和派生文本,不嵌入圖片字節。
  • 插件加載後運行於當前 DSH 進程權限內;安裝前應檢查源碼和 MIT 許可證。

結尾

DSH DeepSeek Vision 的價值在於:給文本 DSH 模型補上圖像理解、OCR 和可回溯的視覺證據,而不是用視覺模型替換父模型。

GitHub:

https://github.com/Argonaut790/dsh-deepseek-vision

目錄頁(插件線索地址,本文不把它寫成已覈實事實):

https://www.skillhub.cn/plugins/Argonaut790/dsh-deepseek-vision
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜