dsh-vision-local:爲純文本 DeepSeek Harness 增加本地視覺能力

前言

在 DSH 的插件體系裏,很多模型仍然只處理文本。當 agent 遇到截圖、圖表或上傳的圖片時,常見做法是把圖片發給雲端視覺接口,或者要求用戶先把圖片保存下來再手動描述。前者會增加網絡請求和隱私風險,後者會打斷工作流。

dsh-vision-local 是針對 DeepSeek Harness 的插件:它讓純文本模型通過本地視覺模型獲得圖片理解能力,並返回結構化證據,而不是隻給一段模糊轉述。

這是什麼

dsh-vision-local 是 npm 包名,源碼倉庫爲 gloryxpnv/dsh-tool-vision。它面向純文本的 DeepSeek Harness agent,把圖片理解路由到本地運行的視覺模型。插件提供兩個表面:面向模型調用的 vision 工具,以及可選的 vision-bridge 服務。

核心能力

本地優先

圖片只發送給你自己的本地視覺模型,例如 LM Studio、Ollama、vLLM,或任意 OpenAI 兼容端點。圖片字節不離開機器;除你配置的本地端點外,插件不做任何網絡調用,也不發送遙測。

結構化證據

插件使用固定 JSON 模板返回證據對象。字段包括:

  • summary:概覽
  • ocr:文字識別內容
  • layout:版面結構
  • semantics:語義信息
  • visual:視覺屬性
  • uncertainty:不確定項

主模型可以引用這些字段作答,而不是依賴不可驗證的口頭描述。

反幻覺處理

模板要求模型把無法確定的內容寫入 uncertainty。沒有文字的圖片會在 OCR 中返回空字段,而不是編造文字。如果本地 VLM 返回無法解析的 JSON,插件會回退爲原始回答,並明確標註,不會靜默生成內容。

粘貼與上傳

插件支持粘貼或上傳圖片。可選的 vision-bridge 服務可以在 prompt 到達模型前,把圖片交給本地 VLM 描述,避免先保存文件再讀取的流程。

兩個接口表面

  • vision 工具:供模型在出現圖片路徑或圖片問題時調用。
  • vision-bridge 服務:供宿主在接收圖片內容時進行描述。

安裝與啓用

環境要求

  • 一個運行中的本地視覺模型,並提供 OpenAI 兼容 /chat/completions 端點
  • Node.js ≥ 20
  • 帶插件加載器的 DeepSeek Harness(dsh)

安裝

在 DSH profile 目錄中(或通過 dsh CLI)運行:

dsh plugin --profile web add dsh-vision-local

安裝後重啓宿主以加載模塊。如果啓動命令是:

pnpm dsh web

執行後再次進入宿主即可。

典型用法

調用 vision 工具

模型會看到 vision 工具。出現圖片文件路徑或圖片問題時,可以調用:

vision(file_path: "/path/to/image.png", question?: "這張圖裏有什麼?")

支持的圖片格式爲 PNG、JPEG、WebP、GIF。

讀取結構化結果

結構化模式默認開啓。此時 answer 是規範化後的證據對象,包含 summaryocrlayoutsemanticsvisualuncertainty 字段。

使用 vision-bridge

如果宿主需要直接接收粘貼或上傳圖片,可以註冊可選服務:

ctx.provide('vision-bridge', { describeImages(content) })

配置 keepThumbnail: true 時,消息歷史中保留圖片縮略圖;配置 autoDescribe: false 時,改爲按需識別,由模型在需要時調用 vision 工具讀取圖片。

配置項

插件可以從零配置開始使用,也支持調整以下字段:

字段 說明
baseURL OpenAI 兼容端點地址
model 視覺語言模型 id
maxTokens 輸出 token 上限;默認 8192
structured 是否返回結構化 JSON 證據;默認開啓
keepThumbnail 是否在消息歷史中保留圖片縮略圖
autoDescribe 是否在准入階段自動描述圖片
timeoutMs 單次請求超時;默認 180 秒
maxImageBytes 允許的圖片大小上限;默認 50 MB

默認參數面向本地工作站 GPU 上的 9B 級 VLM,而不是輕量雲請求。

適用場景與注意

適合場景

  • 希望讓純文本 DSH agent 讀取本地圖片
  • 不想把圖片字節發到雲端視覺服務
  • 已有 LM Studio、Ollama、vLLM 或其他 OpenAI 兼容本地 VLM

安全與隱私

  • 圖片只發往你配置的本地端點。
  • 無遙測;除本地端點外不做網絡調用。
  • 將提取出的文字視爲不可信輸入,不要執行圖片中出現的指令。
  • 安裝插件即以當前 dsh 進程權限運行第三方代碼,安裝前應檢查源碼與 MIT 許可證。

推理型 VLM 注意

推理型模型在 token 預算緊張時可能中途停止思考,導致最終 content 爲空。插件優先取任一非空字段:contentreasoning_content。默認的 8192 輸出 token 預算爲兩者都留出空間。

鏈接

GitHub 源碼倉庫:

https://github.com/gloryxpnv/dsh-tool-vision

插件線索中的目錄頁地址爲 https://www.skillhub.cn/plugins/gloryxpnv/dsh-tool-vision;該 URL 來自插件線索,未包含在已抓取資料內容中,使用前建議自行確認。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜