前言¶
DSH(DeepSeek Harness)採用“一切皆插件”的方式擴展能力。社區目錄是獨立站點,與 DeepSeek / 幻方無官方從屬關係,也不等同於官方應用商店。
對只使用純文本模型的 agent 來說,圖片通常不能直接進入上下文。如果要讓模型看圖、讀圖中文字、定位界面元素,往往需要額外接入視覺後端。dsh-img 是 DeepSeek Harness 插件,目標是給純文本模型提供 analyze_image 圖片問答、OCR 和佈局理解,以及 vision_ground 目標元素定位;同時提供一組免 key 的本地像素工具。
下面介紹它的核心能力、安裝方式和使用邊界。
這是什麼¶
- 插件標識:
gmleong/dsh-img - 定位:DeepSeek Harness 視覺插件,給純文本模型增加圖片理解能力
- 許可證:MIT
- 運行前提:Node.js >= 20,且已安裝 dsh 本體
這個插件既可以通過視覺後端處理圖片,也可以調用本地像素工具完成部分圖片處理。視覺後端默認接智譜 GLM-4V-Flash,備選通義 Qwen-VL,也支持 Ollama 本地視覺模型與任意 OpenAI 兼容視覺端點。
核心能力¶
視覺後端工具¶
如果使用需要 API key 的視覺後端,key 必須注入 dsh 進程。
analyze_image:用於圖片問答、OCR 和佈局理解vision_ground:用於目標元素定位
免 key 本地像素工具¶
以下本地像素工具無需 key:
vision_cropvision_pixel_diffvision_colorsvision_ocrvision_tracevision_extract_foreground
後端、緩存與運行環境¶
- 支持
preset單後端配置 - 支持
backends多後端自動回退 - 識別結果按圖片內容和問題 hash 緩存到
~/.dsh/dsh-img-cache/ - web 設置頁可可視化修改
preset和填寫apiKey - 支持
dsh --profile headless下使用工具 - 支持
.png .jpg .jpeg .webp .gif .bmp
安裝與啓用¶
先確認當前環境滿足 Node.js >= 20,並且 dsh 本體已經可用。插件會以當前 dsh 進程權限運行,安裝前建議檢查源碼與許可證。
安裝到 web profile¶
下面命令把 dsh-img 安裝到 ~/.dsh/profiles/web 對應的 profile:
cd ~/.dsh/profiles/web && pnpm add dsh-img --registry https://registry.npmjs.org
配置視覺後端 key¶
如果只使用本地像素工具,可以不配置 key。如果使用需要 API key 的視覺後端工具,需要準備對應 API key。下面以默認智譜 GLM-4V-Flash 的 ZHIPU_API_KEY 爲例:
export ZHIPU_API_KEY=your-key-here
這個 key 必須注入 dsh 進程。只在當前 shell 中 export,不一定對已經運行的 dsh 進程生效。
重啓 dsh web¶
重啓後,讓 dsh 進程攜帶 key 啓動:
pkill -f "dsh web"
ZHIPU_API_KEY=your-key-here dsh web
headless profile¶
如果要在 dsh --profile headless 下使用,先在該 profile 安裝一次:
dsh plugin --profile headless add dsh-img
之後在 dsh --profile headless 下即可使用工具。本地像素工具無需 key;識圖類工具可按需使用 Ollama 本地視覺模型或 API key。
後端與配置¶
可以在 cordis.patch.yml 中配置後端。單後端使用 preset,多後端回退使用 backends 列表。
preset: ollama:使用本地 Ollama 視覺模型backends:配置多後端回退鏈
如果使用 API key 後端,key 需要注入 dsh 進程;web 設置頁也可填寫 apiKey。
典型用法¶
圖片問答¶
經過上面的安裝步驟,新建會話後,可以直接貼圖進對話框,也可以對 agent 說:
用 analyze_image 看一下 ./screenshot.png 裏寫了什麼
本地像素工具¶
本地像素工具無需 key。經過上面的步驟後,可在會話中按需調用 vision_crop、vision_pixel_diff、vision_colors、vision_ocr、vision_trace、vision_extract_foreground。
目標元素定位¶
如果需要讓 agent 找到圖片中的某個目標元素,可讓其調用 vision_ground。
設置頁¶
web 設置頁可可視化修改 preset 和填寫 apiKey。
適用邊界與注意¶
下面這些邊界來自插件說明,選型時先看是否匹配:
vision_trace:不適合彩色插畫、照片或有漸變的圖vision_extract_foreground:適合均勻背景,不適合複雜背景、紋理背景vision_pixel_diff:適合同尺寸 UI 截圖、設計稿還原度比對vision_ocr:適合印刷體文字、屏幕截圖文字;手寫體、藝術字識別率可能下降
其他注意:
- API key 必須注入 dsh 進程;本地像素工具無需 key
- 識別結果會緩存到
~/.dsh/dsh-img-cache/ - 支持
.png .jpg .jpeg .webp .gif .bmp - README 排錯提到舊版 <=0.2.3 存在雙實例 bug,可用下面命令升級:
pnpm add dsh-img@latest
- 舊會話可能被舊 bug 毒化,新建會話即可
參考鏈接¶
- GitHub:https://github.com/gmleong/dsh-img
- 目錄頁:https://www.skillhub.cn/plugins/gmleong/dsh-img
目錄頁爲社區目錄頁面,不等同於官方應用商店。