前言¶
純文本模型本身不能直接理解圖片。開發者如果希望在 DSH 中處理截圖、報錯圖、UI 分析、OCR 或文檔內容,通常需要額外接入視覺模型、配置 MCP 服務,並維護相關依賴。
dsh-free-vision 是一個面向 DeepSeek Harness(DSH)的免費視覺插件。它的目標是讓純文本模型獲得看圖能力,優先使用各平臺免費視覺模型,並提供零 MCP 配置的安裝方式。
下面介紹這個插件的定位、核心能力、安裝方式、典型用法和注意事項。
這是什麼¶
dsh-free-vision 是 DSH 免費視覺插件,由 FuzzySoul 維護,許可證爲 MIT。
它主要解決一個問題:讓純文本模型能夠查看圖片內容,例如截圖、報錯信息、UI 界面、OCR 文本和文檔內容。
插件優先使用各平臺免費視覺模型,並將視覺引擎 luma-mcp 作爲本包依賴內置,在進程內啓動,減少外部 MCP 配置。
核心功能¶
下面這些能力來自已覈實資料:
- 零 MCP 配置:視覺引擎
luma-mcp作爲本包依賴內置,進程內啓動。 - 單個通用工具:提供
image_understand,並註冊到ctx.tools;可通過config.toolName改名。 - 免費優先、多提供商:支持
qwen、volcengine、siliconflow、zhipu、hunyuan、custom。 - API Base URL 可覆蓋:每個 Provider 可覆蓋 API Base URL,可指向代理、API Gateway、本地服務或任意 OpenAI 兼容端點。
- 直連模式:子進程剝離代理環境變量,適合國內 API 直連;文檔說明帶代理可能導致
502。 - 任務模式:支持
auto | general | ocr | ui | debug | describe;大圖會自動多裁剪保真。 - 中英雙語:工具描述與文檔支持中英文。
- 設置界面:可配置 API Key、提供商、工具名等;配置保存到
~/.dsh/free-vision.json。
安裝與啓用¶
先執行安裝命令:
dsh plugin --profile web add dsh-free-vision
安裝完成後,重啓 dsh web。
重啓後,工具 image_understand 即可用。
典型用法¶
模型調用 image_understand 時,需要傳入以下參數:
image_source(必填):本地路徑、HTTP(S) URL 或 data URI;支持PNG/JPG/WebP/GIF,大小≤10MB。prompt(必填):對圖片的問題,中英文均可。task_type(可選):auto | general | ocr | ui | debug | describe。
下面是一個調用形態示例:
image_understand(
image_source="screenshot.png",
prompt="請判斷這張報錯截圖中的關鍵錯誤信息。",
task_type="debug"
)
這裏的 image_source、prompt 和 task_type 對應插件文檔中列出的工具參數。
配置方式¶
配置可以通過設置界面完成。
重啓 dsh web 後,打開 Settings → Free Vision,可以看到配置表單,包括 API Key、提供商、工具名等。保存後,下一次調用立即生效。
配置保存到:
~/.dsh/free-vision.json
也可以只設置對應環境變量。例如使用 qwen 時,可以設置:
DASHSCOPE_API_KEY
注意事項¶
使用前建議確認以下幾點:
apiKey可選;缺省時回退到提供商環境變量。baseURLs缺失或值爲空時,繼續使用該 Provider 的官方默認地址。- 圖片輸入限制爲
≤10MB,支持PNG/JPG/WebP/GIF。 - 直連模式會剝離代理環境變量;文檔說明帶代理可能導致
502。 - 免費額度數據來自各平臺官方頁面,可能變動,使用前請覈實。
- 插件以當前
dsh進程權限運行,安裝前應檢查源碼與許可證。 - 許可證爲 MIT,封裝
luma-mcp(MIT)與 MCP SDK(MIT)。
結尾¶
dsh-free-vision 適合需要在 DSH 中讓純文本模型查看截圖、報錯、UI、OCR 和文檔內容,並希望減少 MCP 配置的場景。
GitHub 倉庫地址:
https://github.com/FuzzySoul/dsh-free-vision