前言¶
在 DSH 工作流中,純文本 LLM 本身不能直接理解圖片。如果每次都要手動調用外部視覺模型,再把描述粘貼回對話,流程會比較零散。dsh-plugin-mm-vision 把這件事做成 DSH 插件:調用配置的視覺模型,把圖片翻譯成緊湊的結構化空間文字,再由文本模型基於這段文字做後續分析。
這是什麼¶
dsh-plugin-mm-vision 是 Elohia 提供的 DeepSeek Harness 插件,許可證爲 MIT。它定位爲“通感編碼器(Synesthesia Encoder)”,主要給任何純文本 LLM 增加看圖能力:插件註冊 mm_vision 工具,模型在對話中可調用該工具,把圖片轉成結構化文字描述。
核心功能¶
通感編碼¶
插件把圖片轉成座標化文字描述,適用於 K線圖、盤面截圖、報告圖表、UI 截圖和自然照片。描述會盡量保留關鍵元素的位置信息,方便純文本模型在後續分析中判斷空間關係。
像素級座標¶
關鍵元素會帶精確 (x%,y%) 百分比座標,便於文本模型判斷元素在畫布中的相對位置。
可選像素網格¶
當 prompt 中出現“像素/重建/還原”關鍵詞時,插件可輸出 40×30 色塊網格(RGB)。
模式自適應¶
auto 模式下,插件自動識別圖表(座標優先)或自然圖(構圖主體)。也可以手動指定 brief、full、coords、pixel。
緩存與配置¶
TTL 內重複分析可秒回,默認 600s / 100 條。模型、baseUrl、API key 可配置,支持任意 OpenAI 兼容視覺模型。
安裝與啓用¶
1、先確保已安裝 DSH CLI,並初始化過 profile。
2、執行安裝命令:
dsh plugin --profile web add dsh-plugin-mm-vision
3、--profile web 可換成你自己的 profile 名。重啓 DSH 後生效。
配置¶
配置可來自 cordis.patch.yml、環境變量或 config.json。
常用環境變量如下:
export MM_VISION_API_KEY=...
export MM_VISION_MODEL=qwen-vl-max
export MM_VISION_BASE_URL=...
其中 MM_VISION_MODEL 默認 qwen-vl-max;MM_VISION_BASE_URL 可選。若要接入其他視覺模型,可配置 OpenAI 兼容視覺模型服務的模型名和 baseUrl。
典型用法¶
安裝後,在對話中直接讓模型看圖:
分析這張K線圖 F:/data/kline.png
幫我看看 examples/chart.png 裏按鈕的位置
掃描這張圖片並重建像素網格 examples/photo.png
模型會自動調用 mm_vision 工具,返回結構化通感編碼文本。
適用場景與注意¶
適合這些場景:
- 已有 DSH 或純文本 LLM 工作流,需要補充圖片理解能力。
- 需要分析 K線圖、盤面截圖、報告圖表、UI 截圖或自然照片。
- 希望視覺模型輸出以結構化文本形式進入對話,由文本模型繼續分析。
使用前需要注意:
- 插件只把圖片發送到配置的視覺模型做描述。
- 插件從不執行圖片內容中的命令。
- 返回文本是注入對話的內容,應按不可信輸入對待。
- 插件以當前
dsh進程權限運行;安裝前建議檢查源碼和 MIT 許可證。 - 運行環境要求 Node
>=18。 scripts/ascii_dot.py爲可選像素點陣生成器(Python/PIL)。
結尾¶
dsh-plugin-mm-vision 的價值在於把“圖片轉結構化文字”這一步收進 DSH 插件流程,讓純文本 LLM 能基於返回文字繼續分析位置、佈局和圖表內容。
- 目錄頁:
https://www.skillhub.cn/plugins/Elohia/dsh-plugin-mm-vision - GitHub:
https://github.com/Elohia/dsh-plugin-mm-vision