dsh-plugin-mm-vision:給純文本 LLM 增加結構化看圖能力

前言

在 DSH 工作流中,純文本 LLM 本身不能直接理解圖片。如果每次都要手動調用外部視覺模型,再把描述粘貼回對話,流程會比較零散。dsh-plugin-mm-vision 把這件事做成 DSH 插件:調用配置的視覺模型,把圖片翻譯成緊湊的結構化空間文字,再由文本模型基於這段文字做後續分析。

這是什麼

dsh-plugin-mm-vision 是 Elohia 提供的 DeepSeek Harness 插件,許可證爲 MIT。它定位爲“通感編碼器(Synesthesia Encoder)”,主要給任何純文本 LLM 增加看圖能力:插件註冊 mm_vision 工具,模型在對話中可調用該工具,把圖片轉成結構化文字描述。

核心功能

通感編碼

插件把圖片轉成座標化文字描述,適用於 K線圖、盤面截圖、報告圖表、UI 截圖和自然照片。描述會盡量保留關鍵元素的位置信息,方便純文本模型在後續分析中判斷空間關係。

像素級座標

關鍵元素會帶精確 (x%,y%) 百分比座標,便於文本模型判斷元素在畫布中的相對位置。

可選像素網格

當 prompt 中出現“像素/重建/還原”關鍵詞時,插件可輸出 40×30 色塊網格(RGB)。

模式自適應

auto 模式下,插件自動識別圖表(座標優先)或自然圖(構圖主體)。也可以手動指定 brieffullcoordspixel

緩存與配置

TTL 內重複分析可秒回,默認 600s / 100 條。模型、baseUrl、API key 可配置,支持任意 OpenAI 兼容視覺模型。

安裝與啓用

1、先確保已安裝 DSH CLI,並初始化過 profile。

2、執行安裝命令:

dsh plugin --profile web add dsh-plugin-mm-vision

3、--profile web 可換成你自己的 profile 名。重啓 DSH 後生效。

配置

配置可來自 cordis.patch.yml、環境變量或 config.json

常用環境變量如下:

export MM_VISION_API_KEY=...
export MM_VISION_MODEL=qwen-vl-max
export MM_VISION_BASE_URL=...

其中 MM_VISION_MODEL 默認 qwen-vl-maxMM_VISION_BASE_URL 可選。若要接入其他視覺模型,可配置 OpenAI 兼容視覺模型服務的模型名和 baseUrl

典型用法

安裝後,在對話中直接讓模型看圖:

分析這張K線圖 F:/data/kline.png
幫我看看 examples/chart.png 裏按鈕的位置
掃描這張圖片並重建像素網格 examples/photo.png

模型會自動調用 mm_vision 工具,返回結構化通感編碼文本。

適用場景與注意

適合這些場景:

  • 已有 DSH 或純文本 LLM 工作流,需要補充圖片理解能力。
  • 需要分析 K線圖、盤面截圖、報告圖表、UI 截圖或自然照片。
  • 希望視覺模型輸出以結構化文本形式進入對話,由文本模型繼續分析。

使用前需要注意:

  • 插件只把圖片發送到配置的視覺模型做描述。
  • 插件從不執行圖片內容中的命令。
  • 返回文本是注入對話的內容,應按不可信輸入對待。
  • 插件以當前 dsh 進程權限運行;安裝前建議檢查源碼和 MIT 許可證。
  • 運行環境要求 Node >=18
  • scripts/ascii_dot.py 爲可選像素點陣生成器(Python/PIL)。

結尾

dsh-plugin-mm-vision 的價值在於把“圖片轉結構化文字”這一步收進 DSH 插件流程,讓純文本 LLM 能基於返回文字繼續分析位置、佈局和圖表內容。

  • 目錄頁:https://www.skillhub.cn/plugins/Elohia/dsh-plugin-mm-vision
  • GitHub:https://github.com/Elohia/dsh-plugin-mm-vision
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜