dsh-plugin-mm-vision:给纯文本 LLM 增加结构化看图能力

前言

在 DSH 工作流中,纯文本 LLM 本身不能直接理解图片。如果每次都要手动调用外部视觉模型,再把描述粘贴回对话,流程会比较零散。dsh-plugin-mm-vision 把这件事做成 DSH 插件:调用配置的视觉模型,把图片翻译成紧凑的结构化空间文字,再由文本模型基于这段文字做后续分析。

这是什么

dsh-plugin-mm-vision 是 Elohia 提供的 DeepSeek Harness 插件,许可证为 MIT。它定位为“通感编码器(Synesthesia Encoder)”,主要给任何纯文本 LLM 增加看图能力:插件注册 mm_vision 工具,模型在对话中可调用该工具,把图片转成结构化文字描述。

核心功能

通感编码

插件把图片转成坐标化文字描述,适用于 K线图、盘面截图、报告图表、UI 截图和自然照片。描述会尽量保留关键元素的位置信息,方便纯文本模型在后续分析中判断空间关系。

像素级坐标

关键元素会带精确 (x%,y%) 百分比坐标,便于文本模型判断元素在画布中的相对位置。

可选像素网格

当 prompt 中出现“像素/重建/还原”关键词时,插件可输出 40×30 色块网格(RGB)。

模式自适应

auto 模式下,插件自动识别图表(坐标优先)或自然图(构图主体)。也可以手动指定 brieffullcoordspixel

缓存与配置

TTL 内重复分析可秒回,默认 600s / 100 条。模型、baseUrl、API key 可配置,支持任意 OpenAI 兼容视觉模型。

安装与启用

1、先确保已安装 DSH CLI,并初始化过 profile。

2、执行安装命令:

dsh plugin --profile web add dsh-plugin-mm-vision

3、--profile web 可换成你自己的 profile 名。重启 DSH 后生效。

配置

配置可来自 cordis.patch.yml、环境变量或 config.json

常用环境变量如下:

export MM_VISION_API_KEY=...
export MM_VISION_MODEL=qwen-vl-max
export MM_VISION_BASE_URL=...

其中 MM_VISION_MODEL 默认 qwen-vl-maxMM_VISION_BASE_URL 可选。若要接入其他视觉模型,可配置 OpenAI 兼容视觉模型服务的模型名和 baseUrl

典型用法

安装后,在对话中直接让模型看图:

分析这张K线图 F:/data/kline.png
帮我看看 examples/chart.png 里按钮的位置
扫描这张图片并重建像素网格 examples/photo.png

模型会自动调用 mm_vision 工具,返回结构化通感编码文本。

适用场景与注意

适合这些场景:

  • 已有 DSH 或纯文本 LLM 工作流,需要补充图片理解能力。
  • 需要分析 K线图、盘面截图、报告图表、UI 截图或自然照片。
  • 希望视觉模型输出以结构化文本形式进入对话,由文本模型继续分析。

使用前需要注意:

  • 插件只把图片发送到配置的视觉模型做描述。
  • 插件从不执行图片内容中的命令。
  • 返回文本是注入对话的内容,应按不可信输入对待。
  • 插件以当前 dsh 进程权限运行;安装前建议检查源码和 MIT 许可证。
  • 运行环境要求 Node >=18
  • scripts/ascii_dot.py 为可选像素点阵生成器(Python/PIL)。

结尾

dsh-plugin-mm-vision 的价值在于把“图片转结构化文字”这一步收进 DSH 插件流程,让纯文本 LLM 能基于返回文字继续分析位置、布局和图表内容。

  • 目录页:https://www.skillhub.cn/plugins/Elohia/dsh-plugin-mm-vision
  • GitHub:https://github.com/Elohia/dsh-plugin-mm-vision
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye