前言¶
在 DSH 工作流中,纯文本 LLM 本身不能直接理解图片。如果每次都要手动调用外部视觉模型,再把描述粘贴回对话,流程会比较零散。dsh-plugin-mm-vision 把这件事做成 DSH 插件:调用配置的视觉模型,把图片翻译成紧凑的结构化空间文字,再由文本模型基于这段文字做后续分析。
这是什么¶
dsh-plugin-mm-vision 是 Elohia 提供的 DeepSeek Harness 插件,许可证为 MIT。它定位为“通感编码器(Synesthesia Encoder)”,主要给任何纯文本 LLM 增加看图能力:插件注册 mm_vision 工具,模型在对话中可调用该工具,把图片转成结构化文字描述。
核心功能¶
通感编码¶
插件把图片转成坐标化文字描述,适用于 K线图、盘面截图、报告图表、UI 截图和自然照片。描述会尽量保留关键元素的位置信息,方便纯文本模型在后续分析中判断空间关系。
像素级坐标¶
关键元素会带精确 (x%,y%) 百分比坐标,便于文本模型判断元素在画布中的相对位置。
可选像素网格¶
当 prompt 中出现“像素/重建/还原”关键词时,插件可输出 40×30 色块网格(RGB)。
模式自适应¶
auto 模式下,插件自动识别图表(坐标优先)或自然图(构图主体)。也可以手动指定 brief、full、coords、pixel。
缓存与配置¶
TTL 内重复分析可秒回,默认 600s / 100 条。模型、baseUrl、API key 可配置,支持任意 OpenAI 兼容视觉模型。
安装与启用¶
1、先确保已安装 DSH CLI,并初始化过 profile。
2、执行安装命令:
dsh plugin --profile web add dsh-plugin-mm-vision
3、--profile web 可换成你自己的 profile 名。重启 DSH 后生效。
配置¶
配置可来自 cordis.patch.yml、环境变量或 config.json。
常用环境变量如下:
export MM_VISION_API_KEY=...
export MM_VISION_MODEL=qwen-vl-max
export MM_VISION_BASE_URL=...
其中 MM_VISION_MODEL 默认 qwen-vl-max;MM_VISION_BASE_URL 可选。若要接入其他视觉模型,可配置 OpenAI 兼容视觉模型服务的模型名和 baseUrl。
典型用法¶
安装后,在对话中直接让模型看图:
分析这张K线图 F:/data/kline.png
帮我看看 examples/chart.png 里按钮的位置
扫描这张图片并重建像素网格 examples/photo.png
模型会自动调用 mm_vision 工具,返回结构化通感编码文本。
适用场景与注意¶
适合这些场景:
- 已有 DSH 或纯文本 LLM 工作流,需要补充图片理解能力。
- 需要分析 K线图、盘面截图、报告图表、UI 截图或自然照片。
- 希望视觉模型输出以结构化文本形式进入对话,由文本模型继续分析。
使用前需要注意:
- 插件只把图片发送到配置的视觉模型做描述。
- 插件从不执行图片内容中的命令。
- 返回文本是注入对话的内容,应按不可信输入对待。
- 插件以当前
dsh进程权限运行;安装前建议检查源码和 MIT 许可证。 - 运行环境要求 Node
>=18。 scripts/ascii_dot.py为可选像素点阵生成器(Python/PIL)。
结尾¶
dsh-plugin-mm-vision 的价值在于把“图片转结构化文字”这一步收进 DSH 插件流程,让纯文本 LLM 能基于返回文字继续分析位置、布局和图表内容。
- 目录页:
https://www.skillhub.cn/plugins/Elohia/dsh-plugin-mm-vision - GitHub:
https://github.com/Elohia/dsh-plugin-mm-vision