dsh-image-mmx:给 DSH 文本模型补上图片理解

前言

DSH 的插件体系强调「一切皆插件」。社区目录是独立站点,与 DeepSeek / 幻方无官方从属关系。对于使用 DeepSeek Harness 的文本模型,一个具体限制是 inputModalities 中没有 image,发送含图消息时会被拒绝。dsh-image-mmx 针对这个问题:会话里粘贴或发送图片后,自动调用 mmx(MiniMax VLM)识别,并把识别结果注入模型上下文。

这是什么

dsh-image-mmx 是由 fengs2021 维护的 DeepSeek Harness 插件,仓库路径为 fengs2021/dsh-image-mmx,许可证为 MIT。

一句话定位:给 DeepSeek Harness 的文本模型装一双眼睛:会话里粘贴/发送图片,自动调用 mmx(MiniMax VLM)识别,识别结果注入模型上下文——DeepSeek 等纯文本模型也能理解图片内容。

核心功能

下面介绍已核实的能力:

  • 文本模型(inputModalities 无 image)也能发送含图消息,不再报「当前模型不支持图片」
  • 图片落盘到会话工作区 .attachments/,自动执行 mmx vision describe(MiniMax VLM)
  • 图片块在模型可见面替换为 [图片N]:"<路径>" + mmx 识别文本(画面元素、布局、报错/代码/界面文字逐字保留)
  • 人类 transcript 照常渲染原图缩略图(可点击放大)
  • mmx 未安装/未认证/超时(60s)/格式不支持(gif)时降级为路径文本
  • 本身支持图片输入的模型走原生路径,不做任何处理
  • 多图支持:每张图独立并行识别,按 [图片1] [图片2]... 编号

安装与启用

先确认环境满足以下前置条件:

  • DeepSeek Harness 0.1.0-rc.6+
  • Node.js 18+
  • peerDependencies: @deepseek-ai/cordis ^4.0.1
  • 本机已安装并认证 mmx-cli(MiniMax 官方 CLI)

如果 mmx 未安装、未认证、识别超时(60s)或图片格式不支持(gif),插件会降级为路径文本。

安装命令:

dsh plugin --profile web add 'github:fengs2021/dsh-image-mmx'

典型用法

1、在 DSH Web 输入框粘贴或拖入图片,也可以配合 dsh-file-bridge 的附件按钮选图。

2、发送后,插件自动完成:图片落盘、调用 mmx 识别、模型直接读到识别结果并回复。

3、多图时,每张图独立并行识别,并按 [图片1] [图片2]... 编号。

适用场景与注意

适合:使用 DeepSeek 等纯文本模型的 DSH Web 会话,需要把截图、报错、代码或界面内容转成模型可读取的文本上下文。

注意:

  • 插件以当前 dsh 进程权限运行,安装前应检查源码与许可证。
  • 本身支持图片输入的模型会走原生路径,不做额外处理。
  • gif 等不支持格式、mmx 未安装/未认证、超时(60s)时,会降级为路径文本。
  • 社区目录是独立站点,与 DeepSeek / 幻方无官方从属关系。

结尾

dsh-image-mmx 的价值在于:用户侧仍看到图片缩略图,模型侧读取 mmx 的识别文本,文本模型因此能基于图片内容继续回复。

目录页:https://www.skillhub.cn/plugins/fengs2021/dsh-image-mmx

GitHub:https://github.com/fengs2021/dsh-image-mmx

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜