dsh-tool-describe-image:给 DSH 增加图片理解能力

前言

在 DSH 插件生态里,不少能力由社区插件补齐。dsh-tool-describe-image 是其中一项,面向“文本模型需要处理图片输入”的场景:通过任意 OpenAI 兼容视觉端点,把图片转成文字或结构化 HTML,再交给 DeepSeek 使用。

下面按 DSH 插件的方式介绍它:解决什么问题、怎么安装、怎么配置、典型用法,以及哪些限制需要提前知道。

这是什么

sala003/dsh-tool-describe-image 是一个 MIT 许可证的 DSH 插件,由 sala003 维护。它的定位是:让 DeepSeek 通过视觉端点“看见”图片,支持百炼 qwen-vl、智谱 GLM-4V、OpenRouter、自建代理等 OpenAI 兼容视觉端点。

它不是单独的视觉 API,而是把视觉端点接入 DSH:

  • 通过工具调用把指定路径的图片转成文字描述。
  • 在 Web 输入框粘贴图片后,自动识别并填入文本或 HTML。
  • 通过 check_balance 查询 DeepSeek 账户余额,含赠送/充值拆分。
  • 提供一个可拖动、可切换表情、带状态气泡、与 Agent 状态联动的鲸鱼娘桌宠设置入口。

插件说明为“零源码改动”,完全通过 DSH 公开扩展点实现;包形态为单 npm 包,包含 host 半区和浏览器半区,双语文案可跟随 Web 界面语言切换。

核心功能

下面列的是已核实能力:

  • 通过任意 OpenAI 兼容视觉端点,把图片转成文字或结构化 HTML。
  • 零配置可进 DSH:不配 API key 也能正常启动,视觉功能可从设置窗补配。
  • 自定义 Prompt 与输出格式:可选文本描述或结构化 HTML。
  • Web 粘贴即识别:Ctrl+V 粘贴图片,自动识别成文字/HTML 填入输入框。
  • describe_image 工具:模型按路径读取图片转成文字,Web / headless 可用。
  • check_balance 工具:查询 DeepSeek 账户余额,含赠送/充值拆分。
  • 悬浮鲸鱼娘桌宠:支持拖动、表情切换、状态气泡、Agent 状态联动。

安装与启用

先确认已安装 DSH,版本要求为 0.1.0-rc.6+。然后执行:

npm install -g dsh-tool-describe-image
dsh plugin --profile web add dsh-tool-describe-image

安装后启动 Web:

dsh web

如果从旧版升级,注意 0.5.0 存在打包缺陷,已由 0.5.1 修复。若装过 0.5.0 并出现:

Cannot read properties of undefined (reading 'prepare')

需先 remove 再装 0.5.1

升级后必须重启 dsh 并刷新浏览器(Ctrl+F5)。

配置

最低要求是配置视觉 API key。可以用环境变量:

$env:DASHSCOPE_API_KEY = "sk-你的key"

也可以写入:

~/.dsh/profiles/web/.env

内容为:

DASHSCOPE_API_KEY=sk-你的key

注意:环境变量优先级高于凭据库。设置 DASHSCOPE_API_KEY 时,设置面板保存会提示环境变量遮蔽;直接改 .env 或环境变量即可。

也可以在 ~/.dsh/profiles/web/cordis.patch.yml 中覆盖模型,例如:

- insert:
    - id: describe-image
      name: 'dsh-tool-describe-image'
      config:
        model: qwen-vl-max

余额查询默认复用 DEEPSEEK_API_KEY,可通过 deepseekBaseUrl 覆盖端点。

典型用法

粘贴图片识别

1、任意截图 Ctrl+C
2、在 DSH Web 输入框中 Ctrl+V
3、识别后文字描述自动填入输入框。
4、回车发送。

按路径让模型描述

对模型说:

描述一下 C:\Users\你的用户名\Pictures\image.png

模型会自动调用 describe_image,再基于返回内容回答。

用鲸鱼娘桌宠配置

双击右下角鲸鱼娘,打开悬浮设置面板。可在面板中配置视觉 API,拖动位置并记忆。

查询 DeepSeek 余额

对模型说:

查一下我的 DeepSeek 余额

模型会自动调用 check_balance。也可以双击鲸鱼娘,在设置面板点「查余额」。

适用场景与注意

这个插件适合这些情况:

  • 想在 DSH 的 Web 或 headless 场景里给文本模型加图片理解能力。
  • 想接入任意 OpenAI 兼容视觉端点,而不绑定单一厂商。
  • 希望在 DSH 内顺手查询 DeepSeek 账户余额。
  • 希望不配置 key 时也能启动,后续从设置窗补配视觉功能。

使用前需要注意:

  • 插件以当前 dsh 进程权限运行,安装前应检查源码与许可证。当前许可证为 MIT。
  • 仅支持 PNG / JPG / WebP / GIF,按字节检测,不信扩展名。
  • 单张图片读取上限 8 MiB,HTTP 协作超时 60000 ms
  • 未配置视觉 API key 时,可能报 DashScope API key missing
  • 升级后必须重启 dsh 并刷新浏览器(Ctrl+F5)。

结尾

dsh-tool-describe-image 的价值比较集中:用视觉端点把图片变成文本或 HTML,让文本模型在 DSH 里继续处理;同时把配置入口放在 Web 端,降低临时接入成本。

项目仓库:

  • GitHub:https://github.com/sala003/dsh-tool-describe-image
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye