前言¶
在 DSH 插件生态里,不少能力由社区插件补齐。dsh-tool-describe-image 是其中一项,面向“文本模型需要处理图片输入”的场景:通过任意 OpenAI 兼容视觉端点,把图片转成文字或结构化 HTML,再交给 DeepSeek 使用。
下面按 DSH 插件的方式介绍它:解决什么问题、怎么安装、怎么配置、典型用法,以及哪些限制需要提前知道。
这是什么¶
sala003/dsh-tool-describe-image 是一个 MIT 许可证的 DSH 插件,由 sala003 维护。它的定位是:让 DeepSeek 通过视觉端点“看见”图片,支持百炼 qwen-vl、智谱 GLM-4V、OpenRouter、自建代理等 OpenAI 兼容视觉端点。
它不是单独的视觉 API,而是把视觉端点接入 DSH:
- 通过工具调用把指定路径的图片转成文字描述。
- 在 Web 输入框粘贴图片后,自动识别并填入文本或 HTML。
- 通过
check_balance查询 DeepSeek 账户余额,含赠送/充值拆分。 - 提供一个可拖动、可切换表情、带状态气泡、与 Agent 状态联动的鲸鱼娘桌宠设置入口。
插件说明为“零源码改动”,完全通过 DSH 公开扩展点实现;包形态为单 npm 包,包含 host 半区和浏览器半区,双语文案可跟随 Web 界面语言切换。
核心功能¶
下面列的是已核实能力:
- 通过任意 OpenAI 兼容视觉端点,把图片转成文字或结构化 HTML。
- 零配置可进 DSH:不配 API key 也能正常启动,视觉功能可从设置窗补配。
- 自定义 Prompt 与输出格式:可选文本描述或结构化 HTML。
- Web 粘贴即识别:
Ctrl+V粘贴图片,自动识别成文字/HTML 填入输入框。 describe_image工具:模型按路径读取图片转成文字,Web / headless 可用。check_balance工具:查询 DeepSeek 账户余额,含赠送/充值拆分。- 悬浮鲸鱼娘桌宠:支持拖动、表情切换、状态气泡、Agent 状态联动。
安装与启用¶
先确认已安装 DSH,版本要求为 0.1.0-rc.6+。然后执行:
npm install -g dsh-tool-describe-image
dsh plugin --profile web add dsh-tool-describe-image
安装后启动 Web:
dsh web
如果从旧版升级,注意 0.5.0 存在打包缺陷,已由 0.5.1 修复。若装过 0.5.0 并出现:
Cannot read properties of undefined (reading 'prepare')
需先 remove 再装 0.5.1。
升级后必须重启 dsh 并刷新浏览器(Ctrl+F5)。
配置¶
最低要求是配置视觉 API key。可以用环境变量:
$env:DASHSCOPE_API_KEY = "sk-你的key"
也可以写入:
~/.dsh/profiles/web/.env
内容为:
DASHSCOPE_API_KEY=sk-你的key
注意:环境变量优先级高于凭据库。设置 DASHSCOPE_API_KEY 时,设置面板保存会提示环境变量遮蔽;直接改 .env 或环境变量即可。
也可以在 ~/.dsh/profiles/web/cordis.patch.yml 中覆盖模型,例如:
- insert:
- id: describe-image
name: 'dsh-tool-describe-image'
config:
model: qwen-vl-max
余额查询默认复用 DEEPSEEK_API_KEY,可通过 deepseekBaseUrl 覆盖端点。
典型用法¶
粘贴图片识别¶
1、任意截图 Ctrl+C。
2、在 DSH Web 输入框中 Ctrl+V。
3、识别后文字描述自动填入输入框。
4、回车发送。
按路径让模型描述¶
对模型说:
描述一下 C:\Users\你的用户名\Pictures\image.png
模型会自动调用 describe_image,再基于返回内容回答。
用鲸鱼娘桌宠配置¶
双击右下角鲸鱼娘,打开悬浮设置面板。可在面板中配置视觉 API,拖动位置并记忆。
查询 DeepSeek 余额¶
对模型说:
查一下我的 DeepSeek 余额
模型会自动调用 check_balance。也可以双击鲸鱼娘,在设置面板点「查余额」。
适用场景与注意¶
这个插件适合这些情况:
- 想在 DSH 的 Web 或 headless 场景里给文本模型加图片理解能力。
- 想接入任意 OpenAI 兼容视觉端点,而不绑定单一厂商。
- 希望在 DSH 内顺手查询 DeepSeek 账户余额。
- 希望不配置 key 时也能启动,后续从设置窗补配视觉功能。
使用前需要注意:
- 插件以当前
dsh进程权限运行,安装前应检查源码与许可证。当前许可证为 MIT。 - 仅支持 PNG / JPG / WebP / GIF,按字节检测,不信扩展名。
- 单张图片读取上限
8 MiB,HTTP 协作超时60000 ms。 - 未配置视觉 API key 时,可能报
DashScope API key missing。 - 升级后必须重启
dsh并刷新浏览器(Ctrl+F5)。
结尾¶
dsh-tool-describe-image 的价值比较集中:用视觉端点把图片变成文本或 HTML,让文本模型在 DSH 里继续处理;同时把配置入口放在 Web 端,降低临时接入成本。
项目仓库:
- GitHub:https://github.com/sala003/dsh-tool-describe-image