dsh-plugin-vision:为 DSH 文本模型接入 Gemini / GLM 视觉能力

前言

在 DeepSeek Harness(DSH)里,如果主对话仍由纯文本大模型承担,本地图片常常无法直接参与推理:截图、订单页、Logo、代码图、文档图都需要另找入口处理。

tdf1995/dsh-plugin-vision 的思路是:不要求文本模型本身读图,而是通过 Gemini / GLM 免费视觉 API 完成图像描述、OCR 与视觉问答,再把结果交回 DSH 会话。

这是什么

一句话定位:它是面向 DSH 的视觉能力插件,为纯文本大模型补上本地图片理解能力。

仓库由 tdf1995 维护,许可证为 MIT

核心功能

图像分析工具

see_image 用于分析本地图片,支持 png / jpg / jpeg / webp / gif,单张上限 20MB

调用时可以自定义提问,例如询问商品、价格、配色,或要求做 OCR。

双提供商与路由

插件支持 Gemini 与 GLM 两类视觉提供商。

auto 模式会自动选择可用 Key 的提供商,并支持粘性路由、故障转移,以及 429 / 限流退避重试。

大图压缩

超过 4MB 的图片会自动压缩到最长边 1920px、JPEG 质量 85 后再上传。

该压缩依赖 pwsh + System.Drawing,仅 Windows 生效;其他平台自动回退原图。

Key 与状态

vision_set_key 用于在会话内保存提供商 API Key 至 DSH 凭据库,并立即生效。

vision_status 用于查看各提供商 Key 配置状态,不回显 Key 本身。

Web UI 图片输入

浏览器端支持 Ctrl+V 粘贴、拖入或点击图片按钮添加图片,并展示附件卡片。

安装与启用

前置要求:

Node.js >= 20
已部署 DeepSeek Harness (DSH)
至少一个 Gemini 或智谱 GLM 视觉 API Key

安装命令:

npm i -D dsh-plugin-vision

API Key 可以放在环境变量、~/.dsh/.credentials.yaml,或通过 vision_set_key 写入 DSH 凭据库。仓库本身不包含 API Key。

插件以当前 dsh 进程权限运行。安装前应检查源码、依赖与许可证。

典型用法

下面是文档示例,可直接作为对话输入:

帮我看看这张图 D:\work\screenshot.png
这张订单截图里商品是什么?多少钱?
用 GLM 分析 code/my/logo.png,描述一下配色
用 gemini-3.6-flash 看 baojia/data/purchased_items/xxx.jpg,做 OCR

前两个例子是直接给本地图片路径或围绕截图提问;第三个例子显式指定 GLM 提供商;第四个例子显式指定模型名并要求 OCR。

适用场景与注意

适合在 DSH 中使用纯文本大模型,但经常需要处理本地图片的开发者,例如截图解读、订单信息提取、Logo 配色分析、文档 OCR。

注意以下边界:

  • 粘贴、拖入等浏览器输入能力只对 Web UI(dsh web)生效;TUI 等无 Web 界面时这些功能会缺席。
  • /vision/save-image 路由仅监听回环地址;即使如此,仍建议只在本机使用。
  • Gemini 在国内访问需要代理;智谱 GLM 可直连。
  • 大图压缩只在 Windows 生效,其他平台会回退原图;使用时仍需满足 20MB 读取上限。
  • 这是社区插件,不应理解为 DeepSeek 或幻方官方应用商店中的官方能力。

结尾

如果你已经在 DSH 中使用纯文本大模型,但经常需要处理本地图片,dsh-plugin-vision 提供了一个直接的桥接方案:用外部视觉 API 完成读图,再把结果送回会话。

项目地址:

  • GitHub: https://github.com/tdf1995/dsh-plugin-vision
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye