前言¶
在 DeepSeek Harness(DSH)里,如果主对话仍由纯文本大模型承担,本地图片常常无法直接参与推理:截图、订单页、Logo、代码图、文档图都需要另找入口处理。
tdf1995/dsh-plugin-vision 的思路是:不要求文本模型本身读图,而是通过 Gemini / GLM 免费视觉 API 完成图像描述、OCR 与视觉问答,再把结果交回 DSH 会话。
这是什么¶
一句话定位:它是面向 DSH 的视觉能力插件,为纯文本大模型补上本地图片理解能力。
仓库由 tdf1995 维护,许可证为 MIT。
核心功能¶
图像分析工具¶
see_image 用于分析本地图片,支持 png / jpg / jpeg / webp / gif,单张上限 20MB。
调用时可以自定义提问,例如询问商品、价格、配色,或要求做 OCR。
双提供商与路由¶
插件支持 Gemini 与 GLM 两类视觉提供商。
auto 模式会自动选择可用 Key 的提供商,并支持粘性路由、故障转移,以及 429 / 限流退避重试。
大图压缩¶
超过 4MB 的图片会自动压缩到最长边 1920px、JPEG 质量 85 后再上传。
该压缩依赖 pwsh + System.Drawing,仅 Windows 生效;其他平台自动回退原图。
Key 与状态¶
vision_set_key 用于在会话内保存提供商 API Key 至 DSH 凭据库,并立即生效。
vision_status 用于查看各提供商 Key 配置状态,不回显 Key 本身。
Web UI 图片输入¶
浏览器端支持 Ctrl+V 粘贴、拖入或点击图片按钮添加图片,并展示附件卡片。
安装与启用¶
前置要求:
Node.js >= 20
已部署 DeepSeek Harness (DSH)
至少一个 Gemini 或智谱 GLM 视觉 API Key
安装命令:
npm i -D dsh-plugin-vision
API Key 可以放在环境变量、~/.dsh/.credentials.yaml,或通过 vision_set_key 写入 DSH 凭据库。仓库本身不包含 API Key。
插件以当前 dsh 进程权限运行。安装前应检查源码、依赖与许可证。
典型用法¶
下面是文档示例,可直接作为对话输入:
帮我看看这张图 D:\work\screenshot.png
这张订单截图里商品是什么?多少钱?
用 GLM 分析 code/my/logo.png,描述一下配色
用 gemini-3.6-flash 看 baojia/data/purchased_items/xxx.jpg,做 OCR
前两个例子是直接给本地图片路径或围绕截图提问;第三个例子显式指定 GLM 提供商;第四个例子显式指定模型名并要求 OCR。
适用场景与注意¶
适合在 DSH 中使用纯文本大模型,但经常需要处理本地图片的开发者,例如截图解读、订单信息提取、Logo 配色分析、文档 OCR。
注意以下边界:
- 粘贴、拖入等浏览器输入能力只对 Web UI(
dsh web)生效;TUI 等无 Web 界面时这些功能会缺席。 /vision/save-image路由仅监听回环地址;即使如此,仍建议只在本机使用。- Gemini 在国内访问需要代理;智谱 GLM 可直连。
- 大图压缩只在 Windows 生效,其他平台会回退原图;使用时仍需满足
20MB读取上限。 - 这是社区插件,不应理解为 DeepSeek 或幻方官方应用商店中的官方能力。
结尾¶
如果你已经在 DSH 中使用纯文本大模型,但经常需要处理本地图片,dsh-plugin-vision 提供了一个直接的桥接方案:用外部视觉 API 完成读图,再把结果送回会话。
项目地址:
- GitHub: https://github.com/tdf1995/dsh-plugin-vision