前言¶
DeepSeek Harness(DSH)的扩展能力以插件形式接入。当 DeepSeek 模型需要处理图片任务时,通常需要额外接入视觉模型或图像生成服务。dsh-vision-imagen 是 xuxun-oss 维护的 DSH 插件,用于桥接 Google Gemini 的多模态识别与图像生成,并支持部分 OpenAI 兼容后端。
下面介绍它的定位、能力、安装方式与注意事项。
这是什么¶
dsh-vision-imagen 是一个 MIT 许可证的 DSH 插件,包名为 dsh-vision-imagen,版本为 1.3.0。
它解决的是一个具体需求:在常规 DeepSeek 会话中,需要看图、生图、改图时,不必手动切换模型,插件按任务路由到视觉或生图后端。
基础要求如下:
| 项目 | 要求 |
|---|---|
| 宿主 | DeepSeek Harness dsh ≥ 0.1.0-rc.7 |
| 运行环境 | Node.js ≥ 18 |
| peerDependencies | @deepseek-ai/dsh-tools(*)、react(^18.2.0) |
| API Key | 需自备,Gemini 可用 Google AI Studio 免费 Key |
核心能力¶
图片识别¶
插件说明中列出的 vision_read 用于识别、读取、描述和分析图片,覆盖 OCR、物体、图表等场景。输入支持本地路径或 http(s) URL。
文本生图¶
插件说明中列出的 generate_image 用于文本生图。生成后会调用 Gemini 视觉模型进行自检反馈,不达标时按优化 prompt 重绘。
改图¶
插件说明中列出的 edit_image 用于修改或优化已有图片:先分析原图,再生成改进版并自检迭代。
会话内自动路由¶
在常规 DeepSeek 会话中,插件可按任务路由到视觉或生图模型,无需手动切换模型。
后端与设置¶
插件说明支持 Gemini 默认后端,以及 OpenAI 兼容后端,示例包括 GPT-4o、Qwen-VL、GLM-4V、gpt-image、DALL-E、Flux 等。设置页可配置 API Key、后端 Provider 与模型,并支持模型不可用时自动降级。
图片输出¶
生成的图片保存在:
~/.dsh/vision-imagen-images/
结果卡片内联显示,并提供可点击链接:
/api/vision-imagen/images/<file>
安装与启用¶
先确认本机满足 dsh 与 Node.js 版本要求。
一行安装命令为:
dsh plugin --profile web add dsh-vision-imagen
本地试用也可以先克隆仓库,再加载本地目录:
git clone https://github.com/xuxun-oss/dsh-vision-imagen.git
dsh plugin --profile web add /path/to/dsh-vision-imagen
安装后打开:
设置 → Vision Imagen
填入 Google AI Studio 的 API Key,点「测试连接」。
如果改用 OpenAI 兼容后端,在设置页的「后端 Provider」中切换后端,并填入对应 API Key 与端点。如果使用 Gemini 后端,按 README 提示仅走原生 Gemini REST API(generateContent / predict),端点不要追加 /openai。
典型用法¶
1、识别图片:在会话中给出本地路径或 http(s) URL,提出“识别这张图”“读取图中表格”等需求。插件说明中对应工具为 vision_read。
2、文本生图:描述目标画面,提出生成需求。插件说明中对应工具为 generate_image。生成后会有视觉模型自检反馈,不达标时按优化 prompt 重绘。
3、改图:给出已有图片,提出“优化背景”“调整画面”等需求。插件说明中对应工具为 edit_image。
4、切换后端:在设置页选择 Gemini 或 OpenAI 兼容后端,填入对应 API Key 与端点,再执行上面的任务。
适用场景与注意¶
适合以下场景:
- 需要以 DSH 插件方式接入视觉识别与图像生成能力。
- 希望在常规 DeepSeek 会话中同时处理图片理解、生图和改图。
- 已自备 Gemini 或 OpenAI 兼容后端 API Key。
需要注意:
- 插件以当前 dsh 进程权限运行,安装前应检查源码与许可证。
- API Key 保存在本机配置文件中,路径为:
~/.dsh/vision-imagen.json
设置页回显仅显示后 4 位,且不应提交到版本库。
- 插件 HTTP 路由仅允许本机回环地址访问,路由前缀为:
/api/vision-imagen/*
非 loopback 请求返回 403。
- 如果使用 Gemini 后端,按 README 提示使用原生 Gemini REST API 端点,不要追加 /openai。
- 设置页支持模型不可用时自动降级。本文不展开具体模型链。
链接¶
- 社区插件目录页:https://www.skillhub.cn/plugins/xuxun-oss/dsh-vision-imagen
- GitHub:https://github.com/xuxun-oss/dsh-vision-imagen