dsh-vision-imagen:DeepSeek Harness 的视觉识别与图像生成插件

前言

DeepSeek Harness(DSH)的扩展能力以插件形式接入。当 DeepSeek 模型需要处理图片任务时,通常需要额外接入视觉模型或图像生成服务。dsh-vision-imagen 是 xuxun-oss 维护的 DSH 插件,用于桥接 Google Gemini 的多模态识别与图像生成,并支持部分 OpenAI 兼容后端。

下面介绍它的定位、能力、安装方式与注意事项。

这是什么

dsh-vision-imagen 是一个 MIT 许可证的 DSH 插件,包名为 dsh-vision-imagen,版本为 1.3.0。

它解决的是一个具体需求:在常规 DeepSeek 会话中,需要看图、生图、改图时,不必手动切换模型,插件按任务路由到视觉或生图后端。

基础要求如下:

项目 要求
宿主 DeepSeek Harness dsh ≥ 0.1.0-rc.7
运行环境 Node.js ≥ 18
peerDependencies @deepseek-ai/dsh-tools*)、react^18.2.0
API Key 需自备,Gemini 可用 Google AI Studio 免费 Key

核心能力

图片识别

插件说明中列出的 vision_read 用于识别、读取、描述和分析图片,覆盖 OCR、物体、图表等场景。输入支持本地路径或 http(s) URL。

文本生图

插件说明中列出的 generate_image 用于文本生图。生成后会调用 Gemini 视觉模型进行自检反馈,不达标时按优化 prompt 重绘。

改图

插件说明中列出的 edit_image 用于修改或优化已有图片:先分析原图,再生成改进版并自检迭代。

会话内自动路由

在常规 DeepSeek 会话中,插件可按任务路由到视觉或生图模型,无需手动切换模型。

后端与设置

插件说明支持 Gemini 默认后端,以及 OpenAI 兼容后端,示例包括 GPT-4o、Qwen-VL、GLM-4V、gpt-image、DALL-E、Flux 等。设置页可配置 API Key、后端 Provider 与模型,并支持模型不可用时自动降级。

图片输出

生成的图片保存在:

~/.dsh/vision-imagen-images/

结果卡片内联显示,并提供可点击链接:

/api/vision-imagen/images/<file>

安装与启用

先确认本机满足 dsh 与 Node.js 版本要求。

一行安装命令为:

dsh plugin --profile web add dsh-vision-imagen

本地试用也可以先克隆仓库,再加载本地目录:

git clone https://github.com/xuxun-oss/dsh-vision-imagen.git
dsh plugin --profile web add /path/to/dsh-vision-imagen

安装后打开:

设置 → Vision Imagen

填入 Google AI Studio 的 API Key,点「测试连接」。

如果改用 OpenAI 兼容后端,在设置页的「后端 Provider」中切换后端,并填入对应 API Key 与端点。如果使用 Gemini 后端,按 README 提示仅走原生 Gemini REST API(generateContent / predict),端点不要追加 /openai

典型用法

1、识别图片:在会话中给出本地路径或 http(s) URL,提出“识别这张图”“读取图中表格”等需求。插件说明中对应工具为 vision_read

2、文本生图:描述目标画面,提出生成需求。插件说明中对应工具为 generate_image。生成后会有视觉模型自检反馈,不达标时按优化 prompt 重绘。

3、改图:给出已有图片,提出“优化背景”“调整画面”等需求。插件说明中对应工具为 edit_image

4、切换后端:在设置页选择 Gemini 或 OpenAI 兼容后端,填入对应 API Key 与端点,再执行上面的任务。

适用场景与注意

适合以下场景:

  • 需要以 DSH 插件方式接入视觉识别与图像生成能力。
  • 希望在常规 DeepSeek 会话中同时处理图片理解、生图和改图。
  • 已自备 Gemini 或 OpenAI 兼容后端 API Key。

需要注意:

  • 插件以当前 dsh 进程权限运行,安装前应检查源码与许可证。
  • API Key 保存在本机配置文件中,路径为:
~/.dsh/vision-imagen.json

设置页回显仅显示后 4 位,且不应提交到版本库。
- 插件 HTTP 路由仅允许本机回环地址访问,路由前缀为:

/api/vision-imagen/*

非 loopback 请求返回 403。
- 如果使用 Gemini 后端,按 README 提示使用原生 Gemini REST API 端点,不要追加 /openai
- 设置页支持模型不可用时自动降级。本文不展开具体模型链。

链接

  • 社区插件目录页:https://www.skillhub.cn/plugins/xuxun-oss/dsh-vision-imagen
  • GitHub:https://github.com/xuxun-oss/dsh-vision-imagen
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye