前言¶
DeepSeek Harness(DSH)把 Agent、工具调用和对话流整合在一起,写代码、查资料、跑任务都很顺手。但不少开发者用着用着会发现:想让 Agent「画一张图」时,往往还得切到 Midjourney、DALL·E 或各家云平台的控制台,复制 Prompt、等生成、再把图片贴回对话——流程被打断,上下文也容易丢。
社区里有人专门补上了这块能力。dsh-image-gen 是维护者 shanliuling 开源的 DSH 图像生成插件,在 SkillHub 插件库归类为「模型推理」,GitHub 仓库描述为「Generate images directly in DeepSeek Harness chats」。它的目标很直白:像 ChatGPT 那样,在 DSH 聊天窗口里用自然语言描述画面,Agent 自动调用 generate_image 工具,图片直接出现在当前会话中。
本文基于插件 GitHub README、package.json 与 SkillHub 目录 API 交叉核实,介绍它的能力边界、安装方式与典型用法。需要说明的是:SkillHub(skillhub.cn/plugins)是社区维护的 DSH 插件目录,与 DeepSeek / 幻方并无官方从属关系;DSH 本身秉持「一切皆插件」的理念,这类能力大多由社区贡献。
这是什么¶
dsh-image-gen 是一款面向 DeepSeek Harness Web 端的开源插件(MIT 协议),通过 npm 包名 dsh-image-gen 分发。它为 DSH Agent 注册了 generate_image 工具,把用户的文字 Prompt 转发到外部图像 API,再把返回的图片嵌入对话流,并接入 DSH 的 Attachment / Conversation 体系。
简单说,它解决的是「DSH 能写代码、能调工具,但缺一套原生、可配置的多模态生图链路」的问题。你自备各家云平台的 API Key(BYOK),在设置页选好 Provider 和模型即可使用,Key 经 DSH 的 credentials 服务管理,写保护隔离,不必写进项目源码。
核心功能与亮点¶
根据官方 README,插件主要提供以下能力:
- 对话内直接生图:在聊天框用自然语言描述即可,Agent 自动调用工具,无需手动切换网站或复制 Prompt。
- 历史生图画廊:会话顶栏提供「画廊」Tab,汇总所有历史生成图片,支持关键词搜索、厂商筛选、单张删除(带防误触确认)以及复制、下载。
- 交互式图片操作:支持全屏预览、复制到剪贴板、本地下载、新标签页打开。
- 多 Provider 支持:覆盖 Google Gemini、OpenAI Images、OpenAI Compatible API、字节 Seedream / 火山方舟、阿里云 DashScope(通义万相 / Qwen-Image)。Provider、模型和 Endpoint 均可在 Web 设置中自定义。
- 图片跟随会话持久化:生成结果接入 DSH 附件体系,重新打开历史会话仍能看到之前的图片。
- 自动落盘到工作区:默认将图片保存到当前会话工作区(可关闭或修改子目录),工具结果会返回文件绝对路径。
- 原生设置界面:在 DSH Web 的 Settings → Plugins → Image generation 中完成配置,无需手改配置文件。
各 Provider 的默认模型与 Endpoint 如下(摘自 README,实际以设置页为准):
| Provider | 默认模型 | 默认 Endpoint / Base URL |
|---|---|---|
| Google Gemini | gemini-3.1-flash-image |
https://generativelanguage.googleapis.com/v1beta/interactions |
| OpenAI Images | gpt-image-2 |
https://api.openai.com/v1 |
| OpenAI Compatible | 自定义 | 自定义 Base URL |
| ByteDance Seedream / 火山方舟 | doubao-seedream-5-0-260128 |
https://ark.cn-beijing.volces.com/api/v3 |
| Aliyun DashScope / 通义万相 | wanx2.1-t2i-turbo |
https://dashscope.aliyuncs.com/api/v1 |
在 SkillHub 目录中,该插件标记为 verified(可安装校验通过),GitHub 星标约 150+(目录同步数据为 153 stars、7 forks,GitHub 实时数据可能更高)。
安装与启用¶
在 DeepSeek Harness 项目根目录执行以下命令。官方 README 推荐通过 npm 安装最新版,并指定 --profile web(该插件面向 Web 客户端):
# 推荐:安装或升级到最新版本
pnpm dsh plugin --profile web add dsh-image-gen@latest
# 若已将 dsh 安装为全局命令,可省略 pnpm:
dsh plugin --profile web add dsh-image-gen@latest
如需从 GitHub 直装或本地调试,README 还提供了另外两种方式:
# 从 GitHub 仓库安装最新代码
pnpm dsh plugin --profile web add git+https://github.com/shanliuling/dsh-image-gen.git
# 本地克隆后开发安装
git clone https://github.com/shanliuling/dsh-image-gen.git
pnpm dsh plugin --profile web add ./dsh-image-gen
安装完成后,打开 DSH Web 页面(默认 http://localhost:3080),进入 Settings → Plugins → Image generation,选择 Provider 并填写 API Key。可按需开启「保存到工作区」并自定义子目录,点击保存即可生效。
典型用法示例¶
配置好 Key 之后,直接在对话中描述想要的画面即可。README 给出的示例 Prompt:
帮我画一张雨夜霓虹街头的赛博朋克猫咪。
或:
生成一张极简主义的现代建筑客厅插画。
Agent 会调用 generate_image,图片 inline 显示在当前对话流中。若要回顾历史作品,点击会话顶栏的 「画廊」 Tab,可集中浏览、搜索和管理所有生成记录。
如果你更习惯让 Agent 代为安装,也可以直接对它说:
帮我安装生图插件,执行命令:pnpm dsh plugin --profile web add dsh-image-gen@latest
适用场景与注意事项¶
适合谁用:
- 已在用 DSH Web 端做 Agent 开发或日常对话,希望补齐「文生图」能力、减少上下文切换的开发者;
- 手头已有 Gemini、OpenAI、火山方舟或通义万相等 API Key,希望以 BYOK 方式接入的用户;
- 需要在同一会话里反复迭代画面、并保留历史生成记录的场景。
使用前请注意:
- 插件以当前 dsh 进程权限运行。安装前建议阅读 GitHub 源码 与 MIT 许可证,确认行为符合你的安全策略。
- 生图费用由你所选 Provider 的 API 计费,插件本身不代收费用;请妥善保管 API Key,并关注各平台的用量与配额。
- 需配置
--profile web。该插件的dsh.client.platform为web,与 TUI 或其他 profile 的安装方式可能不同,以 README 为准。 - 模型与 Endpoint 会随厂商更新而变化。上表默认值来自 README,实际可用模型以各平台文档和插件设置页为准。
- 国内网络环境下,访问 Google / OpenAI 等境外 API 可能需要额外网络配置;火山方舟、通义万相等国内服务通常更易直连。
小结¶
dsh-image-gen 把 ChatGPT 式的「对话中生图」体验带到了 DeepSeek Harness:一条安装命令、设置页填 Key、聊天框描述画面,Agent 就能调用 generate_image 并把结果留在会话里,还附带画廊管理与工作区落盘。对于已经在 DSH 生态里做 Agent 工作流的开发者,这是一个值得尝试的模型推理类插件。
- 目录页:https://www.skillhub.cn/plugins/shanliuling/dsh-image-gen
- GitHub:https://github.com/shanliuling/dsh-image-gen