在 DeepSeek Harness 对话里直接生图:dsh-image-gen 插件上手

前言

DeepSeek Harness(DSH)把 Agent、工具调用和对话流整合在一起,写代码、查资料、跑任务都很顺手。但不少开发者用着用着会发现:想让 Agent「画一张图」时,往往还得切到 Midjourney、DALL·E 或各家云平台的控制台,复制 Prompt、等生成、再把图片贴回对话——流程被打断,上下文也容易丢。

社区里有人专门补上了这块能力。dsh-image-gen 是维护者 shanliuling 开源的 DSH 图像生成插件,在 SkillHub 插件库归类为「模型推理」,GitHub 仓库描述为「Generate images directly in DeepSeek Harness chats」。它的目标很直白:像 ChatGPT 那样,在 DSH 聊天窗口里用自然语言描述画面,Agent 自动调用 generate_image 工具,图片直接出现在当前会话中。

本文基于插件 GitHub README、package.json 与 SkillHub 目录 API 交叉核实,介绍它的能力边界、安装方式与典型用法。需要说明的是:SkillHub(skillhub.cn/plugins)是社区维护的 DSH 插件目录,与 DeepSeek / 幻方并无官方从属关系;DSH 本身秉持「一切皆插件」的理念,这类能力大多由社区贡献。

这是什么

dsh-image-gen 是一款面向 DeepSeek Harness Web 端的开源插件(MIT 协议),通过 npm 包名 dsh-image-gen 分发。它为 DSH Agent 注册了 generate_image 工具,把用户的文字 Prompt 转发到外部图像 API,再把返回的图片嵌入对话流,并接入 DSH 的 Attachment / Conversation 体系。

简单说,它解决的是「DSH 能写代码、能调工具,但缺一套原生、可配置的多模态生图链路」的问题。你自备各家云平台的 API Key(BYOK),在设置页选好 Provider 和模型即可使用,Key 经 DSH 的 credentials 服务管理,写保护隔离,不必写进项目源码。

核心功能与亮点

根据官方 README,插件主要提供以下能力:

  1. 对话内直接生图:在聊天框用自然语言描述即可,Agent 自动调用工具,无需手动切换网站或复制 Prompt。
  2. 历史生图画廊:会话顶栏提供「画廊」Tab,汇总所有历史生成图片,支持关键词搜索、厂商筛选、单张删除(带防误触确认)以及复制、下载。
  3. 交互式图片操作:支持全屏预览、复制到剪贴板、本地下载、新标签页打开。
  4. 多 Provider 支持:覆盖 Google Gemini、OpenAI Images、OpenAI Compatible API、字节 Seedream / 火山方舟、阿里云 DashScope(通义万相 / Qwen-Image)。Provider、模型和 Endpoint 均可在 Web 设置中自定义。
  5. 图片跟随会话持久化:生成结果接入 DSH 附件体系,重新打开历史会话仍能看到之前的图片。
  6. 自动落盘到工作区:默认将图片保存到当前会话工作区(可关闭或修改子目录),工具结果会返回文件绝对路径。
  7. 原生设置界面:在 DSH Web 的 Settings → Plugins → Image generation 中完成配置,无需手改配置文件。

各 Provider 的默认模型与 Endpoint 如下(摘自 README,实际以设置页为准):

Provider 默认模型 默认 Endpoint / Base URL
Google Gemini gemini-3.1-flash-image https://generativelanguage.googleapis.com/v1beta/interactions
OpenAI Images gpt-image-2 https://api.openai.com/v1
OpenAI Compatible 自定义 自定义 Base URL
ByteDance Seedream / 火山方舟 doubao-seedream-5-0-260128 https://ark.cn-beijing.volces.com/api/v3
Aliyun DashScope / 通义万相 wanx2.1-t2i-turbo https://dashscope.aliyuncs.com/api/v1

在 SkillHub 目录中,该插件标记为 verified(可安装校验通过),GitHub 星标约 150+(目录同步数据为 153 stars、7 forks,GitHub 实时数据可能更高)。

安装与启用

在 DeepSeek Harness 项目根目录执行以下命令。官方 README 推荐通过 npm 安装最新版,并指定 --profile web(该插件面向 Web 客户端):

# 推荐:安装或升级到最新版本
pnpm dsh plugin --profile web add dsh-image-gen@latest

# 若已将 dsh 安装为全局命令,可省略 pnpm:
dsh plugin --profile web add dsh-image-gen@latest

如需从 GitHub 直装或本地调试,README 还提供了另外两种方式:

# 从 GitHub 仓库安装最新代码
pnpm dsh plugin --profile web add git+https://github.com/shanliuling/dsh-image-gen.git

# 本地克隆后开发安装
git clone https://github.com/shanliuling/dsh-image-gen.git
pnpm dsh plugin --profile web add ./dsh-image-gen

安装完成后,打开 DSH Web 页面(默认 http://localhost:3080),进入 Settings → Plugins → Image generation,选择 Provider 并填写 API Key。可按需开启「保存到工作区」并自定义子目录,点击保存即可生效。

典型用法示例

配置好 Key 之后,直接在对话中描述想要的画面即可。README 给出的示例 Prompt:

帮我画一张雨夜霓虹街头的赛博朋克猫咪。

或:

生成一张极简主义的现代建筑客厅插画。

Agent 会调用 generate_image,图片 inline 显示在当前对话流中。若要回顾历史作品,点击会话顶栏的 「画廊」 Tab,可集中浏览、搜索和管理所有生成记录。

如果你更习惯让 Agent 代为安装,也可以直接对它说:

帮我安装生图插件,执行命令:pnpm dsh plugin --profile web add dsh-image-gen@latest

适用场景与注意事项

适合谁用:

  • 已在用 DSH Web 端做 Agent 开发或日常对话,希望补齐「文生图」能力、减少上下文切换的开发者;
  • 手头已有 Gemini、OpenAI、火山方舟或通义万相等 API Key,希望以 BYOK 方式接入的用户;
  • 需要在同一会话里反复迭代画面、并保留历史生成记录的场景。

使用前请注意:

  1. 插件以当前 dsh 进程权限运行。安装前建议阅读 GitHub 源码 与 MIT 许可证,确认行为符合你的安全策略。
  2. 生图费用由你所选 Provider 的 API 计费,插件本身不代收费用;请妥善保管 API Key,并关注各平台的用量与配额。
  3. 需配置 --profile web。该插件的 dsh.client.platformweb,与 TUI 或其他 profile 的安装方式可能不同,以 README 为准。
  4. 模型与 Endpoint 会随厂商更新而变化。上表默认值来自 README,实际可用模型以各平台文档和插件设置页为准。
  5. 国内网络环境下,访问 Google / OpenAI 等境外 API 可能需要额外网络配置;火山方舟、通义万相等国内服务通常更易直连。

小结

dsh-image-gen 把 ChatGPT 式的「对话中生图」体验带到了 DeepSeek Harness:一条安装命令、设置页填 Key、聊天框描述画面,Agent 就能调用 generate_image 并把结果留在会话里,还附带画廊管理与工作区落盘。对于已经在 DSH 生态里做 Agent 工作流的开发者,这是一个值得尝试的模型推理类插件。

  • 目录页:https://www.skillhub.cn/plugins/shanliuling/dsh-image-gen
  • GitHub:https://github.com/shanliuling/dsh-image-gen
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜