前言¶
在 DeepSeek Harness(DSH)里做对话式智能体时,生图和读图往往要绕出聊天界面:要么手动切到 API 控制台或第三方工具,要么依赖外部脚本把结果贴回对话。对日常在 Web 端调试模型的开发者来说,这会打断上下文,也不利于让模型直接「看见」图片内容。
dsh-chat-imagine 由社区维护者 corrinehu 发布,目标是把生图与识图收进 DSH 聊天流程:生成结果直接显示在对话里,识图则把图片转成结构化 JSON 证据,供当前会话中的任意模型调用。下面介绍它的能力边界、安装方式与典型用法。
这是什么¶
dsh-chat-imagine 是一个 DSH 插件(SkillHub 分类:联网工具),当前版本 0.4.1,MIT 许可证。它实现了在 DSH 聊天窗口中自动调用生图工具——可走 API 渠道,也可走本机 CLI(已支持 mmx / codex / agy)——并在对话内联展示图片;同时支持利用对应 CLI 的视觉能力识别图片,输出结构化证据供模型读取。
插件仓库:https://github.com/corrinehu/dsh-chat-imagine
核心功能¶
生图:API 与 CLI 双通道¶
插件支持两条生图路径,安装后会自动探测本机可用渠道。
API 渠道
- 使用 DSH 中已配置的 OpenAI 兼容接口,从中查找可用的生图模型。
- 内置渠道(如 OpenRouter)在 DSH 设置里未填写 base URL 时,插件会自动使用 DSH 内置的默认地址,行为与聊天路由一致。
CLI 渠道
插件会扫描本机是否安装了以下 CLI,找到的都会作为可用的生成与识别渠道:
| CLI | 说明 |
|---|---|
mmx |
MiniMax CLI |
codex |
OpenAI Codex CLI |
agy |
Google Antigravity CLI |
CLI 生图需注意额度来源:
- 调用
codex消耗的是 ChatGPT 账号(Plus/Pro)额度,而非 API key;需已安装 codex CLI,并登录有生图额度的账号(可用codex login status查看)。 - 调用
agy消耗的是 Google 账号额度;需已安装 agy CLI,并在 Antigravity App 里保持登录。
探测到 codex / agy 时,插件还会随包注册技能 cli-image-gen,教模型在 generate_image 工具失败(额度、区域限制或解析失败)时改走 CLI 生图,收尾用 show_image_file 内联展示。
识图:CLI 视觉能力转结构化证据¶
识图依赖本机 CLI:装了 mmx / codex / agy 任意一个即可使用 analyze_image 工具,无需全部安装。一个都没装时插件仍可正常生图,但调用识图会返回「未发现 CLI,不支持识图」。
识图走同一 CLI 渠道的视觉能力:
mmx:vision describecodex:exec -i附图 + 服务端 JSON schemaagy:--json-schema
工具把图片(本地路径或 http(s) URL)读取成结构化 JSON 证据,包含 OCR 全文与逐行文本、按阅读顺序的版面区域、语义实体与关系、视觉线索、不确定项清单。任何模型(含纯文本模型)都能直接调用,无需切换到视觉模型。
渠道默认按速度选择(mmx → codex → agy),也可用 set_image_default 的 visionBackend 参数固定默认识图渠道。某渠道额度耗尽时,可在对话里说明换一个(backend 参数或直接说「用 codex 读」)。
安装与启用¶
插件当前仅在 DSH Web profile 中测试通过。安装前建议查看仓库源码与 MIT 许可证;插件以当前 DSH 进程权限运行,CLI 渠道会调用本机已安装的可执行文件。
推荐通过 npm 安装(自带预构建产物):
dsh plugin --profile web add dsh-chat-imagine
也可从 GitHub 源码安装:
dsh plugin --profile web add github:corrinehu/dsh-chat-imagine
安装并启用后,在新对话里即可直接使用生图与识图能力。
典型用法¶
首次生图与设置默认渠道¶
安装启用后,在新对话里直接描述想画的内容:
帮我生成一个 Q 版蓝鲸 Logo
插件会检索可用的渠道和模型,并询问默认生图的渠道。设置后不必重复选择。
日常生图¶
之后直接在聊天里描述即可:
生成一张 16:9 的雪山日出
生成结果会直接显示在聊天中。
如需指定非默认渠道,在对话里说明即可:
用 agy 生成一张手绘彩铅风格说明大模型后训练的宽屏图片
识图(读图)¶
装好 mmx / codex / agy 任一 CLI 后,可让模型读取图片内容:
帮我读一下这张图 /tmp/screenshots/error.png,把报错原文抄出来
工具返回的五段式结构化证据借鉴了 modlens 的契约设计,刻意不含坐标框与置信度字段。与 modlens 类「接管模型路由」方案的主要区别是:识图走 CLI 渠道的视觉模型,当前会话不需要切换到视觉模型。
适用场景与注意事项¶
适合谁
- 在 DSH Web 端做对话调试,希望生图结果直接出现在聊天里的开发者。
- 需要在纯文本模型会话中读取图片内容(OCR、版面、语义),又不想手动切换视觉模型的场景。
- 已有 OpenAI 兼容生图 API,或本机已配置
mmx/codex/agyCLI 的用户。
需要注意
- 图片只保存在 DSH 进程内存中;重启后历史图片链接会失效,需要保留时请从聊天界面保存。
- Node.js 版本要求:
^22.19.0或>=24.0.0。 - SkillHub 目录页与 DeepSeek / 幻方无官方从属关系,属于社区插件生态。