前言¶
DeepSeek Harness(DSH)把 Agent、工具調用和對話流整合在一起,寫代碼、查資料、跑任務都很順手。但不少開發者用着用着會發現:想讓 Agent「畫一張圖」時,往往還得切到 Midjourney、DALL·E 或各家雲平臺的控制檯,複製 Prompt、等生成、再把圖片貼回對話——流程被打斷,上下文也容易丟。
社區裏有人專門補上了這塊能力。dsh-image-gen 是維護者 shanliuling 開源的 DSH 圖像生成插件,在 SkillHub 插件庫歸類爲「模型推理」,GitHub 倉庫描述爲「Generate images directly in DeepSeek Harness chats」。它的目標很直白:像 ChatGPT 那樣,在 DSH 聊天窗口裏用自然語言描述畫面,Agent 自動調用 generate_image 工具,圖片直接出現在當前會話中。
本文基於插件 GitHub README、package.json 與 SkillHub 目錄 API 交叉覈實,介紹它的能力邊界、安裝方式與典型用法。需要說明的是:SkillHub(skillhub.cn/plugins)是社區維護的 DSH 插件目錄,與 DeepSeek / 幻方並無官方從屬關係;DSH 本身秉持「一切皆插件」的理念,這類能力大多由社區貢獻。
這是什麼¶
dsh-image-gen 是一款面向 DeepSeek Harness Web 端的開源插件(MIT 協議),通過 npm 包名 dsh-image-gen 分發。它爲 DSH Agent 註冊了 generate_image 工具,把用戶的文字 Prompt 轉發到外部圖像 API,再把返回的圖片嵌入對話流,並接入 DSH 的 Attachment / Conversation 體系。
簡單說,它解決的是「DSH 能寫代碼、能調工具,但缺一套原生、可配置的多模態生圖鏈路」的問題。你自備各家雲平臺的 API Key(BYOK),在設置頁選好 Provider 和模型即可使用,Key 經 DSH 的 credentials 服務管理,寫保護隔離,不必寫進項目源碼。
核心功能與亮點¶
根據官方 README,插件主要提供以下能力:
- 對話內直接生圖:在聊天框用自然語言描述即可,Agent 自動調用工具,無需手動切換網站或複製 Prompt。
- 歷史生圖畫廊:會話頂欄提供「畫廊」Tab,彙總所有歷史生成圖片,支持關鍵詞搜索、廠商篩選、單張刪除(帶防誤觸確認)以及複製、下載。
- 交互式圖片操作:支持全屏預覽、複製到剪貼板、本地下載、新標籤頁打開。
- 多 Provider 支持:覆蓋 Google Gemini、OpenAI Images、OpenAI Compatible API、字節 Seedream / 火山方舟、阿里雲 DashScope(通義萬相 / Qwen-Image)。Provider、模型和 Endpoint 均可在 Web 設置中自定義。
- 圖片跟隨會話持久化:生成結果接入 DSH 附件體系,重新打開歷史會話仍能看到之前的圖片。
- 自動落盤到工作區:默認將圖片保存到當前會話工作區(可關閉或修改子目錄),工具結果會返回文件絕對路徑。
- 原生設置界面:在 DSH Web 的 Settings → Plugins → Image generation 中完成配置,無需手改配置文件。
各 Provider 的默認模型與 Endpoint 如下(摘自 README,實際以設置頁爲準):
| Provider | 默認模型 | 默認 Endpoint / Base URL |
|---|---|---|
| Google Gemini | gemini-3.1-flash-image |
https://generativelanguage.googleapis.com/v1beta/interactions |
| OpenAI Images | gpt-image-2 |
https://api.openai.com/v1 |
| OpenAI Compatible | 自定義 | 自定義 Base URL |
| ByteDance Seedream / 火山方舟 | doubao-seedream-5-0-260128 |
https://ark.cn-beijing.volces.com/api/v3 |
| Aliyun DashScope / 通義萬相 | wanx2.1-t2i-turbo |
https://dashscope.aliyuncs.com/api/v1 |
在 SkillHub 目錄中,該插件標記爲 verified(可安裝校驗通過),GitHub 星標約 150+(目錄同步數據爲 153 stars、7 forks,GitHub 即時數據可能更高)。
安裝與啓用¶
在 DeepSeek Harness 項目根目錄執行以下命令。官方 README 推薦通過 npm 安裝最新版,並指定 --profile web(該插件面向 Web 客戶端):
# 推薦:安裝或升級到最新版本
pnpm dsh plugin --profile web add dsh-image-gen@latest
# 若已將 dsh 安裝爲全局命令,可省略 pnpm:
dsh plugin --profile web add dsh-image-gen@latest
如需從 GitHub 直裝或本地調試,README 還提供了另外兩種方式:
# 從 GitHub 倉庫安裝最新代碼
pnpm dsh plugin --profile web add git+https://github.com/shanliuling/dsh-image-gen.git
# 本地克隆後開發安裝
git clone https://github.com/shanliuling/dsh-image-gen.git
pnpm dsh plugin --profile web add ./dsh-image-gen
安裝完成後,打開 DSH Web 頁面(默認 http://localhost:3080),進入 Settings → Plugins → Image generation,選擇 Provider 並填寫 API Key。可按需開啓「保存到工作區」並自定義子目錄,點擊保存即可生效。
典型用法示例¶
配置好 Key 之後,直接在對話中描述想要的畫面即可。README 給出的示例 Prompt:
幫我畫一張雨夜霓虹街頭的賽博朋克貓咪。
或:
生成一張極簡主義的現代建築客廳插畫。
Agent 會調用 generate_image,圖片 inline 顯示在當前對話流中。若要回顧歷史作品,點擊會話頂欄的 「畫廊」 Tab,可集中瀏覽、搜索和管理所有生成記錄。
如果你更習慣讓 Agent 代爲安裝,也可以直接對它說:
幫我安裝生圖插件,執行命令:pnpm dsh plugin --profile web add dsh-image-gen@latest
適用場景與注意事項¶
適合誰用:
- 已在用 DSH Web 端做 Agent 開發或日常對話,希望補齊「文生圖」能力、減少上下文切換的開發者;
- 手頭已有 Gemini、OpenAI、火山方舟或通義萬相等 API Key,希望以 BYOK 方式接入的用戶;
- 需要在同一會話裏反覆迭代畫面、並保留歷史生成記錄的場景。
使用前請注意:
- 插件以當前 dsh 進程權限運行。安裝前建議閱讀 GitHub 源碼 與 MIT 許可證,確認行爲符合你的安全策略。
- 生圖費用由你所選 Provider 的 API 計費,插件本身不代收費用;請妥善保管 API Key,並關注各平臺的用量與配額。
- 需配置
--profile web。該插件的dsh.client.platform爲web,與 TUI 或其他 profile 的安裝方式可能不同,以 README 爲準。 - 模型與 Endpoint 會隨廠商更新而變化。上表默認值來自 README,實際可用模型以各平臺文檔和插件設置頁爲準。
- 國內網絡環境下,訪問 Google / OpenAI 等境外 API 可能需要額外網絡配置;火山方舟、通義萬相等國內服務通常更易直連。
小結¶
dsh-image-gen 把 ChatGPT 式的「對話中生圖」體驗帶到了 DeepSeek Harness:一條安裝命令、設置頁填 Key、聊天框描述畫面,Agent 就能調用 generate_image 並把結果留在會話裏,還附帶畫廊管理與工作區落盤。對於已經在 DSH 生態裏做 Agent 工作流的開發者,這是一個值得嘗試的模型推理類插件。
- 目錄頁:https://www.skillhub.cn/plugins/shanliuling/dsh-image-gen
- GitHub:https://github.com/shanliuling/dsh-image-gen