前言¶
在 DeepSeek Harness(DSH)裏做對話式智能體時,生圖和讀圖往往要繞出聊天界面:要麼手動切到 API 控制檯或第三方工具,要麼依賴外部腳本把結果貼回對話。對日常在 Web 端調試模型的開發者來說,這會打斷上下文,也不利於讓模型直接「看見」圖片內容。
dsh-chat-imagine 由社區維護者 corrinehu 發佈,目標是把生圖與識圖收進 DSH 聊天流程:生成結果直接顯示在對話裏,識圖則把圖片轉成結構化 JSON 證據,供當前會話中的任意模型調用。下面介紹它的能力邊界、安裝方式與典型用法。
這是什麼¶
dsh-chat-imagine 是一個 DSH 插件(SkillHub 分類:聯網工具),當前版本 0.4.1,MIT 許可證。它實現了在 DSH 聊天窗口中自動調用生圖工具——可走 API 渠道,也可走本機 CLI(已支持 mmx / codex / agy)——並在對話內聯展示圖片;同時支持利用對應 CLI 的視覺能力識別圖片,輸出結構化證據供模型讀取。
插件倉庫:https://github.com/corrinehu/dsh-chat-imagine
核心功能¶
生圖:API 與 CLI 雙通道¶
插件支持兩條生圖路徑,安裝後會自動探測本機可用渠道。
API 渠道
- 使用 DSH 中已配置的 OpenAI 兼容接口,從中查找可用的生圖模型。
- 內置渠道(如 OpenRouter)在 DSH 設置裏未填寫 base URL 時,插件會自動使用 DSH 內置的默認地址,行爲與聊天路由一致。
CLI 渠道
插件會掃描本機是否安裝了以下 CLI,找到的都會作爲可用的生成與識別渠道:
| CLI | 說明 |
|---|---|
mmx |
MiniMax CLI |
codex |
OpenAI Codex CLI |
agy |
Google Antigravity CLI |
CLI 生圖需注意額度來源:
- 調用
codex消耗的是 ChatGPT 賬號(Plus/Pro)額度,而非 API key;需已安裝 codex CLI,並登錄有生圖額度的賬號(可用codex login status查看)。 - 調用
agy消耗的是 Google 賬號額度;需已安裝 agy CLI,並在 Antigravity App 裏保持登錄。
探測到 codex / agy 時,插件還會隨包註冊技能 cli-image-gen,教模型在 generate_image 工具失敗(額度、區域限制或解析失敗)時改走 CLI 生圖,收尾用 show_image_file 內聯展示。
識圖:CLI 視覺能力轉結構化證據¶
識圖依賴本機 CLI:裝了 mmx / codex / agy 任意一個即可使用 analyze_image 工具,無需全部安裝。一個都沒裝時插件仍可正常生圖,但調用識圖會返回「未發現 CLI,不支持識圖」。
識圖走同一 CLI 渠道的視覺能力:
mmx:vision describecodex:exec -i附圖 + 服務端 JSON schemaagy:--json-schema
工具把圖片(本地路徑或 http(s) URL)讀取成結構化 JSON 證據,包含 OCR 全文與逐行文本、按閱讀順序的版面區域、語義實體與關係、視覺線索、不確定項清單。任何模型(含純文本模型)都能直接調用,無需切換到視覺模型。
渠道默認按速度選擇(mmx → codex → agy),也可用 set_image_default 的 visionBackend 參數固定默認識圖渠道。某渠道額度耗盡時,可在對話裏說明換一個(backend 參數或直接說「用 codex 讀」)。
安裝與啓用¶
插件當前僅在 DSH Web profile 中測試通過。安裝前建議查看倉庫源碼與 MIT 許可證;插件以當前 DSH 進程權限運行,CLI 渠道會調用本機已安裝的可執行文件。
推薦通過 npm 安裝(自帶預構建產物):
dsh plugin --profile web add dsh-chat-imagine
也可從 GitHub 源碼安裝:
dsh plugin --profile web add github:corrinehu/dsh-chat-imagine
安裝並啓用後,在新對話裏即可直接使用生圖與識圖能力。
典型用法¶
首次生圖與設置默認渠道¶
安裝啓用後,在新對話裏直接描述想畫的內容:
幫我生成一個 Q 版藍鯨 Logo
插件會檢索可用的渠道和模型,並詢問默認生圖的渠道。設置後不必重複選擇。
日常生圖¶
之後直接在聊天裏描述即可:
生成一張 16:9 的雪山日出
生成結果會直接顯示在聊天中。
如需指定非默認渠道,在對話裏說明即可:
用 agy 生成一張手繪彩鉛風格說明大模型後訓練的寬屏圖片
識圖(讀圖)¶
裝好 mmx / codex / agy 任一 CLI 後,可讓模型讀取圖片內容:
幫我讀一下這張圖 /tmp/screenshots/error.png,把報錯原文抄出來
工具返回的五段式結構化證據借鑑了 modlens 的契約設計,刻意不含座標框與置信度字段。與 modlens 類「接管模型路由」方案的主要區別是:識圖走 CLI 渠道的視覺模型,當前會話不需要切換到視覺模型。
適用場景與注意事項¶
適合誰
- 在 DSH Web 端做對話調試,希望生圖結果直接出現在聊天裏的開發者。
- 需要在純文本模型會話中讀取圖片內容(OCR、版面、語義),又不想手動切換視覺模型的場景。
- 已有 OpenAI 兼容生圖 API,或本機已配置
mmx/codex/agyCLI 的用戶。
需要注意
- 圖片只保存在 DSH 進程內存中;重啓後歷史圖片鏈接會失效,需要保留時請從聊天界面保存。
- Node.js 版本要求:
^22.19.0或>=24.0.0。 - SkillHub 目錄頁與 DeepSeek / 幻方無官方從屬關係,屬於社區插件生態。