前言¶
DeepSeek Harness(DSH)擅長文本推理,但純文本模型無法直接理解聊天框裏拖入的截圖或設計稿。社區裏不少視覺插件只解決「讀圖」,且常引導用戶走共享的第三方端點;圖片會經過你不完全可控的中間服務。
下面介紹 dsh-media-skills(GitHub:MJorgin/dsh-media-skills)。它在 DSH 插件生態裏歸類爲「模型推理」,由維護者 MJorgin 發佈,當前 package 版本爲 0.3.0,MIT 許可。插件 bundle 提供兩個 Skill、一條自動寫入的視覺模型路由,以及可配置的視覺引擎故障轉移鏈;密鑰不寫進倉庫,讀圖與生圖均走用戶自選的免費或已有 API 提供方。
這是什麼¶
dsh-media-skills 的定位是:給 DSH 裝上「眼睛」和「畫筆」——在任意會話裏粘貼圖片並自動轉述爲文字,同時支持按需生成無水印插畫。官方說明支持 DeepSeek Harness rc.7、rc.8、v0.1.1-rc.1、v0.1.1-rc.2;Python 3.9+。
與常見「只讀圖」插件相比,本 bundle 額外提供 media-tools 生圖能力,並在安裝後自動向模型選擇器寫入「智譜 GLM-4V-Flash(視覺)」路由。SkillHub 目錄頁:https://www.skillhub.cn/plugins/MJorgin/dsh-media-skills(社區獨立站點,與 DeepSeek / 幻方無官方從屬關係)。
核心功能¶
貼圖自動轉述¶
在純文本會話中,可通過粘貼、拖拽或「添加圖片」按鈕(rc.7 / rc.8 需配套 client-ux 補丁)送入圖片。視覺模型將圖片轉爲文字描述,連同縮略圖交給當前模型。
- v0.1.1-rc.1 及以上:默認使用 DeepSeek-V4-Flash-Vision-Exp,與主 agent 共用
DEEPSEEK_API_KEY。 - rc.7 / rc.8:默認 GLM-4V-Flash,單路由超時 15s,可故障轉移至 SiliconFlow Qwen3-VL。
貼圖轉述管道屬於 DSH 本體(api-proxy 圖片准入邏輯);本 bundle 提供其依賴的視覺路由與讀圖 Skill。rc.7 / rc.8 需應用倉庫內 cordis.patch.yml 及文檔中的 Harness 補丁,詳見 docs/HARNESS_PATCH.md。
vision-review¶
讀圖 Skill,用於分析截圖、識別界面視覺問題(重疊、溢出、錯位)、檢測水印 Logo、將圖片轉爲文字。可選 --structured 模式,輸出 ModLens 風格的結構化證據 JSON(summary、全文 OCR、閱讀順序版面、實體關係、不確定性)。
視覺引擎故障轉移順序:GLM-4V-Flash → DeepSeek-V4-Flash-Vision-Exp → SiliconFlow Qwen3-VL → SenseNova → Google Gemini → 任意 OpenAI 兼容端點。配置了對應 Key 的引擎會自動加入鏈路。
media-tools¶
生圖 Skill,用於生成插畫、頭像、背景、Banner。模型路由爲 SenseNova U1 Fast → SiliconFlow Kolors,官方說明爲免費且無水印。
視覺模型路由¶
安裝後模型選擇器自動出現「智譜 GLM-4V-Flash(視覺)」。v0.1.1 的 deepseek-official 路由還原生攜帶 DeepSeek-V4-Flash-Vision-Exp。新開對話選中任一視覺模型即可直接圍繞圖片多輪對話。
安裝與啓用¶
官方安裝命令如下,<name> 替換爲你的 DSH profile 名稱:
dsh plugin --profile <name> add github:MJorgin/dsh-media-skills
先做 Key 配置,再重啓服務。
- v0.1.1-rc.1+:若已配置主 agent 的
DEEPSEEK_API_KEY,貼圖轉述與 DeepSeek 視覺路由無需額外 Key。 - rc.7 / rc.8 或需免費引擎:智譜 open.bigmodel.cn 申請
glm-4v-flash(免費);SiliconFlow siliconflow.cn 申請 Kolors 用 Key;可選 Google Gemini aistudio.google.com 加入讀圖回退鏈。
Key 寫入 Web 界面 設置 → 模型 中 zhipu-vision 提供方的 API Key 欄,或寫入憑據文件:
# ~/.dsh/.credentials.yaml(建議 chmod 600)
GLM_API_KEY: <你的智譜 Key>
Skill 腳本還會按順序讀取環境變量、~/.dsh/secrets/media-tools.env、~/.codex/secrets/media-tools.env:
# ~/.dsh/secrets/media-tools.env(建議 chmod 600)
GLM_API_KEY=...
SILICONFLOW_API_KEY=...
GEMINI_API_KEY=... # 可選
- 徹底重啓
dsh web,瀏覽器強刷(Linux 上一般爲Ctrl+Shift+R)。
驗證:模型選擇器出現「智譜 GLM-4V-Flash(視覺)」;若 DSH 版本支持貼圖轉述,輸入框應出現添加圖片按鈕。完整排錯見倉庫 docs/SETUP_VISION.md。
典型用法¶
README 歸納了三種讀圖方式:
| 方式 | 操作 | 適用場景 |
|---|---|---|
| A. 直接貼圖 | 任意會話點添加圖片 / 拖拽 / 粘貼後發送 | 日常看圖,無需切模型或存文件 |
| B. 視覺模型會話 | 新對話選「智譜 GLM-4V-Flash(視覺)」,貼圖對話 | 多輪圍繞圖片、原生 read_image |
| C. 文件 + Skill | 圖片放入工作區,提示 agent 用 vision-review 讀取 | 批量檢查、腳本化流程 |
轉述語言跟隨你發送消息的語言(中文消息出中文描述,英文消息出英文描述;未輸入文字時默認中文)。
自然語言也可觸發 Skill:
- 「看看這張圖 / 檢查這個截圖有沒有視覺 bug」→
vision-review - 「給我生成一張 XX 的圖」→
media-tools
倉庫 examples/ 目錄提供 6 張 AI 生成示例圖及一張讀圖測試卡,可用於檢驗 OCR 與版面識別準確度。
適用場景與注意¶
適合誰
- 已在 DSH 上開發智能體,需要在純文本會話裏快速理解截圖、設計稿、報錯界面。
- 希望在同一條插件裏完成免費讀圖與無水印生圖,且 Key 留在本地、不經共享匿名端點。
- 使用 rc.7 / rc.8 或 v0.1.1-rc.x,願意按文檔配置免費視覺 / 生圖 API。
安裝前務必瞭解
- 插件以當前
dsh進程權限運行;安裝前應閱讀源碼與 MIT 許可證,確認 Key 存放方式符合你的安全要求。 - 貼圖直讀依賴 DSH 本體是否包含對應 api-proxy 支持;僅安裝本 bundle 不能保證所有版本都出現添加圖片按鈕,判斷方法見
docs/SETUP_VISION.mdFAQ。 - DeepSeek-V4-Flash-Vision-Exp 走 DeepSeek API 餘額;GLM-4V-Flash、Kolors 等爲官方標註的免費額度,具體限額以各提供方爲準。
- 可與 ModLens 共存;粘貼路由順序與配置說明見
docs/COMPARE_MODLENS.md。
結尾¶
dsh-media-skills 把免費視覺路由、vision-review 讀圖與 media-tools 生圖打包進一個 DSH bundle,密鑰本地保管、不寫進倉庫。若你正在 DSH 上補齊多模態能力,可按上文命令安裝並按 Harness 版本配置 Key。
- SkillHub 目錄:https://www.skillhub.cn/plugins/MJorgin/dsh-media-skills
- GitHub 倉庫:https://github.com/MJorgin/dsh-media-skills