前言¶
DeepSeek Harness(DSH)擅长文本推理,但纯文本模型无法直接理解聊天框里拖入的截图或设计稿。社区里不少视觉插件只解决「读图」,且常引导用户走共享的第三方端点;图片会经过你不完全可控的中间服务。
下面介绍 dsh-media-skills(GitHub:MJorgin/dsh-media-skills)。它在 DSH 插件生态里归类为「模型推理」,由维护者 MJorgin 发布,当前 package 版本为 0.3.0,MIT 许可。插件 bundle 提供两个 Skill、一条自动写入的视觉模型路由,以及可配置的视觉引擎故障转移链;密钥不写进仓库,读图与生图均走用户自选的免费或已有 API 提供方。
这是什么¶
dsh-media-skills 的定位是:给 DSH 装上「眼睛」和「画笔」——在任意会话里粘贴图片并自动转述为文字,同时支持按需生成无水印插画。官方说明支持 DeepSeek Harness rc.7、rc.8、v0.1.1-rc.1、v0.1.1-rc.2;Python 3.9+。
与常见「只读图」插件相比,本 bundle 额外提供 media-tools 生图能力,并在安装后自动向模型选择器写入「智谱 GLM-4V-Flash(视觉)」路由。SkillHub 目录页:https://www.skillhub.cn/plugins/MJorgin/dsh-media-skills(社区独立站点,与 DeepSeek / 幻方无官方从属关系)。
核心功能¶
贴图自动转述¶
在纯文本会话中,可通过粘贴、拖拽或「添加图片」按钮(rc.7 / rc.8 需配套 client-ux 补丁)送入图片。视觉模型将图片转为文字描述,连同缩略图交给当前模型。
- v0.1.1-rc.1 及以上:默认使用 DeepSeek-V4-Flash-Vision-Exp,与主 agent 共用
DEEPSEEK_API_KEY。 - rc.7 / rc.8:默认 GLM-4V-Flash,单路由超时 15s,可故障转移至 SiliconFlow Qwen3-VL。
贴图转述管道属于 DSH 本体(api-proxy 图片准入逻辑);本 bundle 提供其依赖的视觉路由与读图 Skill。rc.7 / rc.8 需应用仓库内 cordis.patch.yml 及文档中的 Harness 补丁,详见 docs/HARNESS_PATCH.md。
vision-review¶
读图 Skill,用于分析截图、识别界面视觉问题(重叠、溢出、错位)、检测水印 Logo、将图片转为文字。可选 --structured 模式,输出 ModLens 风格的结构化证据 JSON(summary、全文 OCR、阅读顺序版面、实体关系、不确定性)。
视觉引擎故障转移顺序:GLM-4V-Flash → DeepSeek-V4-Flash-Vision-Exp → SiliconFlow Qwen3-VL → SenseNova → Google Gemini → 任意 OpenAI 兼容端点。配置了对应 Key 的引擎会自动加入链路。
media-tools¶
生图 Skill,用于生成插画、头像、背景、Banner。模型路由为 SenseNova U1 Fast → SiliconFlow Kolors,官方说明为免费且无水印。
视觉模型路由¶
安装后模型选择器自动出现「智谱 GLM-4V-Flash(视觉)」。v0.1.1 的 deepseek-official 路由还原生携带 DeepSeek-V4-Flash-Vision-Exp。新开对话选中任一视觉模型即可直接围绕图片多轮对话。
安装与启用¶
官方安装命令如下,<name> 替换为你的 DSH profile 名称:
dsh plugin --profile <name> add github:MJorgin/dsh-media-skills
先做 Key 配置,再重启服务。
- v0.1.1-rc.1+:若已配置主 agent 的
DEEPSEEK_API_KEY,贴图转述与 DeepSeek 视觉路由无需额外 Key。 - rc.7 / rc.8 或需免费引擎:智谱 open.bigmodel.cn 申请
glm-4v-flash(免费);SiliconFlow siliconflow.cn 申请 Kolors 用 Key;可选 Google Gemini aistudio.google.com 加入读图回退链。
Key 写入 Web 界面 设置 → 模型 中 zhipu-vision 提供方的 API Key 栏,或写入凭据文件:
# ~/.dsh/.credentials.yaml(建议 chmod 600)
GLM_API_KEY: <你的智谱 Key>
Skill 脚本还会按顺序读取环境变量、~/.dsh/secrets/media-tools.env、~/.codex/secrets/media-tools.env:
# ~/.dsh/secrets/media-tools.env(建议 chmod 600)
GLM_API_KEY=...
SILICONFLOW_API_KEY=...
GEMINI_API_KEY=... # 可选
- 彻底重启
dsh web,浏览器强刷(Linux 上一般为Ctrl+Shift+R)。
验证:模型选择器出现「智谱 GLM-4V-Flash(视觉)」;若 DSH 版本支持贴图转述,输入框应出现添加图片按钮。完整排错见仓库 docs/SETUP_VISION.md。
典型用法¶
README 归纳了三种读图方式:
| 方式 | 操作 | 适用场景 |
|---|---|---|
| A. 直接贴图 | 任意会话点添加图片 / 拖拽 / 粘贴后发送 | 日常看图,无需切模型或存文件 |
| B. 视觉模型会话 | 新对话选「智谱 GLM-4V-Flash(视觉)」,贴图对话 | 多轮围绕图片、原生 read_image |
| C. 文件 + Skill | 图片放入工作区,提示 agent 用 vision-review 读取 | 批量检查、脚本化流程 |
转述语言跟随你发送消息的语言(中文消息出中文描述,英文消息出英文描述;未输入文字时默认中文)。
自然语言也可触发 Skill:
- 「看看这张图 / 检查这个截图有没有视觉 bug」→
vision-review - 「给我生成一张 XX 的图」→
media-tools
仓库 examples/ 目录提供 6 张 AI 生成示例图及一张读图测试卡,可用于检验 OCR 与版面识别准确度。
适用场景与注意¶
适合谁
- 已在 DSH 上开发智能体,需要在纯文本会话里快速理解截图、设计稿、报错界面。
- 希望在同一条插件里完成免费读图与无水印生图,且 Key 留在本地、不经共享匿名端点。
- 使用 rc.7 / rc.8 或 v0.1.1-rc.x,愿意按文档配置免费视觉 / 生图 API。
安装前务必了解
- 插件以当前
dsh进程权限运行;安装前应阅读源码与 MIT 许可证,确认 Key 存放方式符合你的安全要求。 - 贴图直读依赖 DSH 本体是否包含对应 api-proxy 支持;仅安装本 bundle 不能保证所有版本都出现添加图片按钮,判断方法见
docs/SETUP_VISION.mdFAQ。 - DeepSeek-V4-Flash-Vision-Exp 走 DeepSeek API 余额;GLM-4V-Flash、Kolors 等为官方标注的免费额度,具体限额以各提供方为准。
- 可与 ModLens 共存;粘贴路由顺序与配置说明见
docs/COMPARE_MODLENS.md。
结尾¶
dsh-media-skills 把免费视觉路由、vision-review 读图与 media-tools 生图打包进一个 DSH bundle,密钥本地保管、不写进仓库。若你正在 DSH 上补齐多模态能力,可按上文命令安装并按 Harness 版本配置 Key。
- SkillHub 目录:https://www.skillhub.cn/plugins/MJorgin/dsh-media-skills
- GitHub 仓库:https://github.com/MJorgin/dsh-media-skills