前言¶
用 DeepSeek Harness(DSH)时有一个绕不开的限制:DeepSeek 官方模型是纯文本模型,本身不能看图。消息里出现截图、图表或界面照片,要么人工把内容转述成文字,要么把整段对话切到别的多模态模型,上下文就断了。
DeepSeek VisionPlus 走的是另一条路:文本请求继续由 DeepSeek 官方 API 处理,消息中出现图片时自动路由到免费视觉模型池,理解结果回到同一对话。DSH 的理念是一切皆插件,这个能力就是以插件形态实现的。下面介绍它的功能、安装和日常用法。
这是什么¶
DeepSeek VisionPlus(npm 包名 dsh-visionplus,版本 1.0.0)是面向 DeepSeek Harness 的视觉插件,由 qq247505 维护,MIT 许可证。一句话定位:文本走 DeepSeek 官方 API,图片自动路由到免费视觉模型池。
它是零补丁插件:不修改 Harness 源码,源码运行、桌面端、npm 任一安装方式,装上即完整形态。
核心功能¶
自动视觉路由¶
消息中出现图片——选图、粘贴,或模型自主调用 read_image——自动交给视觉池处理;无图请求仍走 DeepSeek,推理等级(Off/High/Max)原样保留。
设置卡片¶
设置 → 桥接视觉 是一个独立栏目。在这里可以添加视觉模型、配置密钥、编辑模型目录(模型 ID、名称、上下文窗口、最大输出,支持 K/M 单位),保存实时生效。
输入框图片按钮¶
选中视觉变体后,输入框出现图片按钮,支持选图、多选、拖拽即发。
一键测试¶
DeepSeek 与每个视觉模型都有测试按钮。流程是先校验参数(密钥、地址、模型 ID、官方上限),再按官方对接方式发起真实请求,结果以气泡提示,3 秒消失。
免费额度保护¶
免费视觉模型频率有限,插件做了三层保护:
1、视觉池顺序轮换 + 限频(最小间隔、每分钟上限、失败冷却);
2、单个模型失败自动换下一个;
3、全部失败时如实抛回,由 DeepSeek 自行决策本轮怎么处理。
状态行、缓存与视觉记忆¶
对话里会显示「正在调用 xx 处理图片…」「成功」或失败原因。
另外两项和长会话相关的能力:
- 内容哈希缓存:同图 + 同问题 + 同模型自动复用上次结果,不重复调用视觉接口,LRU 上限 64;
- 视觉记忆:视觉结果以带标记的对话行留存,会话压缩(compaction)后自动补回最近 4 条,长线任务不丢视觉上下文。
自主看图引导¶
选中视觉变体的会话会自动获得看图引导:模型主动调用 read_image、一次读 1-2 张、失败单独重试。切回 DeepSeek 原生模型即自动移除,不影响其他会话。
安装与启用¶
要求:已安装官方 DeepSeek Harness(桌面端或命令行运行均可)、pnpm,Node >= 20。
dsh plugin --profile web add github:qq247505/DeepSeek-VisionPlus
装好后按下面的步骤配置:
1、重启 Harness,打开 设置 → 桥接视觉 卡片;
2、DeepSeek 块填入 DEEPSEEK_API_KEY(API 地址默认官方 https://api.deepseek.com),点「测试」验证;
3、点「+ 智谱(GLM)」或「+ Qwen(千问)」添加视觉模型,填入对应密钥(GLM_API_KEY / SILICONFLOW_API_KEY),各点「测试」验证;
4、保存后,在对话页模型选择器选择 DeepSeek-V4-Pro 视觉(或 Flash 视觉);
5、输入框点图片按钮发图,或让模型自主 read_image,视觉任务自动路由。
预置了三个视觉模型,规格如下:
| 视觉模型 | 模型 | 上下文 | 最大输出 |
|---|---|---|---|
| 智谱 GLM | glm-4.1v-thinking-flash | 64K | 16K |
| 智谱 GLM | glm-4.6v-flash | 128K | 32K |
| SiliconFlow | Qwen/Qwen3-VL-8B-Instruct | 64K | 16K |
实现细节¶
几点值得留意的设计:
- 设置存储在插件自有命名空间,通过插件自挂接口
/api/visionPlus.settings读写,不借用 llm-pi-ai; - 内部视觉线路不会出现在模型选择器,用户只能选到对外暴露的视觉变体;
- 会话级模型切换接管
agentDefaultModel.saveSelection,切换只影响当前会话,不污染全局默认; - 以上全部是插件运行时能力,没有对 Harness 源码打补丁。
常见问题¶
- 测试报 401:检查密钥是否填写正确;
- 测试报 404:检查 API 地址与模型 ID;
- 视觉请求 429:免费模型频率有限,插件自带限频,稍后重试;
- 想再加视觉模型:点「+ 自定义模型」,按对方官方文档填写。
适用场景与注意¶
适合的场景:日常以 DeepSeek 官方模型为主力,偶尔需要看截图、图表、界面,不想为此切换整个对话模型;长会话希望视觉上下文在压缩后不丢;想保持 DSH 环境干净、不愿改源码的。
注意两点:
1、免费视觉模型频率有限,重度看图需求要接受轮换和限频的存在,遇 429 稍后重试;
2、插件以当前 dsh 进程的权限运行,安装任何第三方插件前建议先查看仓库源码与许可证(本项目为 MIT)。
卸载¶
dsh plugin --profile web remove dsh-visionplus
零补丁插件,卸载即干净,无需回退任何宿主改动。
小结¶
DeepSeek VisionPlus 解决的问题很具体:让纯文本的 DeepSeek 在 DSH 里能看图,同时不改变原有的文本链路和推理设置。装一个插件、填几个密钥就能用,卸载也不留痕迹。如果你在用 DSH,可以试一试。
- GitHub 仓库:https://github.com/qq247505/DeepSeek-VisionPlus
- 社区目录收录页:https://www.skillhub.cn/plugins/qq247505/DeepSeek-VisionPlus
社区目录为独立站点,与 DeepSeek、幻方无官方从属关系;插件信息以 GitHub 仓库为准。