前言¶
在 DeepSeek Harness(DSH)里用纯文本主模型(如 DeepSeek)聊天时,常见问题是主模型不认图:要么换多模态模型,要么手动把截图内容敲进对话。dsh-vision-opencode 走另一条路——聊天里发图时,先交给可配置的视觉模型转成文字,主模型照常回复,不必切换主模型。
下面介绍这个插件的定位、能力与安装配置方式。资料来自 SkillHub 目录页 与 GitHub 仓库(维护者 poiuyjie,MIT 许可证,当前版本 0.4.2)。
这是什么¶
dsh-vision-opencode 是 DSH 的 Web 端插件,分类为模型推理。一句话定位:通过任意视觉模型,把图片自动转成文字,供纯文本 LLM 使用。
插件会自动识别纯文本主模型并接管图片;若主模型本身支持多模态,则保留 DSH 原生链路,无需改模型目录。
核心功能¶
聊天发图自动转换¶
在对话里发送图片时,插件将图片交给所选识图模型(如 MiMo-V2.5)转成文字描述,再交给主模型继续推理。输入框右侧提供「识图模型」下拉,自动列出各供应商中支持图片的模型。
Vision 设置与工具¶
在 设置 → Vision 可独立管理识图模型。插件还提供:
vision_read_image工具vision-image-analysisskill
可用于 OCR、图表、截图理解等场景。
异常兜底¶
单次请求 60 秒超时;失败重试 1 次;重试耗尽后降级为占位文本,避免拖垮整个回合。
渠道状态与推理策略¶
设置 → Vision 中,各渠道(提供方分组)名称旁有状态圆点,逻辑与官方「模型」页一致:
- 已配置 API 密钥(宿主路由的
apiKeyEnv或插件写入的<PROVIDER>_API_KEY任一可用)显示为绿点 - 明确未配置密钥显示为红点
- 不显示表示状态未知(如凭据服务不可用)
每个识图模型可单独设置「推理」策略:
| 选项 | 含义 |
|---|---|
| 默认 | 跟随供应商默认档位 |
| 关闭 | 不思考,更快更省;仅当供应商真实声明 off 时提供 |
| 强制关闭 | 尽力关掉思考(如 reasoning_effort:"none"),不保证成功 |
各供应商对「关闭思考」的字段声明不一致,插件只能尽力区分「关闭」与「强制关闭」并试参数,不保证每个供应商都能真正关掉。
安装与启用¶
推荐用 DSH 原生命令安装:
dsh plugin --profile web add -w github:poiuyjie/dsh-vision-opencode
也可用一键脚本(Ubuntu 用 install.sh,Windows 用 install.ps1):
curl -fsSL https://raw.githubusercontent.com/poiuyjie/dsh-vision-opencode/main/scripts/install.sh | bash
安装完成后重启 dsh,在输入框右侧选择识图模型即可启用。
卸载命令:
dsh plugin --profile web remove -w dsh-vision-opencode
也可使用仓库中的 uninstall.sh。卸载前建议备份包含图片的会话——卸载后这些旧会话可能无法再发给纯文本主模型。
配置¶
编辑 ~/.dsh/settings.yaml,或在 设置 → Vision 图形化管理:
vision-opencode:
provider: '' # 识图模型供应商;空 = 未选择
model: '' # 识图模型 id;空 = 未选择
autoConvert: true # 发图自动转换开关;出问题可改 false 关掉
若只想保留工具和选择器、关闭自动转换,将 autoConvert 设为 false 后重启即可。
典型用法¶
1、安装插件并重启 dsh。
2、在 设置 → Vision 选择识图模型的供应商与模型 id,或直接在输入框右侧「识图模型」下拉中选择。
3、确认对应渠道的 API 密钥已配置(状态圆点为绿)。
4、在对话中发送图片。插件自动调用识图模型转成文字,主模型基于转换结果继续回复。
5、需要主动识图时,可调用 vision_read_image 工具或使用 vision-image-analysis skill。
适用场景与注意¶
适合谁:
- 主模型固定为纯文本模型,但对话中偶尔需要发截图、图表、文档图片
- 希望识图模型与主模型分离配置,按供应商切换而无需改主模型目录
- 需要在 DSH 内做 OCR 或截图理解,且希望通过工具 / skill 复用同一套识图能力
注意事项:
- 插件以当前
dsh进程权限运行,安装前应检查 源码 与 MIT 许可证 - 需要 Node.js >= 20.3;依赖
@deepseek-ai/dsh-llm、dsh-tools、dsh-settings等 peer 包(rc.6 及以上) - 图片转换异常或选择器不出现,多半是识图模型未选或版本差异,可查看浏览器控制台报错并在 GitHub 提 issue
- 纯文本与多模态主模型会自动区分,切换供应商一般无需再改配置
链接¶
- 目录页:https://www.skillhub.cn/plugins/poiuyjie/dsh-vision-opencode
- GitHub:https://github.com/poiuyjie/dsh-vision-opencode
SkillHub 是面向中国用户的 Skills 社区目录,与 DeepSeek / 幻方无官方从属关系。dsh-vision-opencode 的价值在于:在不换主模型的前提下,给纯文本 LLM 补上可配置的识图能力。