dsh-vision-opencode:为纯文本主模型配置可切换的识图模型

前言

在 DeepSeek Harness(DSH)里用纯文本主模型(如 DeepSeek)聊天时,常见问题是主模型不认图:要么换多模态模型,要么手动把截图内容敲进对话。dsh-vision-opencode 走另一条路——聊天里发图时,先交给可配置的视觉模型转成文字,主模型照常回复,不必切换主模型。

下面介绍这个插件的定位、能力与安装配置方式。资料来自 SkillHub 目录页GitHub 仓库(维护者 poiuyjie,MIT 许可证,当前版本 0.4.2)。

这是什么

dsh-vision-opencode 是 DSH 的 Web 端插件,分类为模型推理。一句话定位:通过任意视觉模型,把图片自动转成文字,供纯文本 LLM 使用。

插件会自动识别纯文本主模型并接管图片;若主模型本身支持多模态,则保留 DSH 原生链路,无需改模型目录。

核心功能

聊天发图自动转换

在对话里发送图片时,插件将图片交给所选识图模型(如 MiMo-V2.5)转成文字描述,再交给主模型继续推理。输入框右侧提供「识图模型」下拉,自动列出各供应商中支持图片的模型。

Vision 设置与工具

在 设置 → Vision 可独立管理识图模型。插件还提供:

  • vision_read_image 工具
  • vision-image-analysis skill

可用于 OCR、图表、截图理解等场景。

异常兜底

单次请求 60 秒超时;失败重试 1 次;重试耗尽后降级为占位文本,避免拖垮整个回合。

渠道状态与推理策略

设置 → Vision 中,各渠道(提供方分组)名称旁有状态圆点,逻辑与官方「模型」页一致:

  • 已配置 API 密钥(宿主路由的 apiKeyEnv 或插件写入的 <PROVIDER>_API_KEY 任一可用)显示为绿点
  • 明确未配置密钥显示为红点
  • 不显示表示状态未知(如凭据服务不可用)

每个识图模型可单独设置「推理」策略:

选项 含义
默认 跟随供应商默认档位
关闭 不思考,更快更省;仅当供应商真实声明 off 时提供
强制关闭 尽力关掉思考(如 reasoning_effort:"none"),不保证成功

各供应商对「关闭思考」的字段声明不一致,插件只能尽力区分「关闭」与「强制关闭」并试参数,不保证每个供应商都能真正关掉。

安装与启用

推荐用 DSH 原生命令安装:

dsh plugin --profile web add -w github:poiuyjie/dsh-vision-opencode

也可用一键脚本(Ubuntu 用 install.sh,Windows 用 install.ps1):

curl -fsSL https://raw.githubusercontent.com/poiuyjie/dsh-vision-opencode/main/scripts/install.sh | bash

安装完成后重启 dsh,在输入框右侧选择识图模型即可启用。

卸载命令:

dsh plugin --profile web remove -w dsh-vision-opencode

也可使用仓库中的 uninstall.sh。卸载前建议备份包含图片的会话——卸载后这些旧会话可能无法再发给纯文本主模型。

配置

编辑 ~/.dsh/settings.yaml,或在 设置 → Vision 图形化管理:

vision-opencode:
  provider: ''       # 识图模型供应商;空 = 未选择
  model: ''          # 识图模型 id;空 = 未选择
  autoConvert: true  # 发图自动转换开关;出问题可改 false 关掉

若只想保留工具和选择器、关闭自动转换,将 autoConvert 设为 false 后重启即可。

典型用法

1、安装插件并重启 dsh

2、在 设置 → Vision 选择识图模型的供应商与模型 id,或直接在输入框右侧「识图模型」下拉中选择。

3、确认对应渠道的 API 密钥已配置(状态圆点为绿)。

4、在对话中发送图片。插件自动调用识图模型转成文字,主模型基于转换结果继续回复。

5、需要主动识图时,可调用 vision_read_image 工具或使用 vision-image-analysis skill。

适用场景与注意

适合谁:

  • 主模型固定为纯文本模型,但对话中偶尔需要发截图、图表、文档图片
  • 希望识图模型与主模型分离配置,按供应商切换而无需改主模型目录
  • 需要在 DSH 内做 OCR 或截图理解,且希望通过工具 / skill 复用同一套识图能力

注意事项:

  • 插件以当前 dsh 进程权限运行,安装前应检查 源码 与 MIT 许可证
  • 需要 Node.js >= 20.3;依赖 @deepseek-ai/dsh-llmdsh-toolsdsh-settings 等 peer 包(rc.6 及以上)
  • 图片转换异常或选择器不出现,多半是识图模型未选或版本差异,可查看浏览器控制台报错并在 GitHub 提 issue
  • 纯文本与多模态主模型会自动区分,切换供应商一般无需再改配置

链接

SkillHub 是面向中国用户的 Skills 社区目录,与 DeepSeek / 幻方无官方从属关系。dsh-vision-opencode 的价值在于:在不换主模型的前提下,给纯文本 LLM 补上可配置的识图能力。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜