前言¶
在 DeepSeek Harness(DSH)里,模型能力通常由插件按路由组合。如果你使用的 DeepSeek 纯文本模型无法直接接收图片,常见做法是额外接一个视觉模型,先把图片转成文字,再交给文本模型推理。
dsh-llm-deepseek-vision 把这个流程封装成 DSH 插件:注册一个 DeepSeek (Vision) 路由,让纯文本模型基于视觉模型给出的图片描述继续推理,而不是直接处理图片字节。
定位¶
它由 NagasakiSoyo-ui 维护,许可证为 MIT。
插件通过 npm 包名 @deepseek-ai/dsh-llm-deepseek-vision 安装,并声明 dsh.bundle manifest;也支持从源码构建后接入 Harness 部署。
工作原理¶
下面介绍它的三条核心行为:
1、注册额外的 provider 路由:deepseek-vision。
2、对外广告 deepseek-v4-flash 和 deepseek-v4-pro,并声明:
input: [text, image]
3、按请求内容分流:
- 不带图片:零开销透传到文本推理路由,默认是
opencode-go。 - 带图片:由配置的视觉模型把每张图描述成文字,再交给纯文本模型基于描述推理。
默认情况下,文本推理与图片描述都跑在 OpenCode Zen Go(opencode-go)。
安装¶
先用 npm 包安装插件,并挂到 web profile:
dsh plugin --profile web add @deepseek-ai/dsh-llm-deepseek-vision
如果需要从源码构建,可以按下面步骤操作:
git clone https://github.com/NagasakiSoyo-ui/dsh-llm-deepseek-vision.git
cd dsh-llm-deepseek-vision
npm install
npm run build
构建完成后,再把插件产物接入你的 Harness 部署。
挂载到组合配置¶
在 profile 的 cordis.patch.yml 中添加插件条目,并配置视觉路由、委托路由和模型目录:
- id: llm-deepseek-vision
name: '@deepseek-ai/dsh-llm-deepseek-vision'
config:
visionProvider: opencode-go
visionModel: <支持 [text, image] 的视觉模型 id>
visionPrompt: <给视觉模型的描述指令>
visionMaxTokens: 1024
delegateProvider: opencode-go
models:
- id: deepseek-v4-flash
- id: deepseek-v4-pro
visionProvider 指向提供视觉模型的 provider 路由;delegateProvider 指向实际完成文本推理的路由。models 决定这个 deepseek-vision 路由对外展示的模型目录。
前置条件¶
启用前需要确认以下几点:
1、视觉 provider 路由必须存在,并且其模型被声明为支持图片输入:
input: [text, image]
2、视觉模型必须能被其 provider 路由解析。
3、视觉模型的 provider 必须能完成认证,并在凭据库中配置对应的 apiKeyEnv。
4、Harness 必须挂载持久化附件服务;dsh-base 已内置该服务。
5、如果手写声明了 pi-ai 路由条目,但未声明推理能力,会被按“可关闭思考”处理,即发送 off。
使用¶
经过上面的配置后,在模型选择器中选择 DeepSeek (Vision),再选择 deepseek-v4-flash 或 deepseek-v4-pro,然后在消息中附加图片。
如果希望它成为会话默认模型,可以设置:
agent-default-model:
provider: deepseek-vision
model: deepseek-v4-flash
配置项¶
| 字段 | 说明 |
|---|---|
visionProvider |
提供视觉模型的 provider 路由 |
visionModel |
视觉模型 id,必须支持 [text, image] 输入 |
visionPrompt |
给视觉模型的描述指令 |
visionMaxTokens |
单次视觉描述的输出上限 |
delegateProvider |
接收文字请求并推理的路由 |
models |
该路由对外广告的模型目录 |
适用场景与注意¶
适合已有 DSH 纯文本模型、但需要让模型基于图片作答的场景。插件不改变推理模型本身,而是在请求链路中把图片转换为文字描述,再交给文本模型继续推理。
使用前注意:
1、视觉描述每轮都会重新生成;如果会话日志里包含图片,每轮都会重新描述。
2、回放一个视觉轮次会重新运行视觉模型。
3、插件以当前 dsh 进程权限运行,安装前应检查源码与许可证。
4、DSH 插件生态强调“一切皆插件”;插件目录是独立站点,与 DeepSeek / 幻方无官方从属关系,不应把它理解为官方应用商店。
结尾¶
dsh-llm-deepseek-vision 的价值在于把“看图”和“推理”拆开:视觉模型负责把图片描述成文字,纯文本模型负责基于这些描述完成推理。
目录页线索(来自插件线索,使用前请自行确认):
https://www.skillhub.cn/plugins/NagasakiSoyo-ui/dsh-llm-deepseek-vision
GitHub 仓库:
https://github.com/NagasakiSoyo-ui/dsh-llm-deepseek-vision