dsh-llm-deepseek-vision:给 DeepSeek Harness 的纯文本模型提供视觉输入

前言

在 DeepSeek Harness(DSH)里,模型能力通常由插件按路由组合。如果你使用的 DeepSeek 纯文本模型无法直接接收图片,常见做法是额外接一个视觉模型,先把图片转成文字,再交给文本模型推理。

dsh-llm-deepseek-vision 把这个流程封装成 DSH 插件:注册一个 DeepSeek (Vision) 路由,让纯文本模型基于视觉模型给出的图片描述继续推理,而不是直接处理图片字节。

定位

它由 NagasakiSoyo-ui 维护,许可证为 MIT

插件通过 npm 包名 @deepseek-ai/dsh-llm-deepseek-vision 安装,并声明 dsh.bundle manifest;也支持从源码构建后接入 Harness 部署。

工作原理

下面介绍它的三条核心行为:

1、注册额外的 provider 路由:deepseek-vision

2、对外广告 deepseek-v4-flashdeepseek-v4-pro,并声明:

input: [text, image]

3、按请求内容分流:

  • 不带图片:零开销透传到文本推理路由,默认是 opencode-go
  • 带图片:由配置的视觉模型把每张图描述成文字,再交给纯文本模型基于描述推理。

默认情况下,文本推理与图片描述都跑在 OpenCode Zen Go(opencode-go)。

安装

先用 npm 包安装插件,并挂到 web profile:

dsh plugin --profile web add @deepseek-ai/dsh-llm-deepseek-vision

如果需要从源码构建,可以按下面步骤操作:

git clone https://github.com/NagasakiSoyo-ui/dsh-llm-deepseek-vision.git
cd dsh-llm-deepseek-vision
npm install
npm run build

构建完成后,再把插件产物接入你的 Harness 部署。

挂载到组合配置

在 profile 的 cordis.patch.yml 中添加插件条目,并配置视觉路由、委托路由和模型目录:

- id: llm-deepseek-vision
  name: '@deepseek-ai/dsh-llm-deepseek-vision'
  config:
    visionProvider: opencode-go
    visionModel: <支持 [text, image] 的视觉模型 id>
    visionPrompt: <给视觉模型的描述指令>
    visionMaxTokens: 1024
    delegateProvider: opencode-go
    models:
      - id: deepseek-v4-flash
      - id: deepseek-v4-pro

visionProvider 指向提供视觉模型的 provider 路由;delegateProvider 指向实际完成文本推理的路由。models 决定这个 deepseek-vision 路由对外展示的模型目录。

前置条件

启用前需要确认以下几点:

1、视觉 provider 路由必须存在,并且其模型被声明为支持图片输入:

input: [text, image]

2、视觉模型必须能被其 provider 路由解析。

3、视觉模型的 provider 必须能完成认证,并在凭据库中配置对应的 apiKeyEnv

4、Harness 必须挂载持久化附件服务;dsh-base 已内置该服务。

5、如果手写声明了 pi-ai 路由条目,但未声明推理能力,会被按“可关闭思考”处理,即发送 off

使用

经过上面的配置后,在模型选择器中选择 DeepSeek (Vision),再选择 deepseek-v4-flashdeepseek-v4-pro,然后在消息中附加图片。

如果希望它成为会话默认模型,可以设置:

agent-default-model:
  provider: deepseek-vision
  model: deepseek-v4-flash

配置项

字段 说明
visionProvider 提供视觉模型的 provider 路由
visionModel 视觉模型 id,必须支持 [text, image] 输入
visionPrompt 给视觉模型的描述指令
visionMaxTokens 单次视觉描述的输出上限
delegateProvider 接收文字请求并推理的路由
models 该路由对外广告的模型目录

适用场景与注意

适合已有 DSH 纯文本模型、但需要让模型基于图片作答的场景。插件不改变推理模型本身,而是在请求链路中把图片转换为文字描述,再交给文本模型继续推理。

使用前注意:

1、视觉描述每轮都会重新生成;如果会话日志里包含图片,每轮都会重新描述。

2、回放一个视觉轮次会重新运行视觉模型。

3、插件以当前 dsh 进程权限运行,安装前应检查源码与许可证。

4、DSH 插件生态强调“一切皆插件”;插件目录是独立站点,与 DeepSeek / 幻方无官方从属关系,不应把它理解为官方应用商店。

结尾

dsh-llm-deepseek-vision 的价值在于把“看图”和“推理”拆开:视觉模型负责把图片描述成文字,纯文本模型负责基于这些描述完成推理。

目录页线索(来自插件线索,使用前请自行确认):

https://www.skillhub.cn/plugins/NagasakiSoyo-ui/dsh-llm-deepseek-vision

GitHub 仓库:

https://github.com/NagasakiSoyo-ui/dsh-llm-deepseek-vision
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜