ds-vision-plugin:DeepSeek Harness 的网页图片转文本插件

前言

DeepSeek Harness(DSH)通过插件扩展智能体工作流,社区目录是独立站点,不代表 DeepSeek 或幻方的官方应用商店。一个具体痛点是:文本型 DeepSeek 模型本身只处理文本,但在 Harness Web composer 里,用户仍可能直接粘贴或拖入截图、文档图片。ds-vision-plugin 用来解决这个输入断层:它把网页中的图片转成文本,再交给文本型 DeepSeek 模型继续处理,同时提供视觉分析、OCR 路由和诊断工具。

这是什么

ds-vision-plugin 是一个 DeepSeek Harness 插件,由 Sorwcyra 维护,许可证为 MIT

它的一句话定位是:为 DeepSeek Harness 提供自动网页图片到文本桥接,并附带视觉和 OCR 工具。

对使用者来说,它解决的问题是:在 Harness Web composer 中粘贴或拖入图片后,不需要先手动保存路径、调用外部工具或切换模型,插件会把图片替换为可用于文本推理的内容。

核心功能

自动网页图片转文本

在 Harness Web composer 中粘贴或拖入图片后,插件会把图片替换为与图片内容对应的文本,供文本型 DeepSeek 模型继续处理。

四模型竞速

插件支持四模型 first-success race,默认使用的模型为:

  • agnes-2.5-flash
  • agnes-2.0-flash
  • glm-4v-flash
  • glm-4.1v-thinking-flash

首个有效结果会被交给文本型 DeepSeek 模型。明确不使用 glm-4.6v-flash

OCR 路由

插件支持将图片路由到 Baidu OCR 或本地 Tesseract。如果 OCR 不可用,会回退到 VLM。

自定义模型与本地运行时

可以添加用户自有的 OpenAI-compatible 模型,加入并发竞速或顺序回退。也支持本地 Ollama/LM Studio

诊断与失败处理

插件暴露 vision_analyzevision_status,用于工作区文件和诊断。

它也提供:

  • YAML 热重载
  • 结果缓存
  • 超时控制
  • 大小限制
  • 严格失败或可见失败标注

图片不会被静默丢弃;失败时由部署方选择可见标注或严格失败。

引导式 CLI

插件提供引导式 CLI,覆盖:

  • setup
  • keys
  • status
  • custom models
  • live verification

密钥按环境变量命名,vision_status 不返回密钥内容。

安装与启用

环境要求:Node.js 22.19+24+

在 PowerShell、Command Prompt、bash 或 zsh 中运行:

npx -y github:Sorwcyra/ds-vision-plugin

该命令用于安装或更新插件,并进入后续配置与启动流程。当前默认 Web 端口为 3080;快速安装命令不覆盖该端口。如果默认端口已经在服务,它会打开现有 Web UI,而不是重复启动进程。

常用可选参数:

npx -y github:Sorwcyra/ds-vision-plugin --update

用于在包版本一致时也重新安装。

npx -y github:Sorwcyra/ds-vision-plugin --port 8080

用于显式覆盖 Harness Web 端口。

npx -y github:Sorwcyra/ds-vision-plugin --no-open

用于启动时不打开浏览器。

npx -y github:Sorwcyra/ds-vision-plugin --no-start

用于只安装和配置,不启动。

典型用法

下面是最直接的流程:

1、运行快速安装命令:

npx -y github:Sorwcyra/ds-vision-plugin

2、按 CLI 引导完成 setup、keys、status、custom models 和 live verification。

3、在 Harness Web composer 中粘贴或拖入图片。

4、插件把图片替换为文本后,文本型 DeepSeek 模型继续处理。

5、如需检查工作区文件或诊断状态,可使用插件暴露的 vision_analyzevision_status

适用场景与注意

适合这类场景:主模型是文本型 DeepSeek,但你希望用户在 Harness Web 输入框里直接处理截图、文档图片或工具结果中的图片。

使用前需要注意:

  • 四路竞速会为每个未缓存图片发起四个 provider 请求。
  • 如果更关注请求数、成本或数据暴露,优先选择本地 VLM/OCR 路线。
  • 图片不会被静默丢弃;失败时按部署配置选择可见标注或严格失败。
  • 密钥通过环境变量管理,vision_status 不返回密钥内容。
  • 插件以当前 dsh 进程权限运行;安装前应检查源码和 MIT 许可证。
  • 当前默认 Web 端口为 3080,快速安装命令不会强制覆盖该端口。

仓库地址:

https://github.com/Sorwcyra/ds-vision-plugin
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜