前言¶
纯文本模型本身不能直接理解图片。开发者如果希望在 DSH 中处理截图、报错图、UI 分析、OCR 或文档内容,通常需要额外接入视觉模型、配置 MCP 服务,并维护相关依赖。
dsh-free-vision 是一个面向 DeepSeek Harness(DSH)的免费视觉插件。它的目标是让纯文本模型获得看图能力,优先使用各平台免费视觉模型,并提供零 MCP 配置的安装方式。
下面介绍这个插件的定位、核心能力、安装方式、典型用法和注意事项。
这是什么¶
dsh-free-vision 是 DSH 免费视觉插件,由 FuzzySoul 维护,许可证为 MIT。
它主要解决一个问题:让纯文本模型能够查看图片内容,例如截图、报错信息、UI 界面、OCR 文本和文档内容。
插件优先使用各平台免费视觉模型,并将视觉引擎 luma-mcp 作为本包依赖内置,在进程内启动,减少外部 MCP 配置。
核心功能¶
下面这些能力来自已核实资料:
- 零 MCP 配置:视觉引擎
luma-mcp作为本包依赖内置,进程内启动。 - 单个通用工具:提供
image_understand,并注册到ctx.tools;可通过config.toolName改名。 - 免费优先、多提供商:支持
qwen、volcengine、siliconflow、zhipu、hunyuan、custom。 - API Base URL 可覆盖:每个 Provider 可覆盖 API Base URL,可指向代理、API Gateway、本地服务或任意 OpenAI 兼容端点。
- 直连模式:子进程剥离代理环境变量,适合国内 API 直连;文档说明带代理可能导致
502。 - 任务模式:支持
auto | general | ocr | ui | debug | describe;大图会自动多裁剪保真。 - 中英双语:工具描述与文档支持中英文。
- 设置界面:可配置 API Key、提供商、工具名等;配置保存到
~/.dsh/free-vision.json。
安装与启用¶
先执行安装命令:
dsh plugin --profile web add dsh-free-vision
安装完成后,重启 dsh web。
重启后,工具 image_understand 即可用。
典型用法¶
模型调用 image_understand 时,需要传入以下参数:
image_source(必填):本地路径、HTTP(S) URL 或 data URI;支持PNG/JPG/WebP/GIF,大小≤10MB。prompt(必填):对图片的问题,中英文均可。task_type(可选):auto | general | ocr | ui | debug | describe。
下面是一个调用形态示例:
image_understand(
image_source="screenshot.png",
prompt="请判断这张报错截图中的关键错误信息。",
task_type="debug"
)
这里的 image_source、prompt 和 task_type 对应插件文档中列出的工具参数。
配置方式¶
配置可以通过设置界面完成。
重启 dsh web 后,打开 Settings → Free Vision,可以看到配置表单,包括 API Key、提供商、工具名等。保存后,下一次调用立即生效。
配置保存到:
~/.dsh/free-vision.json
也可以只设置对应环境变量。例如使用 qwen 时,可以设置:
DASHSCOPE_API_KEY
注意事项¶
使用前建议确认以下几点:
apiKey可选;缺省时回退到提供商环境变量。baseURLs缺失或值为空时,继续使用该 Provider 的官方默认地址。- 图片输入限制为
≤10MB,支持PNG/JPG/WebP/GIF。 - 直连模式会剥离代理环境变量;文档说明带代理可能导致
502。 - 免费额度数据来自各平台官方页面,可能变动,使用前请核实。
- 插件以当前
dsh进程权限运行,安装前应检查源码与许可证。 - 许可证为 MIT,封装
luma-mcp(MIT)与 MCP SDK(MIT)。
结尾¶
dsh-free-vision 适合需要在 DSH 中让纯文本模型查看截图、报错、UI、OCR 和文档内容,并希望减少 MCP 配置的场景。
GitHub 仓库地址:
https://github.com/FuzzySoul/dsh-free-vision