前言¶
在 DSH(DeepSeek Harness)的插件生态里,常见做法是把扩展能力拆成插件加载。对于 Web 聊天界面,一个具体问题是:用户已经能把图片粘贴或上传到会话里,但界面不一定直接展示图片,文本模型也不一定理解图片内容。
visual-review 就是为这个场景做的插件:让 DSH Web 聊天界面直接显示图片,并让模型调用视觉工具获得图片的中文文字描述。
这是什么¶
visual-review 由 wang-bool 维护,许可证为 MIT。它面向 DSH Web 场景,把“图片显示”和“视觉解读”放在同一个插件中。
核心功能¶
- 在 DSH Web 聊天界面直接渲染粘贴或上传的图片,支持 PNG、JPEG、WebP、GIF。
- 提供
visual_review工具,调用视觉多模态模型,返回图片的中文文字描述,可覆盖文字、物体、人物、场景、图表等内容。 - 双引擎:优先使用 OpenAI 兼容的多模态
chat/completionsAPI;未配置云端时回退本机Qwen3-VL-8B。 - 通过发送拦截和
agent/pre-step兜底,将图片块转换为带附件 ID 的文本注解,使文本模型也能配合视觉工具工作。 - 支持通过
attachment_id分析会话图片,或通过image_path分析本地文件。 - 提供
visual_review_config配置工具,可查看或更新云端url、api_key、model,并可一键切换引擎。
安装与环境¶
使用本插件需要先满足 DSH Web profile 和 Node.js 版本要求:
DSH Web profile
Node.js ≥ 18
如果使用本机引擎,还需要以下依赖和本地模型:
Python 3.10+
torch
transformers ≥ 4.57(支持 Qwen3-VL)
Pillow
本地 Qwen3-VL-8B-Instruct 模型
在 DSH Web profile 下执行安装命令:
dsh plugin --profile web add visual-review
配置¶
云端引擎¶
云端配置存放在:
$DSH_HOME/visual_review.config.json
云端配置项包括:
url
api_key
model
也可以在会话中调用 visual_review_config 查看或更新这些字段。将 url、api_key、model 三项都置空,会回到本机引擎。
该文件包含明文 API Key,应加入 .gitignore,并注意文件权限控制。
本机引擎¶
未配置云端时,插件会回退到本机 Qwen3-VL-8B。本机模式下图片仅在本机处理,不产生任何外部网络请求。
典型用法¶
1、在聊天框粘贴或上传一张图片。图片会渲染在气泡里,模型可自动调用 visual_review 并给出图片描述。
2、让模型分析磁盘上的图片,例如:
请用 visual_review 分析 /path/to/photo.png
3、给模型更具体的诉求,例如:
读出这张图片里的所有文字
描述这个图表的趋势
4、需要切换引擎时,调用 visual_review_config 修改云端配置;把三项都置空则回到本机引擎。
适用场景与注意¶
这个插件适合使用 DSH Web、希望文本模型能借助视觉工具理解图片的场景。如果已有 OpenAI 兼容的多模态接口,可以配置云端;如果希望图片不发送到外部服务,可以配置本机模式。
需要注意:
/vr-image与/api/session.prompt路由只接受回环地址127.0.0.1/::1的请求,其他来源返回 403。- 云端 API Key 以明文存储在
$DSH_HOME/visual_review.config.json,不要提交到仓库,并注意权限控制。 - 本机模式需要本地模型和依赖,使用前应确认
Qwen3-VL-8B-Instruct已就位。 - 插件会随当前 DSH 进程运行,可能访问插件配置、本地文件和云端接口;安装前应检查源码、许可证和依赖。
相关链接¶
这里的插件目录是独立站点,与 DeepSeek / 幻方无官方从属关系。
- GitHub:
https://github.com/wang-bool/visual-review - 插件目录页(资料线索):
https://www.skillhub.cn/plugins/wang-bool/visual-review