@zenk/vision:让 DSH 直接看懂截图,图片不出本机

前言

给 AI 看一张截图,常见的做法有两条路:要么自己把图里的内容转成文字描述,要么把图片上传到云端多模态接口。前者费时,还容易丢掉位置、布局这类细节;后者则要考虑隐私和成本。

DSH 的理念是「一切皆插件」,视觉能力同样可以以插件形式补齐。本文介绍的 @zenk/vision 做的就是这件事:在对话框里直接粘贴截图,AI 就能看到并分析,图片不出本机。

这是什么

@zenk/vision 是 DSH 的本地视觉插件,由 kaaaaahn 维护,MIT 协议开源,当前版本 0.3.1。它把两条本地视觉链路接入 DSH:macOS Vision 负责 OCR,ollama 上的 qwen3-vl 负责语义理解。

核心功能

  • OCR 带像素坐标:基于 macOS Vision,识别文字的同时给出像素位置,做 UI 定位时可以直接按坐标说。
  • 语义理解:通过 ollama 运行 qwen3-vl,能看懂画面布局、元素与异常区域。
  • 零配置:自动检测环境、按内存选模型(8G→2b / 16~32G→4b / 32G+→8b),缺 ollama 时自动安装。
  • 渐进可用:模型在后台下载(1.8~5.7GB),下载期间 OCR 已经可用。
  • 全本地:免费、离线,图片不出 Mac。
  • 上传图片桥接:将图片块转为文本,text-only 通道也能使用。

安装与启用

使用 README 给出的安装命令:

dsh plugin --profile web add "github:kaaaaahn/dsh-vision#v0.3.1"

这条命令从 GitHub 拉取 v0.3.1 版本。安装完成后重启 DSH 生效;桌面端把 --profile web 换成 --profile desktop 即可。

需要注意,插件市场条目(添加来源 https://kaaaaahn.github.io/dsh-vision/catalog/source.json)依赖 npm 发布,目前暂未上线,现阶段请使用上面的 GitHub 命令安装。

首次使用时,插件会自动在后台下载模型(1.8~5.7GB),下载期间 OCR 已可用。环境依赖 macOS Vision 与 ollama,缺 ollama 时会自动安装,环境细节见仓库中的 docs/ollama-setup.md

典型用法

最直接的用法:在对话框里粘贴图片发送,AI 自动分析并回复。截图、粘贴、发送,不需要额外命令。

第二种是让 AI 调用工具分析本地文件:

vision_analyze(file_path=..., describe=true)

file_path 指定本地图片路径,describe=true 开启语义描述。适合分析磁盘上已有的图片,比如让 AI 描述一张截图的布局与元素。

适用场景与注意

适合的场景:

1、日常对话中直接粘贴截图,让 AI 读图回答,省去手动转述;
2、做 UI 相关工作时,利用带像素坐标的 OCR 定位元素;
3、对隐私敏感、不希望截图离开本机的环境。

使用前有几点注意:

1、插件依赖 macOS Vision,面向 Mac 环境使用;
2、首次使用会下载 1.8~5.7GB 的模型,注意磁盘空间和网络;模型选型参考 docs/ollama-setup.md
3、安全方面,插件以当前 dsh 进程权限运行,安装前建议先检查源码与许可证。本项目为 MIT 协议,核心代码集中在 lib/index.js(插件入口,含 vision_analyze、vision_setup、图片桥接等)与 lib/vision_analyze.swift(OCR 与 ollama 语义描述脚本,随包分发),可以直接审阅;
4、遇到问题先查 docs/troubleshooting.md,里面有 22 条 FAQ。

结尾

@zenk/vision 做的事情不复杂:把 macOS 自带的 OCR 和本地多模态模型接进 DSH,让「给 AI 看图」变成粘贴一下的事,同时保证图片不出本机。对经常需要读截图的 DSH 用户来说,是一个实用的补充。

  • 插件目录页:https://www.skillhub.cn/plugins/kaaaaahn/dsh-vision
  • GitHub 仓库:https://github.com/kaaaaahn/dsh-vision

其中目录页为社区维护的独立站点,与 DeepSeek、幻方无官方从属关系。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜