@zenk/vision:讓 DSH 直接看懂截圖,圖片不出本機

前言

給 AI 看一張截圖,常見的做法有兩條路:要麼自己把圖裏的內容轉成文字描述,要麼把圖片上傳到雲端多模態接口。前者費時,還容易丟掉位置、佈局這類細節;後者則要考慮隱私和成本。

DSH 的理念是「一切皆插件」,視覺能力同樣可以以插件形式補齊。本文介紹的 @zenk/vision 做的就是這件事:在對話框裏直接粘貼截圖,AI 就能看到並分析,圖片不出本機。

這是什麼

@zenk/vision 是 DSH 的本地視覺插件,由 kaaaaahn 維護,MIT 協議開源,當前版本 0.3.1。它把兩條本地視覺鏈路接入 DSH:macOS Vision 負責 OCR,ollama 上的 qwen3-vl 負責語義理解。

核心功能

  • OCR 帶像素座標:基於 macOS Vision,識別文字的同時給出像素位置,做 UI 定位時可以直接按座標說。
  • 語義理解:通過 ollama 運行 qwen3-vl,能看懂畫面佈局、元素與異常區域。
  • 零配置:自動檢測環境、按內存選模型(8G→2b / 16~32G→4b / 32G+→8b),缺 ollama 時自動安裝。
  • 漸進可用:模型在後臺下載(1.8~5.7GB),下載期間 OCR 已經可用。
  • 全本地:免費、離線,圖片不出 Mac。
  • 上傳圖片橋接:將圖片塊轉爲文本,text-only 通道也能使用。

安裝與啓用

使用 README 給出的安裝命令:

dsh plugin --profile web add "github:kaaaaahn/dsh-vision#v0.3.1"

這條命令從 GitHub 拉取 v0.3.1 版本。安裝完成後重啓 DSH 生效;桌面端把 --profile web 換成 --profile desktop 即可。

需要注意,插件市場條目(添加來源 https://kaaaaahn.github.io/dsh-vision/catalog/source.json)依賴 npm 發佈,目前暫未上線,現階段請使用上面的 GitHub 命令安裝。

首次使用時,插件會自動在後臺下載模型(1.8~5.7GB),下載期間 OCR 已可用。環境依賴 macOS Vision 與 ollama,缺 ollama 時會自動安裝,環境細節見倉庫中的 docs/ollama-setup.md

典型用法

最直接的用法:在對話框裏粘貼圖片發送,AI 自動分析並回復。截圖、粘貼、發送,不需要額外命令。

第二種是讓 AI 調用工具分析本地文件:

vision_analyze(file_path=..., describe=true)

file_path 指定本地圖片路徑,describe=true 開啓語義描述。適合分析磁盤上已有的圖片,比如讓 AI 描述一張截圖的佈局與元素。

適用場景與注意

適合的場景:

1、日常對話中直接粘貼截圖,讓 AI 讀圖回答,省去手動轉述;
2、做 UI 相關工作時,利用帶像素座標的 OCR 定位元素;
3、對隱私敏感、不希望截圖離開本機的環境。

使用前有幾點注意:

1、插件依賴 macOS Vision,面向 Mac 環境使用;
2、首次使用會下載 1.8~5.7GB 的模型,注意磁盤空間和網絡;模型選型參考 docs/ollama-setup.md
3、安全方面,插件以當前 dsh 進程權限運行,安裝前建議先檢查源碼與許可證。本項目爲 MIT 協議,核心代碼集中在 lib/index.js(插件入口,含 vision_analyze、vision_setup、圖片橋接等)與 lib/vision_analyze.swift(OCR 與 ollama 語義描述腳本,隨包分發),可以直接審閱;
4、遇到問題先查 docs/troubleshooting.md,裏面有 22 條 FAQ。

結尾

@zenk/vision 做的事情不復雜:把 macOS 自帶的 OCR 和本地多模態模型接進 DSH,讓「給 AI 看圖」變成粘貼一下的事,同時保證圖片不出本機。對經常需要讀截圖的 DSH 用戶來說,是一個實用的補充。

  • 插件目錄頁:https://www.skillhub.cn/plugins/kaaaaahn/dsh-vision
  • GitHub 倉庫:https://github.com/kaaaaahn/dsh-vision

其中目錄頁爲社區維護的獨立站點,與 DeepSeek、幻方無官方從屬關係。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜