前言¶
DeepSeek Harness(簡稱 dsh)把模型、工具、技能、會話、沙箱、存儲、循環、調度和 UI 都做成可替換插件,官方說法是「一切皆插件」。裝好 Node.js 之後,可以用下面這條命令拉起網頁界面:
npx @deepseek-ai/dsh web
Harness 解決的是「智能體怎麼在真實環境裏持續幹活」。但很多日常任務並不是純文本:報錯彈窗、設計稿、長網頁截圖、手繪線框,都得先看圖。DeepSeek 這類純文本模型本身接不了圖片,粘貼截圖會被拒絕;即便接上通用看圖接口,得到的也常常是一段籠統描述——按鈕在哪、報錯寫了什麼、實現和參考圖差在哪,仍然沒法直接動手。
社區目錄把這類能力歸在「界面增強」。dsh-vision-toolkit 的做法不是換一個多模態主模型,而是給當前文本 Agent 掛上一套視覺工具和 Skill:看圖帶着當前問題的意圖,定位返回原圖像素座標,長截圖可以分塊 OCR,UI 還原還能拿像素差異做下一輪修正。本文按社區目錄詳情頁、GitHub 倉庫 README / 中文說明 / package.json / CHANGELOG.md / MIT 許可證、npm 包頁,以及 DeepSeek Harness 官方倉庫 交叉覈對後整理。
需要先說清楚來源:社區插件目錄 deepseek-harness-plugin.com 是獨立站點,與 DeepSeek / 幻方沒有官方從屬關係,不要把它當成官方應用商店。截至 2026-08-17,GitHub 倉庫 Anionex/dsh-vision-toolkit 爲 539 星;目錄頁標註 386 星、分類爲「界面增強」,並標爲精選。npm 包 @anionex/dsh-vision-toolkit 當前版本爲 0.1.20,許可證爲 MIT。
這是什麼¶
一句話:它是 agent-vision-toolkit 面向 DeepSeek Harness 的原生接入,給 Web 和 Headless Profile 裏的純文本模型補上圖片問答、定位、OCR、裁剪、描摹和像素級驗證。
維護者是 Anionex。倉庫主要語言是 TypeScript。視覺能力來自打包並固定版本的上游工具箱快照,插件自己負責安裝、會話級工具暴露、Credential、路徑校驗、超時取消、結果文件和 Web 展示;運行時不會在後臺拉取上游 main。package.json 裏記錄的上游快照爲 v0.1.0+snapshot.bc9803d。
它分兩層:
- 視覺工具和
vision-toolsSkill:讓 Agent 判斷何時該看圖、定位、OCR、裁剪、描摹或做像素對比。 - DSH 原生接入:把這些能力放進 Profile、會話、Settings、Artifacts 和 Web 界面,並提供安裝後即可使用的免費視覺服務。
對宿主明確標記爲純文本的模型,插件會註冊名爲 <模型名> (Vision Toolkit) 的變體。默認情況下,在 DSH Web 裏粘貼圖片會切到這個變體,並把工作區路徑以及圍繞當前問題的視覺描述一起交給文本模型。
核心功能¶
倉庫 README 列出 10 個可以單獨調用、也可以串成工作流的工具。座標統一用原圖像素 x1,y1,x2,y2,定位結果可以直接交給裁剪、描摹或後續自動化。
1、帶着意圖看圖。 vision_glance 不是寫一篇看圖作文,而是圍繞「報錯在哪裏」「提交按鈕是什麼顏色」提取證據。多圖比較也走這條工具。
2、定位和清點界面元素。 vision_ground 回答「我要找的東西在哪」,返回像素框,可選帶框預覽。vision_detect 清點按鈕、圖標等元素,給出編號清單和座標。
3、從截圖裏拿出可繼續用的素材。 vision_crop 裁出 PNG 或 JPEG;vision_trace 把圖形描成可編輯 SVG;vision_extract_foreground 摳主體得到透明 PNG;vision_dominant_colors 給出主色板或候選色排序。README 寫明:裁剪、像素對比、顏色分析、前景提取、SVG 描摹和 HTML 截圖在本地完成,不消耗視覺 API 請求。
4、長截圖 OCR。 vision_long_screenshot_ocr 會分塊讀取,並保留 Markdown、分塊圖、清單和審計結果,失敗後也能繼續,用來處理容易漏行、重複的長網頁截圖。
5、UI 還原閉環。 vision_html_screenshot 按指定視口渲染本地頁面;長文檔可傳 fullPage=true,生成覆蓋整頁的 PNG,並以 CSS 像素返回 pageHeight。vision_pixel_diff 對比參考圖和實現截圖,給出差異比例、重點區域、熱力圖和 JSON。倉庫內置了可復現的 UI 還原示例:先渲染參考圖和實現,再用差異結果指導下一輪修正。
6、Web 側粘貼即用。 粘貼後保留原生縮略圖、會話記錄和工作區路徑;Web 可以預覽產物,Headless 繼續使用同一份結構化結果。
安裝與啓用¶
目錄頁給出的安裝命令是:
dsh plugin add github:Anionex/dsh-vision-toolkit
如需可復現安裝,目錄頁建議固定 commit 哈希:
dsh plugin add github:Anionex/dsh-vision-toolkit#commit
把 #commit 換成實際提交哈希。倉庫 README 另外給出 npm 包寫法,並要求指定 Profile,當前版本更貼近這條路徑:
dsh plugin --profile web add @anionex/dsh-vision-toolkit
Headless Profile 可以單獨裝:
dsh plugin --profile headless add @anionex/dsh-vision-toolkit
升級和卸載:
dsh plugin --profile web update @anionex/dsh-vision-toolkit
dsh plugin --profile web remove @anionex/dsh-vision-toolkit
如果是從已停止發佈的 @dsh-external/dsh-vision-toolkit 遷過來,README 要求先移除舊包,再安裝 @anionex/dsh-vision-toolkit。
安裝後需要重啓正在運行的 Web Profile,打開 設置 → 視覺工具。默認免費服務已經配好,可以直接點 測試視覺模型。這個測試會走真實看圖請求,而不是隻打通 /models。首次啓動會準備隔離的 Python 運行時,因此需要能訪問 Python 包緩存或網絡;普通安裝不需要再克隆 agent-vision-toolkit,也不需要填本地路徑。
運行要求以 README 和 package.json 爲準:
- DeepSeek Harness Web 或 Headless Profile;對等依賴聲明爲
@deepseek-ai/dsh-agent^0.1.0-rc.6及同線包。 - Node.js
^22.19.0或>=24.0.0。 - Python 3.11+;插件默認自動創建隔離環境。CHANGELOG 在 0.1.13 起支持 Windows 上的 Microsoft Store Python。
- 只有
vision_html_screenshot需要 Chrome、Chromium 或 Edge。 - 圖片需爲 PNG、JPEG、GIF 或 WebP,並位於會話工作區或明確允許的目錄中。
典型用法¶
重啓並確認設置頁連通之後,在會話裏粘貼截圖,或把圖片放進會話工作區,然後調用 /vision-tools。README 給出的示例包括:
看看這張截圖,告訴我報錯原因和最值得先修的地方。
找到右上角的登錄按鈕,返回原圖像素座標並生成帶框預覽圖。
把這個圖標裁出來並轉成 SVG。
按照 reference.png 還原頁面,每輪截圖後做像素對比,直到主要差異消失。
常見任務可以按倉庫推薦的工作流來組合工具:
| 任務 | 推薦工作流 |
|---|---|
| 圖片問答 / 截圖排障 | 看圖 → 圍繞當前問題回答 → 必要時繼續定位 |
| 找按鈕、圖標或文字區域 | 定位目標 → 返回像素框 → 生成標註預覽 |
| 提取截圖裏的圖標 | 定位 → 裁剪 → 描摹爲 SVG |
| 讀取長網頁截圖 | 自動分塊 → OCR → 合併 Markdown → 檢查邊界 |
| 復刻網頁或組件 | 參考圖 → 實現 → HTML 截圖 → 像素對比 → 繼續修正 |
| 提取品牌視覺 | 裁剪區域 → 主色分析 → 前景提取 → 導出透明 PNG |
粘貼後如果仍提示模型不支持圖片,README 的處理順序是:重啓 Web Profile 並刷新頁面,確認當前模型已切到帶 (Vision Toolkit) 後綴的變體;也可以先把圖片放進會話工作區,再調用 /vision-tools。
配置、限制與注意事項¶
默認免費視覺服務的入口是:
Base URL: https://vision.anionex.me/v1
Model: qwen/qwen3.6-27b
這是共享入口,不是無限量私有端點。CHANGELOG 寫明 0.1.14 起默認後端切到 Groq Qwen3.6。README 記錄的請求保護規則爲:單次最多 5 張圖、單張不超過 4 MiB、單張解碼像素不超過 20,000,000、單次輸出最多 4,096 tokens。共享容量用盡時會返回帶 Retry-After 的 429,而不是含糊的模型失敗。
需要更高額度、私有端點或其他模型時,在 設置 → 視覺工具 裏改提供方,並把 API Key 存成 DSH Credential。Settings 只保存 Credential 引用,不會把密鑰回顯到瀏覽器。也可以在 Profile patch 裏寫:
- id: vision-toolkit
config:
provider:
baseUrl: https://api.example.com/v1
credential: MY_VISION_KEY
model: your-vision-model
protocol: openai
支持 OpenAI Chat Completions 兼容端點和 Anthropic Messages。臨時禁用可以在同一處設置 disabled: true。重新啓用或升級 Web 插件後,需要重啓 Web Profile 並刷新頁面。
當前版本的能力邊界也寫在 README 裏:專注截圖理解、視覺定位、OCR、素材提取、UI 還原和像素級驗證;不是視頻、音頻或攝像頭輸入系統,也不會自動點擊 GUI。交互式框選編輯、遠程服務集羣、模型投票和跨會話視覺緩存都不在當前範圍。
目錄頁有一條需要單獨看的安全說明:插件以當前 dsh 進程的權限運行,安裝時可能執行代碼。安裝前應檢查源代碼倉庫和許可證;生產或可復現環境建議固定 commit。找不到 Chrome 時,只有 HTML 截圖不可用,其他工具不受影響。圖片過大時先裁剪或縮放,錯誤會標明是字節限制還是像素限制。
小結¶
純文本模型缺的往往不是「再寫一段圖片描述」,而是能定位、能裁、能讀長圖、能用像素差驗證還原結果的工具鏈。dsh-vision-toolkit 把這套流程接到 DeepSeek Harness 的 Web / Headless Profile 裏,粘貼圖片後切到 (Vision Toolkit) 變體,本地圖像處理和遠程看圖可以在同一次 Agent 工作流裏銜接。
目錄頁:https://deepseek-harness-plugin.com/zh-CN/plugins/dsh-vision-toolkit/
GitHub:https://github.com/Anionex/dsh-vision-toolkit
上游工具箱:https://github.com/Anionex/agent-vision-toolkit
項目站點:https://agent-vision.anionex.me