DeepSeek Harness(DSH)把智能體能力拆成可插拔的插件,但不少開發者日常用的仍是純文本模型:對話裏不能直接貼圖,報錯截圖只能手打路徑,長截圖裏的聊天記錄得自己 OCR,想從設計稿還原前端頁面更是無從談起。社區目錄裏有一款星標超過 800 的插件 dsh-vision-toolkit(維護者 Anionex),目標很明確:給 DSH 裏的文本模型裝上「眼睛」,並把看圖、定位、裁剪、像素對比等能力收進一套可組合的工具箱。
需要說明的是:DSH 的核心理念是「一切皆插件」,而 SkillHub 插件庫 等社區目錄由第三方維護,與 DeepSeek / 幻方並無官方從屬關係;安裝前建議自行查閱源碼與 MIT 許可證,並記住插件以當前 dsh 進程權限運行。
這是什麼¶
dsh-vision-toolkit 是上游項目 agent-vision-toolkit 面向 DeepSeek Harness 的原生集成。它不只是把圖片丟給多模態模型做一段泛泛描述,而是圍繞當前任務提取證據——例如「報錯在哪」「按鈕座標是多少」——並配合本地圖像處理與 vision-skills Skill,讓 Agent 知道何時看圖、何時定位、何時做像素 diff。
項目提供兩層能力:
- 10 個視覺工具 + vision-skills Skill:覆蓋問答、OCR、UI 還原、GUI 操作等 playbook。
- DSH 原生接入:與 Profile、會話、Settings、Artifacts 和 Web UI 打通;粘貼圖片可自動路由到
(Vision Toolkit)變體(2026-08-19 起默認開啓「透明變體路由」,模型列表可只保留原名一項)。
在 SkillHub 目錄中,該插件歸類爲「模型推理」;GitHub 倉庫當前約 821 star、34 fork,npm 包版本 0.1.38,許可證 MIT。
核心功能與亮點¶
粘貼圖片,直接提問¶
在 DSH Web 中粘貼截圖,純文本模型可自動切換到對應的 Vision Toolkit 變體,保留縮略圖、會話歷史與工作區路徑,無需手動複製文件路徑或換模型。
任務導向的看圖,而非萬能描述¶
多數視覺橋接會讓多模態模型生成通用描述再交給文本模型,多一層語義損失。Vision Toolkit 把用戶消息或 Agent 調用原因作爲 focus hint 傳給視覺模型,輸出圍繞當前步驟的重點信息,token 更少、針對性更強。
十項工具,可單獨調用也可串聯¶
| 工具 | 典型問題 | 主要結果 |
|---|---|---|
vision_glance |
圖裏發生了什麼? | 針對性回答、OCR、多圖比較 |
vision_ground |
目標在哪? | 原圖像素座標、可選框選預覽 |
vision_detect |
有哪些按鈕/圖標? | 編號元素清單與座標 |
vision_crop |
裁出某塊區域 | PNG/JPEG 裁剪圖 |
vision_trace |
圖形變矢量 | SVG |
vision_pixel_diff |
實現與參考差在哪? | 差異比例、熱力圖、JSON |
vision_long_screenshot_ocr |
讀完長截圖 | Markdown、分塊與審計輸出 |
vision_extract_foreground |
摳出主體 | 透明 PNG |
vision_dominant_colors |
主色是什麼? | 色板或候選色排序 |
vision_html_screenshot |
渲染本地頁面截圖 | PNG,可選 pageHeight |
座標統一爲原圖像素 x1,y1,x2,y2,可直接交給裁剪或後續自動化。
vision-skills:帶方法論的操作手冊¶
隨插件附帶的 Skill 攜帶上游 playbook,例如:長截圖 OCR、截圖還原 UI、圖標/Logo 矢量化、草圖轉結構化代碼(Mermaid/Graphviz)、基於截圖的 GUI 操作等。提示詞里加上「使用 vision-skills」即可引導 Agent 按步驟選工具並驗證結果。
典型場景演示(來自官方 README)¶
- 截圖 → 可編輯 HTML:左爲參考頁,右爲 HTML/CSS 還原,並可繼續截圖渲染 + 像素對比迭代。
- 手繪稿 → 可用界面:草圖直接變成可交互前端頁面。
- 快速 UI 還原:約三分鐘內產出佈局近似的首版截圖(允許顏色與圖標庫近似)。
安裝與啓用¶
官方 README 推薦通過 npm 包名安裝到指定 Profile(web / headless / desktop 等,按你實際使用的 profile 名替換):
dsh plugin --profile web add @anionex/dsh-vision-toolkit
Headless Profile:
dsh plugin --profile headless add @anionex/dsh-vision-toolkit
DSH Desktop 用戶需從托盤打開 DSH 終端,在桌面版自帶 CLI 中執行(桌面版不寫入系統 PATH):
dsh plugin --profile desktop add @anionex/dsh-vision-toolkit
DeepSeek Harness 插件庫 目錄頁給出的另一種寫法是從 GitHub 解析安裝:
dsh plugin add github:Anionex/dsh-vision-toolkit
需要可復現安裝時,可在命令後固定 commit 哈希,例如 dsh plugin add github:Anionex/dsh-vision-toolkit#commit。
安裝後重啓對應 Profile,打開 設置 → 視覺工具,配置視覺模型提供方(API Key 存爲 DSH Credential),並運行 測試視覺模型 確認連通。首次啓動會準備隔離 Python 運行時:優先使用系統 Python 3.11+,否則從國內鏡像下載約 35MB 的託管 Python(失敗時回退 GitHub 發佈源),並安裝 Pillow、NumPy、vtracer 等鎖定依賴。
典型用法示例¶
在會話中粘貼截圖,或將圖片放入工作區後調用 /vision-skills,可直接用自然語言描述目標:
看看這張截圖,告訴我報錯原因和最值得先修的地方。
找到右上角的登錄按鈕,返回原圖像素座標並生成帶框預覽圖。
把這個圖標裁出來並轉成 SVG。
按照 reference.png 還原頁面,每輪截圖後做像素對比,直到主要差異消失。
帶 Skill 引導的 UI 還原示例:
(使用 vision-skills)把這張圖片還原成 HTML。
也可在 Profile patch 中配置視覺提供方(OpenAI Chat Completions 兼容或 Anthropic Messages):
- id: vision-toolkit
config:
provider:
baseUrl: https://api.example.com/v1
credential: MY_VISION_KEY
model: your-vision-model
protocol: openai
官方文檔提供了 AIHubMix 申請 API Key 並配置 Gemini 3.7 Flash 識圖 的圖文教程。
適用場景與注意事項¶
適合誰:
- 日常用純文本模型寫代碼、排錯,卻希望獲得接近多模態的「貼圖即問」體驗。
- 需要從長截圖提取聊天/文檔、從設計稿或截圖還原 UI、做圖標矢量化、GUI 截圖操作等更高價值視覺任務。
- 希望在 DSH Web / Headless / Desktop 間統一使用同一套視覺工具鏈的 Harness 用戶。
注意事項:
- 插件以 當前 dsh 進程權限 運行,安裝前請閱讀源碼與許可證,勿在未審計的倉庫上盲目安裝。
- 視覺能力依賴你配置的多模態端點;每次檢查只發送必要意圖與圖片,調用間不累積上下文,額外成本通常可控;也可用本地小型多模態側模型進一步降本。
- HTML 頁面截圖需要本機 Chrome/Chromium/Edge;缺失時僅該功能不可用,其餘工具仍可用。
- 本地 OpenAI 兼容服務(LM Studio、Ollama 等)的
baseUrl需帶/v1前綴,否則模型測試可能報incompatible response structure。 - DSH Desktop 2.0.1 內置插件市場存在已知安裝問題,建議優先用終端命令安裝。
小結¶
如果你已經在用 DeepSeek Harness,卻常被「模型不能看圖」卡住,dsh-vision-toolkit 值得列入短名單:一行命令接入、粘貼圖片即可提問、十項工具覆蓋從 OCR 到 UI 還原的完整鏈路,再配 vision-skills 把經驗固化成 Agent 可執行的操作手冊。
- SkillHub 目錄頁:https://www.skillhub.cn/plugins/Anionex/dsh-vision-toolkit
- GitHub 倉庫:https://github.com/Anionex/dsh-vision-toolkit
- 上游工具箱:https://github.com/Anionex/agent-vision-toolkit
- 項目網站:https://agent-vision.anionex.me