前言¶
DeepSeek Harness(dsh)把模型、工具、技能、會話、沙箱、存儲、循環、調度和界面都做成插件,官方口號是「一切皆插件」。開發者預覽版已經把源碼放在 deepseek-ai/deepseek-harness,本地 Web 界面默認跑在 127.0.0.1:3080。
插件裝得再多,主模型如果仍是純文本,拖進聊天框的截圖、PDF、會議錄音對它來說都只是路徑或附件元數據。它看不見像素,也聽不到波形。社區裏因此出現了一批「給純文本模型補視覺」的插件:有的做結構化 OCR,有的做 UI 還原,有的把視覺請求轉給另一條多模態路由。
dsh-vision-complete 走的是另一條路:自己不內置「眼睛」模型,而是把 skill、MCP 工具和 Windows 截圖腳本打成一個包,默認去調通義千問的雲端多模態接口。本文按插件目錄頁、GitHub README、SKILL.md 和安裝腳本交叉覈對後整理:它是什麼、裝完能做什麼、以及哪些步驟不能跳。
社區目錄 DeepSeek Harness 插件庫 是獨立站點,與 DeepSeek / 幻方沒有從屬或背書關係。下面介紹的也是社區維護的開源插件,不是官方應用商店裏的「官方視覺」。
這是什麼¶
dsh-vision-complete 是一款面向 DeepSeek Harness 的開發與運行時插件,由 GitHub 用戶 Yts1919 維護,倉庫許可證爲 MIT(LICENSE 版權行寫作 2026 Yonnn)。目錄頁把它歸在「開發與運行時」。本文寫作時(2026-08-17)從 GitHub API 讀到的星標爲 36。
它要解決的問題很具體:Harness 裏的 DeepSeek 主模型是純文本,看不了圖、聽不了聲。這個插件把下面幾樣東西裝到 ~/.dsh 裏,讓模型在遇到圖片、視頻、音頻、PDF 時知道該調哪個工具:
| 組成 | 作用 |
|---|---|
skills/vision-multimodal |
核心 skill:教模型按任務選工具。附帶零第三方依賴的 vision.py,可接任意 OpenAI 兼容視覺接口 |
tools/screenshot-tool |
Windows 截圖監控:截圖後剪貼板變成 PNG 路徑,粘貼即可讓模型讀圖 |
| qwen-mm-plugins MCP | 安裝時寫入 ~/.dsh/profiles/web/cordis.patch.yml,註冊 core / api / video-memory 三個 MCP 服務器 |
references/ |
API Key 配置、多供應商切換說明 |
倉庫 README 寫得很清楚:插件本身不含視覺模型。默認調用雲端通義千問(阿里雲百鍊 DashScope)。沒有 API Key,裝完也用不了。
平臺限制同樣寫在倉庫徽章和安裝說明裏:一鍵安裝需要 Windows + PowerShell。截圖工具也只覆蓋 Windows 剪貼板。
核心功能¶
倉庫把能力分成兩條通道。SKILL.md 的規則是:工具列表裏已有 mcp__qwen-mm-plugins-* 就走方式 A;沒有 MCP、或要換別的廠商,再走方式 B。
方式 A:MCP(默認)¶
install.ps1 會用 uvx 從 QwenLM/Qwen-MM-Plugins 拉起三個 MCP 服務器,版本釘在腳本里:
qwen-mm-plugins-core(tagqwen-mm-plugins-core-v1.0.2):本地讀圖 / 讀視頻 / 裁剪 / 畫框 / 可視化文件 / 看媒體元信息qwen-mm-plugins-api(tagqwen-mm-plugins-api-v1.0.3):調用 Qwen 多模態模型做理解、OCR、檢測、視頻+音頻融合、語音轉寫、音樂分析、圖像分割qwen-mm-plugins-video-memory(tagqwen-mm-plugins-video-memory-v1.0.1):30 分鐘以上長視頻的語義記憶與檢索
SKILL.md 寫明默認模型名:視覺用 qwen3.7-plus,Omni 用 qwen3.5-omni-plus。一般不需要手動覆蓋。
方式 B:vision.py¶
同一目錄下的 vision.py 走 OpenAI 兼容的 chat/completions 接口,Python 3.7+ 即可,不額外裝包。config.example.json 裏 provider 可選 openai / glm / kimi / qwen / siliconflow / ollama。本地 Ollama 不需要 Key。
能力清單¶
README 與 SKILL.md 列出的能力如下。除圖像分割外,其餘都可以在配好 Key 後直接用自然語言觸發:
| 能力 | 說明 |
|---|---|
| 圖片理解 / 問答 | 描述、問答、看圖說話 |
| OCR 取字 | 截圖、票據、文檔拍照提取文字 |
| 物體檢測定位 | 找目標、畫框、裁剪;grounding 座標是 0–1000 歸一化,不是像素 |
| 視頻理解 | 畫面+聲音時間線、按事件定位、計數 |
| 語音轉寫 | 普通轉寫、帶時間戳、多說話人分離 |
| 音樂分析 | 風格、情緒、樂器、調性 |
| 文檔可視化 | PDF / Office / CSV / 代碼 / 3D / notebook |
| 截圖直讀 | 截圖自動存盤並把剪貼板換成路徑 |
| 圖像分割 | 把目標摳出來;進階能力,需要另起 SAM3 服務 |
| 長視頻 | 30 分鐘以上走 video-memory,不要整段塞進單次工具 |
安裝與啓用¶
目錄頁給出的安裝命令如下。在 DeepSeek Harness 終端裏運行即可,dsh CLI 會從 GitHub 解析插件並裝到當前配置:
dsh plugin add github:Yts1919/dsh-vision-complete
目錄頁同時提醒:如需可復現安裝,應固定 commit 哈希:
dsh plugin add github:Yts1919/dsh-vision-complete#commit
把 #commit 換成倉庫裏某個具體提交的 SHA。插件以當前 dsh 進程的權限運行,安裝時可能執行代碼,裝之前應檢查源碼和許可證。
作者 README 還提供了一條更完整的 Windows 安裝路徑。目錄頁的 dsh plugin add 負責把倉庫登記進 Harness;要把 skill 拷進 ~/.dsh/skills、把三個 MCP 寫進 cordis.patch.yml、並把截圖工具放到 ~/.dsh/tools,需要再跑倉庫裏的安裝腳本。README 要求全程約 5 分鐘,環境是 Windows + PowerShell。
- 克隆或下載倉庫。國內訪問 GitHub 不穩定時,README 提供了 Gitee 鏡像
https://gitee.com/yonnn/dsh-vision-complete:
git clone https://github.com/Yts1919/dsh-vision-complete.git
# 或
git clone https://gitee.com/yonnn/dsh-vision-complete.git
解壓到哪個盤、文件夾叫什麼名字都不影響,後面只要進到那個目錄即可。
- 雙擊
install.bat。不要右鍵install.ps1選「使用 PowerShell 運行」——腳本一結束窗口會閃退,錯誤信息看不到。install.bat會裝 skill、註冊 MCP、拷截圖工具,並檢查uvx/ Python / ffmpeg /DASHSCOPE_API_KEY。命令行等價寫法:
cd C:\DeepSeek-Vision
powershell -ExecutionPolicy Bypass -File .\install.ps1
路徑換成你自己的實際位置。若自檢提示沒有 uvx,方式 A 的 MCP 暫時不可用,需要先安裝 uv 再重跑腳本。
- 配置 API Key。打開安裝後生成的說明文件:
C:\Users\你的用戶名\.dsh\skills\vision-multimodal\references\api-key-setup.md
到 阿里雲百鍊 創建 API-KEY,然後在 PowerShell 執行:
setx DASHSCOPE_API_KEY "sk-你的key"
setx 隻影響之後新啓動的進程。必須完全退出並重啓 DeepSeek Harness,Key 纔會進到 MCP 進程。也可以在「編輯賬戶的環境變量」裏新建用戶變量 DASHSCOPE_API_KEY。
API Key 只放環境變量,不要寫進 config.json。倉庫已經把該文件列入 .gitignore。
- 驗證。找一張圖拖進聊天框,對它說「描述這張圖」。能返回畫面內容即成功。報 401 / 沒有 API Key,回到上一步並確認已經重啓 Harness。模型說沒有
mcp__qwen-mm-plugins-*工具,先確認裝了uv,再完全退出重開 Harness——MCP 服務器要重啓才加載。
卸載:雙擊倉庫裏的 uninstall.bat。
典型用法¶
裝好後不需要記工具名。README 給的說法是:直接跟 DeepSeek 說話,模型會觸發 vision-multimodal 並自己選工具。文檔裏的例子包括:
- 「描述一下這張圖」併發送圖片
- 「把這張截圖裏的文字提取出來」
- 「圖裏的貓在哪個位置,幫我畫個框」
- 「總結這段視頻講了什麼」併發送視頻
- 「把這個會議錄音轉成文字」
- 「這張 PDF 第 2 頁講了什麼」
SKILL.md 要求圖片、視頻一律傳絕對路徑,相對路徑會找不到。中文路徑可以直接傳。處理視頻前應先調 core 的 media_info,拿到時長、分辨率、fps、音軌和旋轉,再決定抽幀還是走 Omni。
截圖直讀¶
截圖工具不是 skill,也不是 MCP,而是一個 Windows 後臺腳本:只有本機 127.0.0.1:3080 在監聽時纔會接管剪貼板。
開啓監控(做一次,窗口保持開着):
- 打開
C:\Users\你的用戶名\.dsh\tools\screenshot-tool\ - 雙擊
start-screenshot-autosave.bat,彈出的黑色窗口不要關 - 可選:雙擊
install-autostart.bat,以後開機自動跑
之後按 Win+Shift+S(或 PRTSC / Alt+PRTSC)截圖,回到聊天框 Ctrl+V。粘貼出來的是 .png 路徑文字,不是圖片本體,這是預期行爲。再說「讀一下這張圖」即可。
默認保存目錄是 %USERPROFILE%\Pictures\DeepSeek-Shots,可用環境變量 DS_SHOT_DIR 改位置。Harness 不在 3080 端口時,設 DS_PORT 或改腳本里的默認值。DeepSeek 關掉後,腳本不再改剪貼板,截圖可以正常貼到微信、Word。
命令行調用 vision.py¶
沒有 MCP、或要換廠商時,把 config.example.json 複製爲 config.json,改 provider,設置對應環境變量後運行:
python vision.py chat --image 圖.png --prompt "描述這張圖"
python vision.py ocr --image 圖.png --lang zh
python vision.py grounding --image 圖.png --prompt "所有貓"
python vision.py compare --image 圖.png --prompt "描述這張圖" --models qwen,glm,kimi
python vision.py providers
各廠商的 base_url、模型名和 Key 環境變量寫在 skills/vision-multimodal/references/providers.md。臨時覆蓋可以用 --provider / --model / --base-url / --api-key。
適用場景與注意事項¶
適合已經在 Windows 上跑 DeepSeek Harness Web UI、並且能申請阿里雲百鍊 Key 的人。典型任務是:讀截圖和票據、給圖裏的目標畫框、轉寫會議錄音、問一段短視頻講了什麼、打開本地 PDF 問某一頁。方式 B 還可以把同一套 skill 接到 OpenAI、智譜、Kimi、硅基流動或本地 Ollama。
下面這些限制來自倉庫文檔和安裝腳本,不是推測:
- 沒有 Key 就不能看雲端模型。 這是 README 標成「唯一繞不開」的一步。README 提到可以把 Key 臨時貼進當前對話,但那隻對這一次會話有效,重啓後仍要配環境變量。
- 一鍵安裝和截圖直讀綁定 Windows。 倉庫徽章寫的是 Platform: Windows。
install.ps1、install.bat和截圖監控都按用戶目錄~/.dsh與 PowerShell 來寫。 - 方式 A 依賴
uvx。 沒裝 uv,MCP 註冊也會寫進 patch 文件,但服務器拉不起來。視頻轉寫還可能需要把 ffmpeg 加進 PATH。 - 圖像分割不是開箱即用。
SKILL.md寫明segmentation需要 SAM3 服務。 - 長視頻不要整段塞進單次調用。 30 分鐘以上走
qwen-mm-plugins-video-memory:先get_summary/get_super_events,需要細節再檢索子圖或 ASR/OCR 文本。視頻抽幀默認約 1 fps、約 448²,文檔不建議無故調高 fps。 - 插件以當前 dsh 進程權限運行。 安裝腳本會改
~/.dsh/profiles/web/cordis.patch.yml,並複製文件到用戶目錄。安裝前檢查源碼和 MIT 許可證;依賴的qwen-mm-plugins由 QwenLM 提供,按各自許可證使用。雲端調用會把圖片、音視頻發到百鍊接口,按各平臺的隱私與計費規則處理。 - grounding 座標是 0–1000 歸一化。 畫框、裁剪必須用同一套座標,不要自行換算成像素。
常見報錯與 README 對照表一致:401 多半是 Key 沒配或沒重啓;找不到 MCP 工具就檢查 uv 並重啓 Harness;vision.py 報 SSL / _ssl 常見於損壞的 Anaconda 環境,換官網安裝的 Python。
小結¶
dsh-vision-complete 做的不是把 DeepSeek 換成多模態模型,而是給純文本 Harness 接上一套可切換的視覺/聽覺工具:默認 MCP 走通義千問,備用 vision.py 走任意 OpenAI 兼容接口,再加一個 Windows 截圖路徑橋。真正擋住使用的通常不是安裝腳本,而是 API Key、uvx 和一次完整的進程重啓。
目錄頁:https://deepseek-harness-plugin.com/zh-CN/plugins/dsh-vision-complete/
GitHub:https://github.com/Yts1919/dsh-vision-complete