前言¶
DeepSeek Harness(DSH)的主力對話模型以純文本爲主,無法直接讀取聊天裏粘貼的圖片。常見做法是先把圖片存成文件,再把路徑交給模型或另開一條多模態鏈路,步驟多、上下文也容易斷。
ModLens 是 DSH 生態裏的視覺插件,由 liustack 維護,在 GitHub 上開源(MIT 許可證,約 3600 stars)。它把粘貼的圖片交給獨立的視覺引擎處理,再把 OCR、版面結構和語義信息整理成結構化 JSON 證據交給文本模型,讓 DeepSeek、GLM 等純文本模型也能基於圖片內容作答。
這是什麼¶
ModLens(@liustack/modlens)的定位是:給純文本編碼智能體外掛視覺能力。在 DSH 裏,它是一個獨立插件;在其他 harness(Claude Code、Codex、OpenCode、Pi 等)裏,對應一個 skill 目錄。
插件不修改 harness 核心配置,也不依賴本地代理進程。卸載時刪除對應目錄即可恢復默認行爲。
核心功能¶
直接粘貼圖片¶
安裝後,在對話裏粘貼圖片或拖入路徑即可觸發。圖片會經 modlens_read_image 工具送入視覺引擎,返回結構化證據,而非讓模型憑空猜測畫面內容。
證據包含完整轉錄文本、按閱讀順序排列的版面區域,以及實體與關係列表。同一張圖粘貼一次後,後續追問無需重複粘貼。
兩種粘貼路徑¶
在 DSH 中,粘貼圖片有兩種交互方式:
- 直接粘貼:圖片先落到臨時文件,路徑進入輸入框,再由
modlens_read_image接管處理。這與 OpenCode、Pi 等 harness 的默認行爲一致。 - 選擇
(modlens vision)模型:在模型選擇器裏選帶(modlens vision)後綴的條目(例如DeepSeek-V4-Flash (modlens vision)),再粘貼圖片。縮略圖會保留在消息裏,請求時再轉換爲結構化證據。
插件會自動發現各 provider 路由上符合條件的純文本 DeepSeek、GLM、MiMo Pro 模型,併爲每條路由添加包裝條目。已確認具備原生視覺能力的模型不會被接管。
多引擎與故障轉移¶
ModLens 不綁定單一視覺服務。內置六種 provider,並可複用本機四個 agent CLI 的已有登錄態,共十種視覺來源。內置 provider 包括:
| Provider | 所需條件 | 單次讀取耗時 | 適用場景 |
|---|---|---|---|
gemini-api |
免費 Gemini API key | 約 5–10 秒 | 推薦默認 |
openai |
OpenAI 兼容端點(key + baseUrl + model) | 約 5–10 秒 | qwen-vl、GLM、自建網關 |
anthropic |
Anthropic API key | 約 5–10 秒 | 已有 key 的環境 |
antigravity-cli |
免費 agy CLI,瀏覽器登錄一次,無需 key |
約 15–45 秒 | 不想註冊 API 時 |
逗號分隔的多組 key 在鑑權、限流或配額失敗時會輪換;其他類型錯誤會跳過剩餘 key,沿用原有 provider 故障轉移邏輯。
在 DSH 中,也可通過 Settings → Plugins → Plugin config 裏的 ModLens 卡片切換引擎、勾選 auto 模式可複用的本地 CLI,保存後立即生效。
安裝與啓用¶
在 DeepSeek Harness 中安裝¶
當前版本爲 3.25.0,要求 Node.js >= 22.19。在終端執行:
npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.25.0
安裝與更新細節見倉庫文檔 docs/harness-setup.md。
配置視覺引擎¶
零配置即可啓動:若本機已有 Claude Code、Codex、OpenCode 或 Pi 的登錄態,安裝流程會詢問是否複用。健康檢查會報告當前可用引擎。
若健康檢查爲空,可任選以下方式之一:
- 在 Google AI Studio 申請免費 Gemini API key(約三分鐘,無需信用卡)。
- 安裝 Antigravity CLI 並登錄:
curl -fsSL https://antigravity.google/cli/install.sh | bash
agy
登錄完成後退出即可。agy 作爲免費通道,無需 API key。
在其他 harness 中安裝¶
把下面這句話發給本機 AI,讓它按 INSTALL.md 完成安裝與健康檢查:
Install and configure the modlens skill following https://github.com/liustack/modlens/blob/main/INSTALL.md, then run the health check and tell me the result.
典型用法¶
安裝完成後直接對話即可,無需額外命令。典型流程:
- 在聊天窗口粘貼截圖、照片或設計稿,也可以拖入本地圖片路徑。
- 用自然語言提問,例如「這張圖裏的報錯信息是什麼」「表格第三列的數字總和是多少」。
- 插件自動調用視覺引擎,把讀取結果以結構化 JSON 證據注入上下文,文本模型據此作答。
需要截屏快捷鍵時,可使用獨立插件 dsh-screenshot。
適用場景與注意¶
適合誰
- 在 DSH 裏使用 DeepSeek、GLM 等純文本模型,但需要分析截圖、文檔掃描件、UI 設計稿或報錯界面。
- 希望一次安裝、在多個 harness 間複用同一套視覺能力,且不想改動 harness 核心配置。
- 已有 Gemini、OpenAI 兼容或 Anthropic key,或願意用免費的 Antigravity CLI 作爲視覺後端。
使用前注意
- 插件以當前 DSH 進程的權限運行,圖片會發送到所配置的視覺引擎。安裝前請閱讀源碼與 SECURITY.md,確認引擎選擇與數據處理方式符合你的安全要求。
- 不同引擎的讀取耗時差異較大(約 5 秒到 45 秒),可按場景在設置頁切換。
- SkillHub 社區目錄(skillhub.cn)由社區維護,與 DeepSeek / 幻方無官方從屬關係;插件版本以 npm 與 GitHub 發佈爲準。
結尾¶
ModLens 把「粘貼圖片 → 結構化證據 → 文本模型作答」串成一條鏈路,讓純文本模型在不改 harness 核心的前提下獲得視覺能力。如需查看插件詳情或提交 issue,可訪問社區目錄頁與 GitHub 倉庫:
- 目錄頁:https://www.skillhub.cn/plugins/liustack/modlens
- GitHub:https://github.com/liustack/modlens