ModLens:爲純文本模型補上視覺能力

前言

DeepSeek Harness(DSH)的主力對話模型以純文本爲主,無法直接讀取聊天裏粘貼的圖片。常見做法是先把圖片存成文件,再把路徑交給模型或另開一條多模態鏈路,步驟多、上下文也容易斷。

ModLens 是 DSH 生態裏的視覺插件,由 liustack 維護,在 GitHub 上開源(MIT 許可證,約 3600 stars)。它把粘貼的圖片交給獨立的視覺引擎處理,再把 OCR、版面結構和語義信息整理成結構化 JSON 證據交給文本模型,讓 DeepSeek、GLM 等純文本模型也能基於圖片內容作答。

這是什麼

ModLens(@liustack/modlens)的定位是:給純文本編碼智能體外掛視覺能力。在 DSH 裏,它是一個獨立插件;在其他 harness(Claude Code、Codex、OpenCode、Pi 等)裏,對應一個 skill 目錄。

插件不修改 harness 核心配置,也不依賴本地代理進程。卸載時刪除對應目錄即可恢復默認行爲。

核心功能

直接粘貼圖片

安裝後,在對話裏粘貼圖片或拖入路徑即可觸發。圖片會經 modlens_read_image 工具送入視覺引擎,返回結構化證據,而非讓模型憑空猜測畫面內容。

證據包含完整轉錄文本、按閱讀順序排列的版面區域,以及實體與關係列表。同一張圖粘貼一次後,後續追問無需重複粘貼。

兩種粘貼路徑

在 DSH 中,粘貼圖片有兩種交互方式:

  1. 直接粘貼:圖片先落到臨時文件,路徑進入輸入框,再由 modlens_read_image 接管處理。這與 OpenCode、Pi 等 harness 的默認行爲一致。
  2. 選擇 (modlens vision) 模型:在模型選擇器裏選帶 (modlens vision) 後綴的條目(例如 DeepSeek-V4-Flash (modlens vision)),再粘貼圖片。縮略圖會保留在消息裏,請求時再轉換爲結構化證據。

插件會自動發現各 provider 路由上符合條件的純文本 DeepSeek、GLM、MiMo Pro 模型,併爲每條路由添加包裝條目。已確認具備原生視覺能力的模型不會被接管。

多引擎與故障轉移

ModLens 不綁定單一視覺服務。內置六種 provider,並可複用本機四個 agent CLI 的已有登錄態,共十種視覺來源。內置 provider 包括:

Provider 所需條件 單次讀取耗時 適用場景
gemini-api 免費 Gemini API key 約 5–10 秒 推薦默認
openai OpenAI 兼容端點(key + baseUrl + model) 約 5–10 秒 qwen-vl、GLM、自建網關
anthropic Anthropic API key 約 5–10 秒 已有 key 的環境
antigravity-cli 免費 agy CLI,瀏覽器登錄一次,無需 key 約 15–45 秒 不想註冊 API 時

逗號分隔的多組 key 在鑑權、限流或配額失敗時會輪換;其他類型錯誤會跳過剩餘 key,沿用原有 provider 故障轉移邏輯。

在 DSH 中,也可通過 Settings → Plugins → Plugin config 裏的 ModLens 卡片切換引擎、勾選 auto 模式可複用的本地 CLI,保存後立即生效。

安裝與啓用

在 DeepSeek Harness 中安裝

當前版本爲 3.25.0,要求 Node.js >= 22.19。在終端執行:

npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.25.0

安裝與更新細節見倉庫文檔 docs/harness-setup.md

配置視覺引擎

零配置即可啓動:若本機已有 Claude Code、Codex、OpenCode 或 Pi 的登錄態,安裝流程會詢問是否複用。健康檢查會報告當前可用引擎。

若健康檢查爲空,可任選以下方式之一:

  1. Google AI Studio 申請免費 Gemini API key(約三分鐘,無需信用卡)。
  2. 安裝 Antigravity CLI 並登錄:
curl -fsSL https://antigravity.google/cli/install.sh | bash
agy

登錄完成後退出即可。agy 作爲免費通道,無需 API key。

在其他 harness 中安裝

把下面這句話發給本機 AI,讓它按 INSTALL.md 完成安裝與健康檢查:

Install and configure the modlens skill following https://github.com/liustack/modlens/blob/main/INSTALL.md, then run the health check and tell me the result.

典型用法

安裝完成後直接對話即可,無需額外命令。典型流程:

  1. 在聊天窗口粘貼截圖、照片或設計稿,也可以拖入本地圖片路徑。
  2. 用自然語言提問,例如「這張圖裏的報錯信息是什麼」「表格第三列的數字總和是多少」。
  3. 插件自動調用視覺引擎,把讀取結果以結構化 JSON 證據注入上下文,文本模型據此作答。

需要截屏快捷鍵時,可使用獨立插件 dsh-screenshot

適用場景與注意

適合誰

  • 在 DSH 裏使用 DeepSeek、GLM 等純文本模型,但需要分析截圖、文檔掃描件、UI 設計稿或報錯界面。
  • 希望一次安裝、在多個 harness 間複用同一套視覺能力,且不想改動 harness 核心配置。
  • 已有 Gemini、OpenAI 兼容或 Anthropic key,或願意用免費的 Antigravity CLI 作爲視覺後端。

使用前注意

  • 插件以當前 DSH 進程的權限運行,圖片會發送到所配置的視覺引擎。安裝前請閱讀源碼與 SECURITY.md,確認引擎選擇與數據處理方式符合你的安全要求。
  • 不同引擎的讀取耗時差異較大(約 5 秒到 45 秒),可按場景在設置頁切換。
  • SkillHub 社區目錄(skillhub.cn)由社區維護,與 DeepSeek / 幻方無官方從屬關係;插件版本以 npm 與 GitHub 發佈爲準。

結尾

ModLens 把「粘貼圖片 → 結構化證據 → 文本模型作答」串成一條鏈路,讓純文本模型在不改 harness 核心的前提下獲得視覺能力。如需查看插件詳情或提交 issue,可訪問社區目錄頁與 GitHub 倉庫:

  • 目錄頁:https://www.skillhub.cn/plugins/liustack/modlens
  • GitHub:https://github.com/liustack/modlens
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜