前言¶
做智能體開發時經常遇到這類問題:模型本身是純文本的,用戶貼一張截圖問“這個報錯是什麼”,模型答不上來;想生成一張圖,得自己另開工具、下載文件、再拖回會話;想讓它操作網頁,主流方案要麼跑無頭瀏覽器不可見,要麼直接接管用戶自己的瀏覽器 profile,風險不低。
dsh-mindseye(MindsEye)針對的就是這三個缺口。它是 DeepSeek Harness(DSH)的一個插件,用一句話概括:Intent-driven vision, image generation, and visible browser automation for DeepSeek Harness。下文按功能、安裝、配置、注意事項的順序介紹。
這是什麼¶
MindsEye 由 kanchengw 維護,倉庫爲 kanchengw/dsh-mindseye,當前版本 0.2.8,許可證 MIT,Node 引擎要求 >=22.19。
它的設計原則是讓 DSH 會話保持主要交互界面:圖片以 DSH 附件的形式保留,生成結果也以原生 DSH 附件顯示在會話中,用戶不需要手動選本地文件或在多個工具間倒騰。
核心功能¶
圖像理解¶
- 保留 DSH 圖片附件;圖片輪次自動掛載視覺工具,純文本輪次保持單一激活入口。
mindseye_read_image:回答單圖/多圖問題,支持 OCR、版面、圖表、顏色、像素差異等聚焦視覺任務,返回包含圖像、證據、答案和調用元數據的結構化結果。mindseye_ground:定位目標並返回像素邊界框,供點擊、裁剪等下游動作使用。- 純文本輪次需要視覺能力時,通過
mindseye_vision_activate手動掛載視覺工具。 mindseye_plan負責提取當前請求、準備下遊工具使用的意圖上下文。
圖像生成與編輯¶
mindseye_generate_image:將用戶的圖像請求發送到配置的圖像生成路由,生成結果以原生 DSH 附件返回並顯示在會話中。mindseye_edit_image:將 DSH 圖片附件與編輯請求發送到配置的圖像編輯路由。- 注意:生成圖像不會自動保存到項目,也不會運行驗證 pass,需要落盤時要自己處理。
瀏覽器自動化¶
配置 gui.enabled 開啓後,插件會打開一個獨立的可見 Chrome 或 Edge 會話。GUI 工具可以打開頁面、快照、等待、點擊、輸入、按鍵、滾動和關閉會話,對應 mindseye_gui_open / snapshot / wait、mindseye_gui_click / type / keypress / scroll、mindseye_gui_close。
遇到 CAPTCHA、登錄或權限確認時,運行會通過原生 DSH 問題卡暫停,用戶可以:
1、接管可見瀏覽器,手動完成該步驟;
2、如果該步驟可能已完成,跳過第一次交接詢問;
3、放棄本次運行。
用戶恢復後,MindsEye 會先檢查頁面狀態,再把控制權交回模型。另外,每次 GUI 動作之後都要求一次新快照,避免元素引用和座標悄悄過期。
可選記憶工具¶
插件還提供一組可選的記憶工具,暴露顯式 DSH 操作,用於存儲、檢索、搜索和比較圖像相關記錄。
安裝與啓用¶
安裝兩步:
npm install dsh-mindseye
npx @deepseek-ai/dsh plugin --profile web add dsh-mindseye
安裝完成後重啓 DSH Web,然後在 MindsEye 設置卡中至少配置一個 vision route。未配置的聚焦視覺路由(如 extract、locate)在可用時會回退到通用理解路由,所以最小可用配置只需要一條路由。
配置¶
通過 DSH 設置卡或插件配置進行設置,主要配置項如下:
vision.routes:understand/extract/locate三個獨立路由。vision.fallbacks:視覺調用的回退路由。image.generate:圖像生成路由,按順序嘗試。image.edit:圖像編輯路由,按順序嘗試。gui.enabled:開啓可見瀏覽器工具,默認關閉。gui.browser:auto、chrome或edge。gui.restrictHosts:設爲true時啓用主機白名單。gui.allowedHosts:主機限制開啓時允許訪問的主機列表。gui.maxSteps和gui.timeoutMs:單次瀏覽器運行的步數與超時上限。
視覺路由使用 OpenAI 兼容的 Chat Completions 或 Responses API;圖像路由支持 JSON 和 multipart 請求體,因此不同的圖像 provider 可以獨立配置。
數據與安全¶
幾個值得在接入前確認的設計:
1、圖像字節和問題只在 MindsEye 工具調用對應 provider 時發送;憑證來自 DSH credentials、環境變量或插件設置,且只發送給匹配的 provider。
2、瀏覽器自動化只在顯式啓用時啓動本地 Chrome/Edge 子進程,使用隔離會話,不附加用戶現有的瀏覽器 profile,也不執行下載的代碼;導航可通過 gui.restrictHosts / gui.allowedHosts 限制到白名單。
3、圖像能力模型保留原生 DSH 圖像塊;純文本回退路徑使用爲當前粘貼操作創建的隔離臨時文件。
適用場景與注意¶
適合的場景:純文本模型需要讀截圖、圖表、OCR;需要在會話內直接生成和編輯圖片;需要模型操作網頁但要求過程可見、可人工接管。
注意事項:
1、插件以當前 dsh 進程的權限運行,安裝前建議檢查源碼與許可證。本項目爲 MIT 許可,倉庫公開可查。
2、gui.enabled 默認關閉,瀏覽器自動化只在顯式啓用時啓動,不開啓則不會有本地瀏覽器子進程。
3、需要接入的視覺/圖像服務需兼容 OpenAI 兼容 API 或支持 JSON / multipart 請求體,具體路由在設置卡中逐條配置。
想參與開發的話,倉庫提供標準命令:
pnpm install
pnpm test
pnpm typecheck
pnpm build
小結¶
dsh-mindseye 把圖像理解、圖像生成和可見瀏覽器自動化整合進 DSH 的插件體系,同時把交互、權限邊界和人工接管都留在 DSH 會話裏。如果你的 DSH 工作流缺多模態和網頁操作能力,可以一試。
倉庫地址:https://github.com/kanchengw/dsh-mindseye
社區目錄收錄地址:https://www.skillhub.cn/plugins/kanchengw/dsh-mindseye(該地址來自插件收錄線索,請以實際站點爲準)。DSH 的理念是“一切皆插件”,上述社區目錄爲獨立站點,與 DeepSeek、幻方無官方從屬關係。