dsh-img:爲 DeepSeek Harness 提供圖片理解與本地視覺工具

dsh-img 是 DeepSeek Harness 的社區視覺插件,旨在爲純文本模型提供圖片理解能力。它通過接入視覺後端或本地像素工具,實現 `analyze_image` 圖片問答、OCR、佈局理解及 `vision_ground` 元素定位。插件支持智譜 GLM-4V-Flash、通義 Qwen-VL、Ollama 本地模型及 OpenAI 兼容端點,並內置免 key 的本地工具如 `vision_crop`、`vision_ocr` 等。 安裝需 Node.js >= 20 及 dsh 本體,通過 `pnpm add` 安裝至指定 profile。使用 API 後端時需將 key 注入

閱讀全文
dsh-image-plugins:爲 DeepSeek Harness 接入看圖與生圖

DeepSeek Harness多模態插件dsh-image-plugins爲DSH Web端提供圖片理解與生成能力。該插件包含understand_image和generate_image兩個獨立工具,分別支持讀取工作區圖片並返回文字描述,以及根據提示詞生成並保存圖片。插件支持OpenAI-compatible端點及DashScope原生API,其中DashScope圖片生成需使用native Model Studio API以規避404錯誤。安裝後需通過Web設置面板或配置文件獨立啓用vision和image功能,並配置相應的baseUrl、apiKey和model。密鑰支持明文、環境變量

閱讀全文
dsh-tool-describe-image:給 DSH 增加圖片理解能力

`sala003/dsh-tool-describe-image` 是 DSH 生態下的 MIT 許可插件,旨在爲文本模型賦予圖片處理能力。它通過接入任意 OpenAI 兼容視覺端點(如百鍊、智譜等),將圖片轉化爲文字描述或結構化 HTML,供 DeepSeek 使用。核心功能包括:Web 界面粘貼即識別、按路徑調用工具描述圖片、查詢 DeepSeek 賬戶餘額,以及提供可定製的鯨魚娘桌寵入口。插件支持零配置啓動,後續可通過環境變量或設置面板補配 API Key。安裝需 DSH 0.1.0-rc.6+,通過 npm 全局安裝並啓用。支持 PNG、JPG、WebP、GIF 格式,單張上限 8Mi

閱讀全文
dsh-dseyes:給 DeepSeek Harness 的純文本模型提供原生圖片上傳體驗

dsh-dseyes 是 DeepSeek Harness (DSH) 的一個 MIT 許可插件,旨在解決純文本模型無法直接處理圖片的問題。該插件允許用戶在 Web GUI 中粘貼或拖入圖片,以附件形式顯示並保留原圖。在請求發送給 DeepSeek 之前,宿主端自動調用智譜 GLM 免費視覺模型(如 glm-4v-flash)識別圖片內容,生成文字描述並替換原圖片塊,使文本模型基於描述進行回答。 插件支持自動降級鏈、結果複用及診斷接口,讀圖失敗時對話不中斷。安裝需 Node >= 22,配置 GLM_API_KEY 或 ZHIPU_API_KEY,並通過 `dsh plugin --profi

閱讀全文
dsh-vision-tools:給 DSH 會話增加圖片理解能力

dsh-vision-tools 是 DSH 生態中的視覺插件,由 moon09300731 維護(MIT 許可)。它提供全局 `vision_understand` 工具,通過 OpenAI 兼容 API(支持智譜、阿里、硅基流動、OpenAI)理解本地圖片,實現畫面描述、文字識別及基於圖片的回答。圖片可通過粘貼、拖拽或按鈕選擇方式送入,自動保存至指定目錄並填入提示詞。插件支持限流自動降級、全局及項目級配置即時生效,並在 Web 界面提供“識圖”入口。安裝命令爲 `dsh plugin --profile web add dsh-vision-tools`,需重啓 `dsh web`。配置需

閱讀全文
dsh-vision-plugin:爲 DSH 增加圖片理解能力

dsh-vision-plugin 是專爲 DeepSeek Harness (DSH) 開發的插件,旨在解決純文本模型無法直接處理圖片的限制。該插件通過調用 OpenRouter 的免費多模態模型(`:free`),在發送前將圖片自動轉換爲文字描述,從而賦予 DeepSeek 等文本模型圖片理解能力,且使用過程零 API 成本。 主要功能包括:提供 `describe_image` 工具讀取本地圖片;通過 `llm/stream` 鉤子在模型不支持圖片時自動攔截並轉換圖片;首次啓動時自動在配置文件中寫入指向 OpenRouter 的 `deepseek-vision` provider。使用

閱讀全文
dsh-vision:爲 DeepSeek Harness 的純文本 DeepSeek 增加圖片理解

dsh-vision 是由 54xkeee 開發的 DeepSeek Harness 插件,旨在爲純文本模型 DeepSeek 增加圖片理解能力。它通過包裝適配器將圖片轉爲文本佔位,並將識別結果回填供模型處理。該插件默認使用豆包 Web 通道,只需瀏覽器登錄即可,免 API key 且零成本;同時支持反重力 IDE、Gemini API、Cockpit 反代、aicode 直連及任意 IDE CLI 等多種接入方式。核心功能包括視覺證據記憶、內容哈希緩存、檔位自動升級及四種任務模式。安裝簡單,配置靈活,適用於希望低成本爲 DSH 增加視覺能力或已有相關 IDE/API 額度的開發者。需注意檢查

閱讀全文
使用dsh-vision在DeepSeek Harness中實現接近原生的圖片理解

dsh-vision 是 oil-oil 維護的 DeepSeek Harness 插件,MIT 開源,當前 0.1.0,面向 dsh 0.1.0-rc.6。主模型能看圖時原圖直髮;純文本 DeepSeek 則把原圖交給 ZenMux、百鍊、TokenDance 或 OpenRouter 觀察,再以非可信上下文交回原模型作答,併兼容 see-skill 與本地 OCR。本文根據目錄頁與 GitHub README 覈實安裝、配置和安全邊界。

閱讀全文