dsh-img:爲 DeepSeek Harness 提供圖片理解與本地視覺工具

dsh-img 是 DeepSeek Harness 的社區視覺插件,旨在爲純文本模型提供圖片理解能力。它通過接入視覺後端或本地像素工具,實現 `analyze_image` 圖片問答、OCR、佈局理解及 `vision_ground` 元素定位。插件支持智譜 GLM-4V-Flash、通義 Qwen-VL、Ollama 本地模型及 OpenAI 兼容端點,並內置免 key 的本地工具如 `vision_crop`、`vision_ocr` 等。 安裝需 Node.js >= 20 及 dsh 本體,通過 `pnpm add` 安裝至指定 profile。使用 API 後端時需將 key 注入

閱讀全文
DSH Computer Use for Windows:爲 DeepSeek Harness 提供 Windows 桌面操作工具

`Altairpaca/dsh-computer-use-windows` 是一款面向 DeepSeek Harness (DSH) 的 Windows 桌面自動化插件,目前處於實驗性 Alpha 階段。該項目旨在解決 Windows 自動化中截圖包含無關窗口、座標控制不穩定及 OCR 文本漂移等難題。核心功能包括窗口綁定截圖、魯棒性 OCR、點擊後驗證、鼠標鍵盤輸入控制、窗口管理、批量運行入口、可選的視覺模型接入以及本地健康檢查。系統支持純 OCR 模式以將截圖保留在本地,也可配置 OpenAI 兼容的視覺提供商。安裝運行需 Windows 11、PowerShell 7.4+ 及 Node

閱讀全文
dsh-eye-vision:爲 text-only DSH 模型提供圖像理解、OCR 與 UI 分析

dsh-eye-vision 是面向 DeepSeek Harness 的 DSH 插件,旨在解決主模型僅支持文本輸入但需處理圖像任務的痛點。該插件通過調用任意 OpenAI-compatible 多模態 API,實現圖像理解、OCR 及 UI 分析,並將結果以文本形式返回給主模型,無需主模型直接支持圖像輸入。其核心功能包括提供 image_understand 工具、支持大圖像裁剪、配置目錄白名單、免重啓生效以及剝離代理環境變量等。用戶可通過 dsh plugin add 命令快速安裝,支持本地路徑、URL 或 data URI 作爲圖像源,並可通過指定 task_type 來執行自動識別、

閱讀全文
DSH DeepSeek Vision:爲文本 DSH 模型增加圖像理解、OCR 與視覺證據

DSH DeepSeek Vision 是由 Argonaut790 維護的 MIT 許可證插件,旨在爲僅支持文本的 DeepSeek Harness 模型增加視覺能力。它通過引入獨立的視覺路由,提供圖像理解、全屏 OCR 及持久視覺證據功能,使文本模型能調用圖像分析能力並將結果保留在對話中,實現證據可回溯。核心功能包括支持多種圖片選擇策略、會話範圍視覺分析器、結構化摘要輸出,以及全局 Vision 提供商選擇器。安裝需滿足特定 Node.js 及 Harness 版本要求,未發佈至 npm,需通過本地構建並添加至 Web profile,配置時需避免與內建視覺工具衝突。該插件適用於需穩定將圖

閱讀全文
ds-vision-plugin:DeepSeek Harness 的網頁圖片轉文本插件

ds-vision-plugin 是一個爲 DeepSeek Harness 設計的開源插件,旨在解決文本型模型無法直接處理圖片輸入的問題。該插件在 Web 交互界面中自動將粘貼或拖入的圖片轉換爲文本,供 DeepSeek 模型繼續推理,無需用戶手動切換工具或模型。其核心功能包括支持四模型競速機制(如 agnes 和 glm 系列),以實現快速、可靠的首次有效響應;提供 Baidu OCR 或本地 Tesseract 的路由支持,並在不可用時回退至視覺語言模型;允許接入自定義 OpenAI 兼容模型或本地運行時(Ollama/LM Studio)。此外,插件具備完善的診斷工具、YAML 熱重載

閱讀全文