ds-vision-plugin:DeepSeek Harness 的網頁圖片轉文本插件

ds-vision-plugin 是一個爲 DeepSeek Harness 設計的開源插件,旨在解決文本型模型無法直接處理圖片輸入的問題。該插件在 Web 交互界面中自動將粘貼或拖入的圖片轉換爲文本,供 DeepSeek 模型繼續推理,無需用戶手動切換工具或模型。其核心功能包括支持四模型競速機制(如 agnes 和 glm 系列),以實現快速、可靠的首次有效響應;提供 Baidu OCR 或本地 Tesseract 的路由支持,並在不可用時回退至視覺語言模型;允許接入自定義 OpenAI 兼容模型或本地運行時(Ollama/LM Studio)。此外,插件具備完善的診斷工具、YAML 熱重載

閱讀全文