ds-vision-plugin:DeepSeek Harness 的网页图片转文本插件

ds-vision-plugin 是一个为 DeepSeek Harness 设计的开源插件,旨在解决文本型模型无法直接处理图片输入的问题。该插件在 Web 交互界面中自动将粘贴或拖入的图片转换为文本,供 DeepSeek 模型继续推理,无需用户手动切换工具或模型。其核心功能包括支持四模型竞速机制(如 agnes 和 glm 系列),以实现快速、可靠的首次有效响应;提供 Baidu OCR 或本地 Tesseract 的路由支持,并在不可用时回退至视觉语言模型;允许接入自定义 OpenAI 兼容模型或本地运行时(Ollama/LM Studio)。此外,插件具备完善的诊断工具、YAML 热重载

阅读全文