dsh-vision:让文本模型在 DSH 中处理带图请求
dsh-vision 是一个 DSH 插件,旨在解决 DeepSeek V4 Flash/Pro 等文本模型无法直接处理图片的问题。当请求包含图片且目标模型不支持视觉输入时,该插件自动调用视觉模型或系统 OCR 对图片进行描述,并将 provider 调用中的图片块替换为文本描述,确保模型能继续处理上下文。会话日志和 UI 界面仍保留原始图片。 插件提供 Auto 和指定模型两种模式。Auto 模式按顺序尝试已声明视觉能力的模型,失败则回退至系统 OCR(macOS 用 Vision,Windows 用 Media.Ocr,其他平台需 Tesseract)。指定模式仅使用配置模型,失败不重试。
阅读全文