dsh-vision:讓文本模型在 DSH 中處理帶圖請求
dsh-vision 是一個 DSH 插件,旨在解決 DeepSeek V4 Flash/Pro 等文本模型無法直接處理圖片的問題。當請求包含圖片且目標模型不支持視覺輸入時,該插件自動調用視覺模型或系統 OCR 對圖片進行描述,並將 provider 調用中的圖片塊替換爲文本描述,確保模型能繼續處理上下文。會話日誌和 UI 界面仍保留原始圖片。 插件提供 Auto 和指定模型兩種模式。Auto 模式按順序嘗試已聲明視覺能力的模型,失敗則回退至系統 OCR(macOS 用 Vision,Windows 用 Media.Ocr,其他平臺需 Tesseract)。指定模式僅使用配置模型,失敗不重試。
閱讀全文