dsh-vision-skill:让 DSH 纯文本模型也能识图、OCR、定位目标

dsh-vision-skill 是 DSH 生态下的标准识图插件,由 DDDFXYqiming 开发并采用 MIT 授权。该插件旨在弥补纯文本模型无法直接处理图片的缺陷,通过注册原生 `vision` runtime skill,让文本模型能够调用本地工具实现图片识别、OCR、目标定位及主色分析等功能。 其核心工具包括:`vision_analyze`(支持通用、代码、证据等6种模式)、`vision_ocr`(保留排版的文字提取)、`vision_ground`(返回坐标的目标定位)、`vision_detect`(枚举按钮等元素)、`vision_dominant_colors`(本地算

阅读全文
dsh-vision-bridge:给 DeepSeek V4 / V4-Flash 的图片消息加一层描述桥接

dsh-vision-bridge 是 DSH 的一个第三方图片处理插件,旨在解决 DeepSeek V4 / V4-Flash 等纯文本模型无法原生处理图片上下文的问题。该插件通过调用 OpenAI 兼容的视觉语言模型(VLM),将用户输入的图片自动转换为文字描述,再交由 DeepSeek 处理,从而在不改变原有文本流程的前提下实现图片理解。 核心功能包括:自动识别并转换图片内容、动态声明模型支持图片输入、请求前拦截并替换图片块、原生支持图片的模型直接放行、基于 attachmentId 缓存描述以重复发送不重复计费、识别失败时优雅降级且不中断对话。安装需前置 dsh CLI 与 pnpm,

阅读全文