dsh-vision-skill:让 DSH 纯文本模型也能识图、OCR、定位目标
dsh-vision-skill 是 DSH 生态下的标准识图插件,由 DDDFXYqiming 开发并采用 MIT 授权。该插件旨在弥补纯文本模型无法直接处理图片的缺陷,通过注册原生 `vision` runtime skill,让文本模型能够调用本地工具实现图片识别、OCR、目标定位及主色分析等功能。 其核心工具包括:`vision_analyze`(支持通用、代码、证据等6种模式)、`vision_ocr`(保留排版的文字提取)、`vision_ground`(返回坐标的目标定位)、`vision_detect`(枚举按钮等元素)、`vision_dominant_colors`(本地算
阅读全文