dsh-tesseract-ocr:为文本模型接入本地图片 OCR
`dsh-tesseract-ocr` 是一款 DeepSeek Harness (DSH) 插件,旨在解决文本模型无法处理图片输入的问题。该插件通过本地调用 Tesseract OCR 引擎识别附件图片中的文字,并将识别后的纯文本发送至模型 API,默认保留原始图片字节在本地,不上传给模型提供商,从而避免修改模型输入模态或传输敏感数据。 核心功能包括:支持文本模型处理图片附件、本地 OCR 识别、默认仅发送文本、可选的视觉模型直通模式(`passthrough: true`),以及未加载时拒绝图片附件的 fail-closed 安全机制。适用场景为使用 DSH 文本模型且需基于图片文字问答的
阅读全文picturereader:给纯文本 DSH 模型补上本地看图能力
picturereader 是 jing-hy 维护的 DSH 模型推理插件(v3.2.0)。它通过视觉孪生 adapter 让纯文本模型获得原生缩略图,用 image_scan、image_ocr 等本地工具把图片转成结构化文本证据,支持隐私/智能/严谨三模式路由与可选外部 VLM。另含 document_to_image 文档转图与 image_edit 本地修图。默认纯本地运行,MIT 许可证。
阅读全文用 dsh-vision-complete 给 DeepSeek Harness 接上看图和听声
dsh-vision-complete 是 Yts1919 维护的 DeepSeek Harness 社区插件(MIT),给纯文本模型补上看图、OCR、检测、视频、语音和 PDF。插件本身不含视觉模型,默认经 MCP 调用通义千问,备用 vision.py 可接 OpenAI 兼容接口。目录页安装命令为 dsh plugin add github:Yts1919/dsh-vision-complete;完整启用还需 Windows 安装脚本、DASHSCOPE_API_KEY,并重启 Harness。
阅读全文用 dsh-vision-router 给纯文本 DeepSeek Harness 智能体装上眼睛
dsh-vision-router 是 ysr666 维护的 DSH 工具与能力插件(MIT,v1.4.4)。它把视觉模型当眼睛、DeepSeek 当大脑,默认提供免 Key 的 OVH 匿名兜底,并注册问答、定位、裁剪、像素对比、OCR 等 11 个像素级工具。本文按社区目录与 GitHub README 核实安装命令、自动识图模型组用法和权限注意事项。
阅读全文使用 dsh-vision-toolkit 给 DeepSeek Harness 纯文本模型补上视觉能力
dsh-vision-toolkit 是 Anionex 维护的 DeepSeek Harness 界面增强插件,把 agent-vision-toolkit 接到 Web / Headless Profile。纯文本模型粘贴图片后可切到 Vision Toolkit 变体,完成带意图的图片问答、元素定位、长截图 OCR 和带像素对比的 UI 还原。目录安装命令为 dsh plugin add github:Anionex/dsh-vision-toolkit,MIT 许可,当前 npm 版本 0.1.20。
阅读全文基于PaddlePaddle2.0验证码端到端的识别
你的代码已经涵盖了验证码识别项目的大部分内容,包括数据处理、模型训练和推理。以下是对你提供的代码进行的一些改进和完善建议: ### 1. 数据预处理 确保图像的尺寸一致(27x72),因为这是你在训练时使用的输入尺寸。 ### 2. 模型定义 你的 `Model` 类已经很好地封装了网络结构,但可以进一步优化和添加一些注释以方便理解。 ### 3. 训练过程 在训练过程中,确保使用多卡训练时
阅读全文