LocalLens:用 macOS Vision OCR 为 DeepSeek Harness 本地读取屏幕与图片文本

前言

在 DeepSeek Harness(DSH)智能体开发中,经常需要把截图、剪贴板图片或本地图片里的文字读出来:报错截图、表格图片、终端截图、文档位图。若走视觉模型插件,通常需要把图像交给模型服务,可能涉及 API key、配额和上传路径。LocalLens 提供另一种做法:调用 macOS Vision 框架,在本地完成 OCR,只把识别出来的文本返回给 DSH。

这是什么

LocalLens 是 uknowmyface/locallens 下的 DSH 插件,由 uknowmyface 维护,许可证为 MIT。它是非官方社区项目,未声明与 DeepSeek 或 Apple 有关联。插件用于从屏幕截图、剪贴板图像或图像文件中提取文本,调用 macOS Vision 框架进行本地 OCR,不需要视觉模型、API key 或网络请求即可完成 OCR。

核心功能

  • 支持 source=screensource=clipboardsource=file 三种输入来源。
  • 从屏幕截图、剪贴板图像和图像文件中提取文本。
  • 支持 languages 参数,默认值为 zh-Hans,en-US
  • 返回 { text, source, lineCount, warning? }
  • 当前资料说明只接受位图;PDF 需先光栅化。

安装与启用

环境要求:

  • macOS 13 或更新
  • Xcode Command Line Tools
  • Node.js 22+

安装命令:

dsh plugin --profile web add github:uknowmyface/locallens

该命令将插件添加到 web profile。安装后,即可在 DSH 会话中通过自然语言调用。

典型用法

下面示例来自已核实资料中的用法。

1、剪贴板 OCR

先用 Cmd+Ctrl+Shift+4 选择区域并复制截图到剪贴板,然后在聊天框输入:

OCR the clipboard

2、读取本地图片文本

read the text in ~/Desktop/bug.png

3、读取屏幕文本

read what's on my screen

这会捕获整个主显示器,并且需要 Screen Recording 权限。

4、在 OCR 后继续处理

OCR the clipboard and turn the table into markdown
read this error screenshot, then grep the project for where it's thrown

识别出的文本会进入模型上下文,因此可以在后续指令中继续转换、搜索或分析。

适用场景与注意

LocalLens 适合 macOS 13+ 环境下需要读取位图文本的场景,尤其是截图、剪贴板图像和本地图像文件。它不用于理解图像内容,只读取文本。

使用注意:

  • 插件以当前 DSH 进程可获得的用户权限运行。source=file 未做沙箱限制,可读取当前用户可读取的图像文件;安装前应检查源码和 MIT 许可证。
  • 图像在本地读取且不上传,但识别出的文本会进入模型上下文,并发送到所配置的模型服务商。若截图中包含不该粘贴进聊天框的敏感信息,不要 OCR。
  • OCR 输出被标记为不可信输入,应作为数据而非命令。
  • source=screen 捕获整个主显示器,需要 Screen Recording 权限,且无区域或窗口范围。
  • 当前只接受位图;PDF 需先光栅化。

结尾

LocalLens 提供了一条轻量路径:把屏幕、剪贴板或本地位图中的文字通过 macOS Vision OCR 转成文本,再交给 DSH 后续处理。它不需要视觉模型、API key 或网络请求,但识别结果仍会进入模型上下文,因此适合对“读取文字”有明确需求的本地场景。

GitHub:

  • https://github.com/uknowmyface/locallens
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye