dsh-better-input:为 DeepSeek Harness 增加语音输入、AI 润色与文件转 Markdown

前言

DeepSeek Harness(DSH)把扩展能力做成插件,社区目录是独立站点,并非官方应用商店。日常和智能体对话时,输入不一定只靠键盘:长提示词、常用模板、本地文档、口述内容,都需要更顺的输入路径。

dsh-better-input 是面向 DSH Web UI 的输入增强插件,由 DIAG5 维护,采用 MIT 许可证。下面介绍它能做什么、如何安装,以及几种典型用法。

这是什么

dsh-better-input 提供语音输入、AI 润色、提示词优化、提示词模板、本地文件输入和文件转 Markdown 等能力。

它可以复用 DSH 已配置的模型,部分功能无需额外 API Key;提示词模板保存在本地,不经服务器。仓库地址是:

https://github.com/DIAG5/dsh-better-input

核心功能

语音输入

点击麦克风按钮后,可以边说边转写,识别出的文字会实时流式进入输入框。

语音识别在浏览器本地完成,使用 Web Speech API,无需 API Key,也没有服务器往返。Firefox/Safari 不支持时,麦克风按钮会自动禁用。单次录音上限可自定义为 1–600 秒。

AI 润色

AI 润色用于语音识别后的自动清理,包括去口头禅、修同音错字、补标点,并把口语列举转成编号列表。

该功能复用 DSH 已配置的模型,无需额外 Key。润色进行中如果手动修改草稿,结果不会覆盖编辑;失败时会保留原文。

提示词优化

提示词优化用于把已经写好的提示词整理得更精准。

在输入框里写好提示词后,点击输入框右上角的优化图标,会弹出原文与优化结果的对比页面。确认满意后可以采用,也可以取消并保留原文。该功能复用 DSH 已配置的模型,无需额外 Key。

提示词模板

常用提示词可以存成模板,之后在输入框键入 / 搜索并一键插入正文。

模板保存在宿主本地:

~/.dsh/better-input/templates.json

模板数据不经服务器,也不上传。最多 200 个模板,正文上限 8000 字。

文件输入与文件转 Markdown

dsh-better-input 支持把本地文件带进输入框。

纯文本文件可以直接发送。文档类文件可以先转换,再以 @文件名 的形式插入为引用芯片。支持的文档格式包括 PDF、DOCX、XLSX、PPTX、HTML、EPUB、CSV、JSON、XML 等。发送时,文件引用会展开成转换后的 Markdown 正文。

OCR 视觉识别

README 的使用说明中提到 OCR 视觉识别:针对没有文本层的扫描 PDF、图片型 PDF 或图片型 PPT,可以逐页或抽图交给视觉模型转为 Markdown。

需要说明的是,已实现能力清单中未单列该项,因此建议在实际启用前以仓库当前说明为准。

更新检查

设置页底部提供“关于与更新”入口,可一键检测 npm 最新版。如果发现新版本,会给出更新命令。

DSH 不会在进入时自动更新第三方插件,需要手动执行更新命令。

可视化设置

设置页可配置识别语言、录音时长、语音润色开关、模型、自定义提示词等内容。

如果希望使用滑块式推理强度调节,README 提到可以安装:

@HanaAyane/dsh-reasoning-effort

安装与启用

前置条件

安装前确认环境满足:

  • DeepSeek Harness >= 0.1.0-rc.8
  • Node.js ^22.19.0 || >=24.0.0
  • Chrome/Edge 浏览器

有全局 dsh CLI

如果已经安装全局 dsh CLI,可使用:

dsh plugin --profile web add dsh-better-input

没有全局 dsh CLI

如果没有全局 CLI,或不希望写入全局环境,可使用 npx 临时拉取:

npx -y @deepseek-ai/dsh plugin --profile web add dsh-better-input

备选安装方式

根据仓库资料,备选安装方式还包括:

  • 从源码安装
  • 在 agent preset 的 cordis.yml 中添加 insert 配置

安装后刷新 Web UI,输入框右侧会出现麦克风图标。

典型用法

1. 语音输入

  1. 打开任意对话。
  2. 点击输入框右侧的麦克风按钮。
  3. 开始说话,识别文字会实时流入输入框。
  4. 再次点击按钮或点击停止,结束录音。
  5. 检查、修改后发送。

2. AI 润色

  1. 进入设置 → BetterInput。
  2. 打开 AI 润色。
  3. 选择一个 DSH 里已配置的模型。
  4. 语音识别后,系统按已配置能力进行清理。

3. 提示词优化

  1. 在输入框里写好提示词。
  2. 点击输入框右上角的优化图标。
  3. 查看原文与优化结果对比。
  4. 选择采用优化结果,或取消并保留原文。

4. 提示词模板

  1. 进入设置 → BetterInput → 提示词模板。
  2. 点击新建模板。
  3. 保存模板后,回到输入框。
  4. 键入 / 搜索模板。
  5. 选中候选项,模板正文插入输入框。

5. 添加文件与转 Markdown

  1. 点击输入框右上角的添加文件按钮。
  2. 选择本地文件。
  3. 纯文本文件可直接输入 @ 选入并发送。
  4. 文档类文件先点击开始转换。
  5. 在输入框中键入 @,选择该文件。
  6. 发送时,文件引用会自动展开为 Markdown 正文。

6. OCR 视觉识别

  1. 进入设置 → BetterInput。
  2. 选择一个支持图片输入的 OCR 视觉模型。
  3. 添加 .pdf.pptx 文件。
  4. 点击开始转换。
  5. 按提示选择是否使用 OCR。

如果未配置 OCR 模型,使用 OCR 时只会收到引导去设置页的提示,不会报红错。若所选模型明确声明不支持图片输入,会提前提示更换,避免无效结果。

7. 检查更新

  1. 进入设置 → BetterInput → 关于与更新。
  2. 点击检查更新。
  3. 如果发现有新版本,查看给出的更新命令。
  4. 根据当前安装方式,使用全局 dsh CLI 或 npx 方式执行更新命令。

适用场景与注意

适合在 DSH Web UI 中频繁输入提示词、语音输入口述内容,或需要把本地文档喂给智能体的人。

需要注意:

  • 语音输入依赖浏览器能力,Firefox/Safari 不支持时按钮会自动禁用。
  • 提示词模板保存在本地,不经服务器。
  • DSH 不会自动更新第三方插件,需要手动执行更新命令。
  • DSH rc.8 起已原生支持图片输入;README 也说明不再提供图片相关的插件功能。
  • OCR 视觉识别在 README 使用说明中出现,但已实现能力清单未单列,使用前请核对仓库当前说明。
  • 插件会随 DSH 客户端运行,实际权限取决于启动 dsh 的环境;安装前应检查源码与许可证。
  • 许可证为 MIT。

链接

GitHub:

https://github.com/DIAG5/dsh-better-input

社区目录页:本次资料未确认目录页 URL,本文不提供该链接;如需查看,请以 DSH 社区目录实际页面为准。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜