dsh-ears:DeepSeek Harness 的开源语音输入插件

前言

DSH 的 Web 界面通常以文本输入为主。当需要用语音补充指令、自然语言或快速记录内容时,键盘输入不一定最合适。dsh-ears 是 DeepSeek Harness 的开源语音输入插件,把语音识别、转写和可选润色接入 DSH Web UI。它不会替用户自动发送消息,而是把语音转成可编辑草稿。

这是什么

先说明对象。dsh-ears 是面向 DSH Web 的语音输入插件,仓库位于:

WizisCool/dsh-ears

许可证为 MIT。package.json 中记录的版本为:

0.2.1

它主要处理三件事:选择语音识别后端、把转写结果写入草稿、在需要时用润色模型优化转写文本。

核心功能

识别后端

下面介绍它支持的识别后端:

Web Speech
本地 Whisper
Groq
Deepgram
阿里云百炼
腾讯云
小米 MiMo
硅基流动
自定义 OpenAI 兼容识别后端

本地 Whisper 后端需要在设置页下载 GGML 模型。部分云后端的额外要求如下:

阿里云百炼: 单次最长 300 秒
腾讯云: AppID、SecretID、SecretKey、engine_type
小米 MiMo: Token Plan 需选择区域集群

润色与草稿

润色默认开启。模型可以使用 dsh 默认 Agent 模型,也可以从 dsh 已配置模型中选择;提示词可以自定义。

转写结果始终写入可编辑草稿,不会自动发送。开启润色后,原始转写会先写入草稿,润色完成后再更新。

安装与更新

前置依赖

安装前先确认版本范围:

DeepSeek Harness: 0.1.0-rc.6 至 0.1.1-rc.2
Node.js: ^22.19.0 || >=24.0.0

安装

先添加插件:

dsh plugin --profile web add dsh-ears

更新

更新时使用同一条 add 命令:

dsh plugin --profile web add dsh-ears

然后重启 dsh web 并刷新 Web UI,以加载新的 Host 代码。

卸载

dsh plugin --profile web remove dsh-ears

典型用法

经过上面的安装,使用流程如下:

1、点击麦克风图标,或按下:

Ctrl+Shift+Space

开始说话。

2、再次按下同一快捷键,或点击麦克风图标,停止录音并开始转写。

3、如果选择本地 Whisper 后端,先在设置页下载 GGML 模型。

4、开启润色后,原始转写先写入草稿,润色完成后再更新。

5、检查草稿内容后,手动发送。

适用场景与注意

适合的场景:

  • 已在 DSH Web 环境中使用 DeepSeek Harness,并希望用语音输入指令或补充上下文。
  • 希望转写结果先进入草稿,再人工检查后发送。
  • 需要选择 Web Speech、本地 Whisper、云端识别后端或自定义 OpenAI 兼容后端。

需要注意:

  • 插件会以当前 dsh 进程权限运行;安装前建议检查源码、依赖和 MIT 许可证。
  • 所有 API key 和凭据由 Host 保存,浏览器不接触。
  • 版本兼容范围为:
DeepSeek Harness: 0.1.0-rc.6 至 0.1.1-rc.2
Node.js: ^22.19.0 || >=24.0.0
  • 转写结果不会自动发送,最终仍需要人工确认。

结尾

dsh-ears 把语音输入做成 DSH Web 插件:先选择识别后端,再把转写结果放进草稿,最后由用户手动发送。

仓库地址:

https://github.com/WizisCool/dsh-ears
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜