前言¶
DSH 的 Web 界面通常以文本输入为主。当需要用语音补充指令、自然语言或快速记录内容时,键盘输入不一定最合适。dsh-ears 是 DeepSeek Harness 的开源语音输入插件,把语音识别、转写和可选润色接入 DSH Web UI。它不会替用户自动发送消息,而是把语音转成可编辑草稿。
这是什么¶
先说明对象。dsh-ears 是面向 DSH Web 的语音输入插件,仓库位于:
WizisCool/dsh-ears
许可证为 MIT。package.json 中记录的版本为:
0.2.1
它主要处理三件事:选择语音识别后端、把转写结果写入草稿、在需要时用润色模型优化转写文本。
核心功能¶
识别后端¶
下面介绍它支持的识别后端:
Web Speech
本地 Whisper
Groq
Deepgram
阿里云百炼
腾讯云
小米 MiMo
硅基流动
自定义 OpenAI 兼容识别后端
本地 Whisper 后端需要在设置页下载 GGML 模型。部分云后端的额外要求如下:
阿里云百炼: 单次最长 300 秒
腾讯云: AppID、SecretID、SecretKey、engine_type
小米 MiMo: Token Plan 需选择区域集群
润色与草稿¶
润色默认开启。模型可以使用 dsh 默认 Agent 模型,也可以从 dsh 已配置模型中选择;提示词可以自定义。
转写结果始终写入可编辑草稿,不会自动发送。开启润色后,原始转写会先写入草稿,润色完成后再更新。
安装与更新¶
前置依赖¶
安装前先确认版本范围:
DeepSeek Harness: 0.1.0-rc.6 至 0.1.1-rc.2
Node.js: ^22.19.0 || >=24.0.0
安装¶
先添加插件:
dsh plugin --profile web add dsh-ears
更新¶
更新时使用同一条 add 命令:
dsh plugin --profile web add dsh-ears
然后重启 dsh web 并刷新 Web UI,以加载新的 Host 代码。
卸载¶
dsh plugin --profile web remove dsh-ears
典型用法¶
经过上面的安装,使用流程如下:
1、点击麦克风图标,或按下:
Ctrl+Shift+Space
开始说话。
2、再次按下同一快捷键,或点击麦克风图标,停止录音并开始转写。
3、如果选择本地 Whisper 后端,先在设置页下载 GGML 模型。
4、开启润色后,原始转写先写入草稿,润色完成后再更新。
5、检查草稿内容后,手动发送。
适用场景与注意¶
适合的场景:
- 已在 DSH Web 环境中使用 DeepSeek Harness,并希望用语音输入指令或补充上下文。
- 希望转写结果先进入草稿,再人工检查后发送。
- 需要选择 Web Speech、本地 Whisper、云端识别后端或自定义 OpenAI 兼容后端。
需要注意:
- 插件会以当前 dsh 进程权限运行;安装前建议检查源码、依赖和 MIT 许可证。
- 所有 API key 和凭据由 Host 保存,浏览器不接触。
- 版本兼容范围为:
DeepSeek Harness: 0.1.0-rc.6 至 0.1.1-rc.2
Node.js: ^22.19.0 || >=24.0.0
- 转写结果不会自动发送,最终仍需要人工确认。
结尾¶
dsh-ears 把语音输入做成 DSH Web 插件:先选择识别后端,再把转写结果放进草稿,最后由用户手动发送。
仓库地址:
https://github.com/WizisCool/dsh-ears