前言¶
在 DeepSeek Harness 里,往 composer 输入的内容常常是口语化的:补充上下文、描述需求、交代约束。这类内容说出来比打字快,但听写拿到的是原始转录——有口头语、有重复、有说到一半再改口的自我更正,贴进输入框之前还得手动整理一遍。
dsh-voice-input 的思路是把两步分开:听写交给浏览器识别或系统听写,清理交给当前 Session 已经选定的模型,不需要另外配置 API key。下面介绍这个插件的定位、安装方法和日常用法。
这是什么¶
dsh-voice-input 是由 lhenlihai-hub 维护的开源插件,许可证为 MIT。它为 DeepSeek Harness 提供语音听写与转录清理,使用当前 Session 选定的模型:先听写,再用这个模型做一次清理,最后把结果插入输入框。
几个边界值得先说清楚:
- 它不翻译、不回答所听写的内容,只处理转录文本本身;
- 它没有 API-key 设置,模型路由与凭证完全由 Harness 管理;
- 当前版本 0.3.1,针对 DeepSeek Harness 0.1.0-rc.6 的 Host、Client Modules、Slot 与 Typert 接口构建。
核心功能¶
- 在官方
conversation.input.leftSlot 中添加麦克风与设置控件; - 在可用时使用
SpeechRecognition/webkitSpeechRecognition; - 浏览器识别不可用时回退到系统听写:macOS 为
Fn×2,Windows 为Win+H; - 默认快捷键
Ctrl+Alt+V,支持自定义组合键或F1–F24; - 支持自动语言检测,以及普通话、繁体中文、粤语、英语、日语、韩语识别模式;
- 每次清理调用前即时读取当前 Session 选定的模型,使用 Harness 的路由与凭证;
- 清理失败时保留原始识别文本,并避免覆盖清理期间的编辑;
- 根据浏览器语言自动提供中文或英文界面;
- 提供当前 profile 内确认后的一键卸载。
有一处限制需要提前知道:浏览器插件无法注册系统级全局快捷键,自定义快捷键只在 Harness 页面获得焦点时生效。
安装与启用¶
使用官方安装命令,把 <profile> 替换为你实际使用的 profile:
dsh plugin --profile <profile> add github:lhenlihai-hub/dsh-voice-input
插件按 profile 安装,卸载也在同一 profile 内进行。若要从源码构建或参与开发,要求 Node.js 22 或更新版本。
日常用法¶
以默认配置为例:
1、点击麦克风或按 Ctrl+Alt+V 开始,说完后再点击或按一次快捷键停止;
2、当前 Session 模型清理转录文本,插件将其插入输入框;
3、点击旁边的设置按钮,可修改快捷键或识别语言。
当浏览器识别不可用时,插件回退到系统听写:输入框自动获得焦点,启动系统听写快捷键(macOS 为 Fn×2,Windows 为 Win+H)后直接说话,草稿约 1.2 秒无变化后开始清理。
清理效果可以看这个例子:
输入:我们现在对软件进行重新的review
输出:我们现在对软件进行重新的review。
清理步骤在句末补上了标点;按它遵循的公开听写产品原则,口头语、重复和显式自我更正会被去除。
隐私与模型调用¶
- 音频由浏览器识别实现或系统听写处理,不经 Harness 模型;只有识别出的文本会发送给当前 Session 模型做清理;
- 浏览器识别是否将音频发送给其供应商,取决于该浏览器的实现与隐私政策;
- 插件设置仅存储在浏览器
localStorage中。
卸载¶
插件提供当前 profile 内确认后的一键卸载。同时要留意卸载的边界:卸载按钮不会删除你单独克隆的源码目录,也不会清除 pnpm 的共享内容寻址缓存。
适用场景与注意事项¶
适合两类读者:一是经常在 Harness composer 里口述输入、想省掉手动整理转录的开发者;二是想在 DeepSeek Harness 0.1.0-rc.6 的 Slot 与 Typert 接口上写插件的作者,可以参考它对接官方接口的方式。
安装任何插件前都建议先做两件事:检查源码、确认许可证。插件以当前 dsh 进程的权限运行;dsh-voice-input 采用 MIT 许可证,源码公开在 GitHub 上。
其他注意事项:
- 自定义快捷键仅在 Harness 页面获得焦点时生效;
- 插件设置仅存储在浏览器
localStorage,换浏览器或设备需要重新配置; - 若在意音频是否发送给浏览器供应商,可改用系统听写回退。
小结¶
dsh-voice-input 把听写和整理拆成两步:前者交给浏览器或系统,后者交给当前 Session 的模型,全程不引入额外凭证。如果你的输入大量依赖口述,可以在自己的 profile 里装上试一试。
- 社区插件目录页:https://www.skillhub.cn/plugins/lhenlihai-hub/dsh-voice-input
- GitHub 仓库:https://github.com/lhenlihai-hub/dsh-voice-input
(社区插件目录为独立站点,与 DeepSeek、幻方无官方从属关系。)