dsh-voice-input: Voice Dictation and Transcription Cleaning Plugin for DeepSeek Harness

前言

在 DeepSeek Harness 里,往 composer 输入的内容常常是口语化的:补充上下文、描述需求、交代约束。这类内容说出来比打字快,但听写拿到的是原始转录——有口头语、有重复、有说到一半再改口的自我更正,贴进输入框之前还得手动整理一遍。

dsh-voice-input 的思路是把两步分开:听写交给浏览器识别或系统听写,清理交给当前 Session 已经选定的模型,不需要另外配置 API key。下面介绍这个插件的定位、安装方法和日常用法。

这是什么

dsh-voice-input 是由 lhenlihai-hub 维护的开源插件,许可证为 MIT。它为 DeepSeek Harness 提供语音听写与转录清理,使用当前 Session 选定的模型:先听写,再用这个模型做一次清理,最后把结果插入输入框。

几个边界值得先说清楚:

  • 它不翻译、不回答所听写的内容,只处理转录文本本身;
  • 它没有 API-key 设置,模型路由与凭证完全由 Harness 管理;
  • 当前版本 0.3.1,针对 DeepSeek Harness 0.1.0-rc.6 的 Host、Client Modules、Slot 与 Typert 接口构建。

核心功能

  • 在官方 conversation.input.left Slot 中添加麦克风与设置控件;
  • 在可用时使用 SpeechRecognition / webkitSpeechRecognition
  • 浏览器识别不可用时回退到系统听写:macOS 为 Fn×2,Windows 为 Win+H
  • 默认快捷键 Ctrl+Alt+V,支持自定义组合键或 F1F24
  • 支持自动语言检测,以及普通话、繁体中文、粤语、英语、日语、韩语识别模式;
  • 每次清理调用前即时读取当前 Session 选定的模型,使用 Harness 的路由与凭证;
  • 清理失败时保留原始识别文本,并避免覆盖清理期间的编辑;
  • 根据浏览器语言自动提供中文或英文界面;
  • 提供当前 profile 内确认后的一键卸载。

有一处限制需要提前知道:浏览器插件无法注册系统级全局快捷键,自定义快捷键只在 Harness 页面获得焦点时生效。

安装与启用

使用官方安装命令,把 <profile> 替换为你实际使用的 profile:

dsh plugin --profile <profile> add github:lhenlihai-hub/dsh-voice-input

插件按 profile 安装,卸载也在同一 profile 内进行。若要从源码构建或参与开发,要求 Node.js 22 或更新版本。

日常用法

以默认配置为例:

1、点击麦克风或按 Ctrl+Alt+V 开始,说完后再点击或按一次快捷键停止;
2、当前 Session 模型清理转录文本,插件将其插入输入框;
3、点击旁边的设置按钮,可修改快捷键或识别语言。

当浏览器识别不可用时,插件回退到系统听写:输入框自动获得焦点,启动系统听写快捷键(macOS 为 Fn×2,Windows 为 Win+H)后直接说话,草稿约 1.2 秒无变化后开始清理。

清理效果可以看这个例子:

输入:我们现在对软件进行重新的review
输出:我们现在对软件进行重新的review。

清理步骤在句末补上了标点;按它遵循的公开听写产品原则,口头语、重复和显式自我更正会被去除。

隐私与模型调用

  • 音频由浏览器识别实现或系统听写处理,不经 Harness 模型;只有识别出的文本会发送给当前 Session 模型做清理;
  • 浏览器识别是否将音频发送给其供应商,取决于该浏览器的实现与隐私政策;
  • 插件设置仅存储在浏览器 localStorage 中。

卸载

插件提供当前 profile 内确认后的一键卸载。同时要留意卸载的边界:卸载按钮不会删除你单独克隆的源码目录,也不会清除 pnpm 的共享内容寻址缓存。

适用场景与注意事项

适合两类读者:一是经常在 Harness composer 里口述输入、想省掉手动整理转录的开发者;二是想在 DeepSeek Harness 0.1.0-rc.6 的 Slot 与 Typert 接口上写插件的作者,可以参考它对接官方接口的方式。

安装任何插件前都建议先做两件事:检查源码、确认许可证。插件以当前 dsh 进程的权限运行;dsh-voice-input 采用 MIT 许可证,源码公开在 GitHub 上。

其他注意事项:

  • 自定义快捷键仅在 Harness 页面获得焦点时生效;
  • 插件设置仅存储在浏览器 localStorage,换浏览器或设备需要重新配置;
  • 若在意音频是否发送给浏览器供应商,可改用系统听写回退。

小结

dsh-voice-input 把听写和整理拆成两步:前者交给浏览器或系统,后者交给当前 Session 的模型,全程不引入额外凭证。如果你的输入大量依赖口述,可以在自己的 profile 里装上试一试。

  • 社区插件目录页:https://www.skillhub.cn/plugins/lhenlihai-hub/dsh-voice-input
  • GitHub 仓库:https://github.com/lhenlihai-hub/dsh-voice-input

(社区插件目录为独立站点,与 DeepSeek、幻方无官方从属关系。)

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

Xiaoye