dsh-dictate:把语音输入接入 DSH Composer

前言

在 DSH 中写长提示词、整理命令或补全代码说明时,键盘输入有时不够直接。dsh-dictate 把语音输入作为 Composer 的一种输入方式:先录音,再转写,最后把文字停在 Composer 里,由用户继续审阅、修改和发送。

它不是实时语音对话插件:不会朗读模型回复,也不会启动双向语音会话。下面介绍它的定位、能力、安装方式和需要注意的运行边界。

这是什么

dsh-dictate 是面向 DeepSeek Harness(DSH)Composer 的上下文感知语音输入插件,GitHub owner 为 franksong2702

它默认使用浏览器 Web Speech 识别,安装后即可使用;在受支持平台上,也可以选择本地 SenseVoice 增强转写。停止录音后,转写结果会留在 Composer 中;如果启用模型润色,它会参考当前 Session 中可见的用户/Assistant 文本整理用词和标点;发送动作始终由用户控制。

核心能力

默认浏览器识别

  • 麦克风入口位于 DSH Composer 工具栏,录音和状态显示在 Composer 上方。
  • Web Speech 模式下,录音时显示实时转写,最终文字写入 Composer。
  • 需要 Chrome 或 Edge 的 Web Speech API。
  • 首次使用需要授予麦克风权限。
  • Web Speech API 的音频由浏览器语音服务处理,不经过 DSH 服务端。

可选本地 SenseVoice

  • 本地 SenseVoice 是实验性增强转写,适用于 Apple Silicon Mac 和 Windows x64。
  • 可以从插件设置页安装、启动、停止、检查状态。
  • 可以显式开启“随 DSH 自动启动”;该选项默认关闭。
  • 首次安装需下载约 253 MB 的 SenseVoice Q8 模型。
  • 运行程序随插件包提供,并经过 SHA-256 校验。
  • 本地识别是停止录音后的最终转写,提供 VAD 语音确认和约 600 ms 尾音保护,不提供实时临时文字。

上下文增强

  • 上下文词汇提取基于当前 Session 和 Composer;模型不可用时使用规则词汇。
  • 选择普通话、粤语或繁体中文时,可以启用“优化中英混合识别”。
  • 可选模型润色使用当前 DSH 可用模型,参考最近 6 条可见用户/Assistant 文本整理用词和标点。
  • 模型润色失败时保留原始转写。

发送控制

  • 模型润色和自动发送默认关闭。
  • 自动发送仅在用户主动结束录音时提交。
  • 浏览器自行结束识别时不会自动发送。
  • 本地识别不可用时不会静默回退,需要用户明确选择本次改用浏览器识别。
  • 已录制音频转写失败不会发送到其他服务。

安装与启用

先安装到 Web profile:

dsh plugin --profile web add dsh-dictate@latest

安装完成后,重启对应的 DSH Web 进程:

dsh web

当前 package.json 版本为:

0.4.0-alpha.9

快速安装说明给出的兼容范围为:

DSH >=0.1.2-alpha.3 <0.2.0

配置入口如下:

设置 → 插件 → 插件配置 → 上下文语音输入

浏览器语音识别保持默认即可,不需要安装本地模型。本地 SenseVoice 在受支持平台上从插件设置页安装和启动。

DSH Web 首次启动会打印一条带认证 token 的本机 URL。访问时应使用启动输出中的完整 URL;不要复制或分享其中的 token。

dsh-dictate 作为 DSH 插件加载运行,会按当前 dsh 进程权限访问本地文件、回环接口和系统资源;安装前应检查源码、LICENSETHIRD_PARTY_NOTICES.md 等文件。

典型用法

1、单击 Composer 工具栏中的麦克风开始录音;再次单击麦克风或同一个右侧修饰键结束录音。

2、macOS 在 Composer 聚焦时单击右 Command,Windows/Linux 单击右 Control;按一次开始,再按一次结束。

3、启用“按住鼠标录音”后,在 Composer 内按住鼠标 500 ms 开始录音,松开结束并将最终结果写入输入框。

4、本地 SenseVoice 模式检测到持续语音后显示“已检测到语音”;停止后由 SenseVoice 返回最终文字。

5、启用模型润色后,插件会等待所选模型润色完成再填入 Composer;润色失败时保留原始转写。

6、启用自动发送后,只有用户主动结束录音才自动提交;浏览器自行结束识别时不会自动发送。

数据范围与运行环境

模型润色会发送原始转写和当前 Session 最近 6 条可见用户/Assistant 文本给所选模型提供商。它不读取系统提示词、工具调用、工具结果、图片或 Assistant 推理内容;上下文最多 12 KB。

本地端点模式将单声道音频转换为 16 kHz PCM WAV 后发送到回环地址的 OpenAI 兼容接口:

/v1/audio/transcriptions

本地运行程序安装到当前 DSH_HOME:

DSH_HOME

它不修改系统 Python、PATH 或全局软件包。

从 0.4.0-alpha.8 起,本地 ASR 支持 Apple Silicon Mac 和 Windows x64;macOS Intel、Windows ARM64 和 Linux 继续使用 Web Speech。

macOS 随包运行程序采用 ad-hoc 签名,尚未使用 Apple Developer ID 公证;Windows .exe 明确未签名并显示命令行窗口。

插件辅助模型调用不写入 DSH Session 日志。

适用场景与注意

dsh-dictate 适合在 DSH Composer 中用语音输入长句、命令、提示词或代码说明,并且希望先编辑再发送的场景。它不适合需要朗读模型回复、双向语音会话或实时语音对话的场景。

使用浏览器识别时,需要 Chrome 或 Edge 的 Web Speech API;使用本地识别时,需要浏览器麦克风与 Web Audio 能力。首次使用两种模式都需要授予麦克风权限。

资料未明确许可证类型,只出现 LICENSE 文件和 THIRD_PARTY_NOTICES.md。安装前应按本机安全策略和许可要求检查来源。

结尾

dsh-dictate 的价值在于把听写放进 Composer,同时保留用户编辑和发送控制权。已确认的 GitHub 地址是:

https://github.com/franksong2702/dsh-dictate

所给资料未提供可确认的目录页 URL。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜