前言¶
在 DSH 中写长提示词、整理命令或补全代码说明时,键盘输入有时不够直接。dsh-dictate 把语音输入作为 Composer 的一种输入方式:先录音,再转写,最后把文字停在 Composer 里,由用户继续审阅、修改和发送。
它不是实时语音对话插件:不会朗读模型回复,也不会启动双向语音会话。下面介绍它的定位、能力、安装方式和需要注意的运行边界。
这是什么¶
dsh-dictate 是面向 DeepSeek Harness(DSH)Composer 的上下文感知语音输入插件,GitHub owner 为 franksong2702。
它默认使用浏览器 Web Speech 识别,安装后即可使用;在受支持平台上,也可以选择本地 SenseVoice 增强转写。停止录音后,转写结果会留在 Composer 中;如果启用模型润色,它会参考当前 Session 中可见的用户/Assistant 文本整理用词和标点;发送动作始终由用户控制。
核心能力¶
默认浏览器识别¶
- 麦克风入口位于 DSH Composer 工具栏,录音和状态显示在 Composer 上方。
- Web Speech 模式下,录音时显示实时转写,最终文字写入 Composer。
- 需要 Chrome 或 Edge 的 Web Speech API。
- 首次使用需要授予麦克风权限。
- Web Speech API 的音频由浏览器语音服务处理,不经过 DSH 服务端。
可选本地 SenseVoice¶
- 本地 SenseVoice 是实验性增强转写,适用于 Apple Silicon Mac 和 Windows x64。
- 可以从插件设置页安装、启动、停止、检查状态。
- 可以显式开启“随 DSH 自动启动”;该选项默认关闭。
- 首次安装需下载约 253 MB 的 SenseVoice Q8 模型。
- 运行程序随插件包提供,并经过 SHA-256 校验。
- 本地识别是停止录音后的最终转写,提供 VAD 语音确认和约 600 ms 尾音保护,不提供实时临时文字。
上下文增强¶
- 上下文词汇提取基于当前 Session 和 Composer;模型不可用时使用规则词汇。
- 选择普通话、粤语或繁体中文时,可以启用“优化中英混合识别”。
- 可选模型润色使用当前 DSH 可用模型,参考最近 6 条可见用户/Assistant 文本整理用词和标点。
- 模型润色失败时保留原始转写。
发送控制¶
- 模型润色和自动发送默认关闭。
- 自动发送仅在用户主动结束录音时提交。
- 浏览器自行结束识别时不会自动发送。
- 本地识别不可用时不会静默回退,需要用户明确选择本次改用浏览器识别。
- 已录制音频转写失败不会发送到其他服务。
安装与启用¶
先安装到 Web profile:
dsh plugin --profile web add dsh-dictate@latest
安装完成后,重启对应的 DSH Web 进程:
dsh web
当前 package.json 版本为:
0.4.0-alpha.9
快速安装说明给出的兼容范围为:
DSH >=0.1.2-alpha.3 <0.2.0
配置入口如下:
设置 → 插件 → 插件配置 → 上下文语音输入
浏览器语音识别保持默认即可,不需要安装本地模型。本地 SenseVoice 在受支持平台上从插件设置页安装和启动。
DSH Web 首次启动会打印一条带认证 token 的本机 URL。访问时应使用启动输出中的完整 URL;不要复制或分享其中的 token。
dsh-dictate 作为 DSH 插件加载运行,会按当前 dsh 进程权限访问本地文件、回环接口和系统资源;安装前应检查源码、LICENSE 与 THIRD_PARTY_NOTICES.md 等文件。
典型用法¶
1、单击 Composer 工具栏中的麦克风开始录音;再次单击麦克风或同一个右侧修饰键结束录音。
2、macOS 在 Composer 聚焦时单击右 Command,Windows/Linux 单击右 Control;按一次开始,再按一次结束。
3、启用“按住鼠标录音”后,在 Composer 内按住鼠标 500 ms 开始录音,松开结束并将最终结果写入输入框。
4、本地 SenseVoice 模式检测到持续语音后显示“已检测到语音”;停止后由 SenseVoice 返回最终文字。
5、启用模型润色后,插件会等待所选模型润色完成再填入 Composer;润色失败时保留原始转写。
6、启用自动发送后,只有用户主动结束录音才自动提交;浏览器自行结束识别时不会自动发送。
数据范围与运行环境¶
模型润色会发送原始转写和当前 Session 最近 6 条可见用户/Assistant 文本给所选模型提供商。它不读取系统提示词、工具调用、工具结果、图片或 Assistant 推理内容;上下文最多 12 KB。
本地端点模式将单声道音频转换为 16 kHz PCM WAV 后发送到回环地址的 OpenAI 兼容接口:
/v1/audio/transcriptions
本地运行程序安装到当前 DSH_HOME:
DSH_HOME
它不修改系统 Python、PATH 或全局软件包。
从 0.4.0-alpha.8 起,本地 ASR 支持 Apple Silicon Mac 和 Windows x64;macOS Intel、Windows ARM64 和 Linux 继续使用 Web Speech。
macOS 随包运行程序采用 ad-hoc 签名,尚未使用 Apple Developer ID 公证;Windows .exe 明确未签名并显示命令行窗口。
插件辅助模型调用不写入 DSH Session 日志。
适用场景与注意¶
dsh-dictate 适合在 DSH Composer 中用语音输入长句、命令、提示词或代码说明,并且希望先编辑再发送的场景。它不适合需要朗读模型回复、双向语音会话或实时语音对话的场景。
使用浏览器识别时,需要 Chrome 或 Edge 的 Web Speech API;使用本地识别时,需要浏览器麦克风与 Web Audio 能力。首次使用两种模式都需要授予麦克风权限。
资料未明确许可证类型,只出现 LICENSE 文件和 THIRD_PARTY_NOTICES.md。安装前应按本机安全策略和许可要求检查来源。
结尾¶
dsh-dictate 的价值在于把听写放进 Composer,同时保留用户编辑和发送控制权。已确认的 GitHub 地址是:
https://github.com/franksong2702/dsh-dictate
所给资料未提供可确认的目录页 URL。