前言¶
在 DSH 的 web 界面里与模型对话时,长提示词通常要逐字输入,长回复则要继续看屏幕。对 DSH 使用者或智能体开发者来说,这两步都可以做得更顺手一些。
dsh-chatvoice 是一个 DSH 插件,把浏览器的原生语音能力接入 dsh web:输入时可以用麦克风说话,回复时可以一键朗读。下面介绍它的定位、安装方式、典型用法和需要注意的限制。
这是什么¶
dsh-chatvoice 由 FuzzySoul 维护,许可证为 MIT。
它给 DeepSeek Harness (dsh) 增加一条「语音输入 + AI 回复朗读」闭环,基于浏览器原生 Web Speech API,零配置、零成本、免 API key。插件自身没有网络请求、没有子进程、没有 API key。
核心能力¶
语音输入¶
在输入框工具条上点麦克风按钮后,浏览器会请求麦克风权限。
说话时,识别结果会逐句进入输入框,中间结果实时显示在上方气泡。聆听过程中可以随时打字修改错字或删除文字;语音只往输入框尾部追加,停止后不会把已删除内容回填。
回复朗读¶
每条助手回复旁边会有一个喇叭按钮。
点一次开始朗读,再点一次停止,也可以随时打断。
自动朗读¶
在设置页开启后,新回复完成后会自动朗读,同样可以随时打断。
设置页¶
在 dsh 设置里进入 ChatVoice,可以配置:
- 识别语言
- 自动朗读
- 音色
- 语速
保存即生效,无需重启。
中文场景下,插件默认使用 zh-CN 识别,并自动选择 Edge 内置的 Xiaoxiao Online (Natural) 免费中文自然音色。
错误提示¶
以下情况都会显示可读的 toast,不会静默失败:
- 麦克风权限被拒
- 浏览器不支持
- 非安全上下文
- 识别网络失败
安装与启用¶
安装命令:
dsh plugin --profile web add dsh-chatvoice
安装后重启 dsh web:
dsh web
打开:
http://127.0.0.1:3080
这里必须用 127.0.0.1 访问。语音识别需要安全上下文,也就是 HTTPS 或 localhost。
如果通过局域网 IP 直连,浏览器会禁用麦克风;插件会自动禁用输入功能并提示,朗读仍可用。
典型用法¶
1、语音输入:点输入框工具条上的麦克风按钮,允许浏览器麦克风授权,开始说话;再点一次麦克风停止,然后回车发送。识别过程中可以打字改字或删除,语音只追加,不回填。
2、朗读某条回复:点助手回复旁的喇叭按钮开始朗读;再点一次停止。
3、开启自动朗读:进入设置 -> ChatVoice,勾选「自动朗读新回复」,保存后立即生效。
适用场景与注意¶
适合在 DSH web 中频繁输入提示词,或希望把长回复变成朗读输出的场景。中文场景优先,资料中建议使用 Edge 试用。
使用注意:
- Chrome 的语音识别走 Google 服务器,国内网络可能报 network 错误;资料建议换 Edge(走 Azure)。
- Edge 在线音色需要联网;离线时回退到系统本地音色。
- Firefox / Safari 不支持 SpeechRecognition,按钮自动置灰提示,朗读仍可用。
- 语音识别准确性取决于浏览器与系统麦克风,与插件本身无关。
- 插件配置持久化到:
~/.dsh/chatvoice.json
该插件以当前 dsh 进程权限运行,并用于 dsh web 客户端;安装前建议检查源码,并确认其 MIT 许可证。
链接¶
- 目录页:https://www.skillhub.cn/plugins/FuzzySoul/dsh-chatvoice
- GitHub:https://github.com/FuzzySoul/dsh-chatvoice