dsh-chatvoice:给 dsh web 增加语音输入与回复朗读

前言

在 DSH 的 web 界面里与模型对话时,长提示词通常要逐字输入,长回复则要继续看屏幕。对 DSH 使用者或智能体开发者来说,这两步都可以做得更顺手一些。

dsh-chatvoice 是一个 DSH 插件,把浏览器的原生语音能力接入 dsh web:输入时可以用麦克风说话,回复时可以一键朗读。下面介绍它的定位、安装方式、典型用法和需要注意的限制。

这是什么

dsh-chatvoice 由 FuzzySoul 维护,许可证为 MIT。

它给 DeepSeek Harness (dsh) 增加一条「语音输入 + AI 回复朗读」闭环,基于浏览器原生 Web Speech API,零配置、零成本、免 API key。插件自身没有网络请求、没有子进程、没有 API key。

核心能力

语音输入

在输入框工具条上点麦克风按钮后,浏览器会请求麦克风权限。

说话时,识别结果会逐句进入输入框,中间结果实时显示在上方气泡。聆听过程中可以随时打字修改错字或删除文字;语音只往输入框尾部追加,停止后不会把已删除内容回填。

回复朗读

每条助手回复旁边会有一个喇叭按钮。

点一次开始朗读,再点一次停止,也可以随时打断。

自动朗读

在设置页开启后,新回复完成后会自动朗读,同样可以随时打断。

设置页

在 dsh 设置里进入 ChatVoice,可以配置:

  • 识别语言
  • 自动朗读
  • 音色
  • 语速

保存即生效,无需重启。

中文场景下,插件默认使用 zh-CN 识别,并自动选择 Edge 内置的 Xiaoxiao Online (Natural) 免费中文自然音色。

错误提示

以下情况都会显示可读的 toast,不会静默失败:

  • 麦克风权限被拒
  • 浏览器不支持
  • 非安全上下文
  • 识别网络失败

安装与启用

安装命令:

dsh plugin --profile web add dsh-chatvoice

安装后重启 dsh web:

dsh web

打开:

http://127.0.0.1:3080

这里必须用 127.0.0.1 访问。语音识别需要安全上下文,也就是 HTTPS 或 localhost。

如果通过局域网 IP 直连,浏览器会禁用麦克风;插件会自动禁用输入功能并提示,朗读仍可用。

典型用法

1、语音输入:点输入框工具条上的麦克风按钮,允许浏览器麦克风授权,开始说话;再点一次麦克风停止,然后回车发送。识别过程中可以打字改字或删除,语音只追加,不回填。

2、朗读某条回复:点助手回复旁的喇叭按钮开始朗读;再点一次停止。

3、开启自动朗读:进入设置 -> ChatVoice,勾选「自动朗读新回复」,保存后立即生效。

适用场景与注意

适合在 DSH web 中频繁输入提示词,或希望把长回复变成朗读输出的场景。中文场景优先,资料中建议使用 Edge 试用。

使用注意:

  • Chrome 的语音识别走 Google 服务器,国内网络可能报 network 错误;资料建议换 Edge(走 Azure)。
  • Edge 在线音色需要联网;离线时回退到系统本地音色。
  • Firefox / Safari 不支持 SpeechRecognition,按钮自动置灰提示,朗读仍可用。
  • 语音识别准确性取决于浏览器与系统麦克风,与插件本身无关。
  • 插件配置持久化到:
~/.dsh/chatvoice.json

该插件以当前 dsh 进程权限运行,并用于 dsh web 客户端;安装前建议检查源码,并确认其 MIT 许可证。

链接

  • 目录页:https://www.skillhub.cn/plugins/FuzzySoul/dsh-chatvoice
  • GitHub:https://github.com/FuzzySoul/dsh-chatvoice
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜