前言¶
在 DSH 插件扩展方式下,dsh web 的助手答复通常以文本呈现。长答复或需要频繁查看结果时,阅读成本会比较高。dsh-tts 是一个 dsh web 语音播报插件:它把每个助手答复的最终结果用 Edge TTS 微软神经语音朗读出来。它由 vim0x3c 维护,许可证为 MIT,资料给出的当前版本为 0.1.0。
插件定位¶
dsh-tts 的定位是 dsh web 的语音播报插件,面向希望听到助手最终答复、减少纯文本阅读的场景。它不替代聊天界面,也不提供语音输入。
核心功能¶
- 将每个助手答复的最终结果用 Edge TTS 微软神经语音朗读。
- 只读最终结果,不读中间步骤与工具调用说明;连续多回合只读最新一条。
- 长回复自动按句子分段串行朗读。
- 内置 20+ 个 Edge 神经音色,默认
zh-CN-XiaoxiaoNeural,支持0.5×–2×语速调节。 - 输入框工具排提供喇叭按钮,用于快速开/关“自动朗读新回复”,关闭时中断当前朗读。
- 支持审批提示朗读,可单独关闭,并可用预设“叮/哔哔/咚”或上传
mp3/wav/ogg(≤1MB)自定义审批提示音。 - 自动朗读失败时降级到浏览器本地
speechSynthesis/ Web Speech API。 - 宿主端提供仅绑定
127.0.0.1的本地桥服务,探测端口8765–8780,含/health与/synthesize。 - 插件本体不含第三方 npm 依赖,离线也能安装。
- 浏览器端设置持久化在
localStorage的dsh-tts.settings。
安装与启用¶
前置要求:dsh 的应用闭包需包含插件的 @deepseek-ai/dsh-* peer 包;任何带 @deepseek-ai/dsh-web-app bundle 的部署满足。
资料称最常用方式是本地构建 tarball 后安装;安装到 web profile 必须使用 -w 标志。在得到 dsh-tts-0.1.0.tgz 后执行:
dsh plugin --profile web add -w ./dsh-tts-0.1.0.tgz
安装后可用下面两条命令验证:第一条检查配置中是否出现 dsh-tts,第二条检查宿主桥的 /health 接口。
dsh --profile web --dump-config | grep dsh-tts
curl http://127.0.0.1:8765/health
资料中另有 git URL 安装方式,但标注不推荐:取到的是源码而非构建好的 lib/,且插件的 peer 包未发布到 npm,通常无法构建或解析。
典型用法¶
1、打开 dsh web 的“设置 → 语音播报”。
2、打开“自动朗读新回复”,先点“试听音色”确认能连通 Edge。
3、之后每次助手给出最终答复时自动朗读。
补充操作:
- 用输入框工具排的喇叭按钮开/关“自动朗读新回复”;关闭时立即中断当前朗读。
- 审批提示朗读可独立开关,并可设置预设或上传的审批提示音。
- 若浏览器自动播放被拦截,先在设置里点一次“试听音色”。
适用场景与注意¶
- 适合希望在 dsh web 中听到助手最终结果、处理长答复或审批提醒的场景。
- Edge 云合成需要网络,宿主须能访问
speech.platform.bing.com;失败时降级到浏览器本地 Web Speech API。 - 只读当前会话,后台会话的答复不会朗读。
- 进程内桥随
dsh web宿主生命周期启停。 - CORS 仅反射白名单内的 dsh web 源,未知网页 Origin 返回 403。
- 语音输入(话筒/STT)未包含。
dsh-tts以当前 dsh 进程权限运行,并会在宿主侧启动本地桥服务;安装前建议检查源码、许可证和运行环境。
小结¶
dsh-tts 为 dsh web 增加了一个较窄但具体的能力:把助手最终结果用 Edge TTS 读出来,同时保留审批提示、手动开关和 Web Speech 降级。
- GitHub:https://github.com/Vim0x3c/dsh-tts
- 目录页:已核实资料未提供 URL