前言¶
在 DeepSeek Harness(DSH)里跑智能体时,助手回复往往很长。盯着屏幕逐段阅读,或切到别的窗口再回来,都容易漏掉关键信息。浏览器自带的朗读能力分散在各处,也无法按消息粒度控制,更谈不上和 DSH 的会话流、审批事件联动。
下面介绍的 dsh-plugin-tts 是面向 DSH web 配置文件的客户端插件:把 Microsoft Edge 的免费在线 TTS 接到会话界面,每条助手消息可点读、可自动朗读,并在设置面板里调音色与语速。需要自定义声线时,还可接入本地 RVC 模型。Edge TTS 路径无需 API Key;RVC 路径在本地推理,不上传云端。
这是什么¶
dsh-plugin-tts(GitHub:1624318455/dsh-plugin-tts)由维护者 1624318455 发布,在 SkillHub 社区目录中归类为客户端插件。当前版本 0.3.0,许可证 MIT,GitHub 星标 10。
插件采用 Host + Web UI 双侧架构:Host 侧注册 TTS 与 RVC 相关路由并运行 worker;Client 侧在 DSH Web 界面注入朗读按钮、自动朗读开关和语音设置面板。一句话定位:在 DSH Web 里把助手回复读出来,并可选 RVC 自定义声线。
核心功能¶
以下能力均来自插件 README 与 package.json,按使用频率归纳。
消息朗读与自动朗读¶
- 朗读按钮:每条已完成的助手消息,在复制 / 反馈 / 分支操作行旁有朗读按钮;点击开始朗读(按钮显示动态均衡器动画),再点停止。
- 自动朗读开关:位于输入区工具行(命令按钮与访问模式按钮之间)。开启后,每条新完成的助手回复会自动朗读(开关带圆形高亮);关闭后不再自动读,但不打断正在进行的手动朗读。
- 朗读选中文字:在消息内选中文字,会出现浮动「朗读选中」芯片,点击只读选中部分。
语音设置¶
路径:设置 → 插件 → 语音。
- TTS 提供商:Edge TTS(免费、无需 API Key)或自定义 RVC 声线。
- 音色:22 个经 live 校验的 Edge TTS 音色,默认 晓萱(
zh-CN-XiaoxuanNeural)。覆盖简体中文、台港澳、英语及部分其他语言;部分旧音色已被 Edge 端点移除(1007 Unsupported voice),插件会自动从列表剔除并回退默认音色。 - 音效调节:语速 / 音调 / 音量(0 为默认)。
- 试听:输入文字点播放按钮;合成或播放中显示加载动画,失败时在行内提示。
- Voice packs:可从 registry 一键安装声线包(RVC 路径,见项目文档)。
长文与播放控制¶
- 无缝分块播放:长回复采用自适应分块、边合成边播放,块与块之间 Web Audio 精确拼接,无间隙(设计说明见仓库
docs/adaptive-chunked-playback.md)。纯 Edge TTS 长文同样走该流水线,不必等全文合成完毕。 - 迷你播放器:朗读时在消息操作行显示暂停 / 继续,以及 1x / 1.25x / 1.5x 倍速;分块长读会显示
chunk x/y计数。 - 下载音频:每条消息可下载合成结果为 MP3,复用会话内缓存,刚朗读过的内容可即时下载。
RVC 自定义声线(可选)¶
除 Edge TTS 外,插件支持用本地训练的 RVC 模型朗读(本地推理,需自行准备 RVC 环境)。仓库提供 portable RVC runtime,可不安装完整 RVC WebUI;也可配合 rvc-server.py 使用。详细步骤见 RVC Custom Voice Guide 与 User Guide。
审批语音提醒(可选,默认关闭)¶
开启后,Agent 审批事件会用 Edge TTS 播报(独立于 RVC 服务、使用专用提醒音色):收到 approval/asked 时会打断当前朗读;approval/decided 仅在空闲时播报。同一 approval id 去重。
安装与启用¶
环境要求(来自 README):
- DeepSeek Harness
web配置文件(dsh web) - Node.js >= 22(worker 使用原生
WebSocket) - 仅在使用 RVC 自定义声线 时:本地 RVC 推理环境(RVC WebUI 或 portable runtime)及运行中的
rvc-server.py
官方安装命令如下。安装前请自行查看仓库源码与 MIT 许可证;插件以当前 dsh 进程权限运行。
dsh plugin --profile web add "github:1624318455/dsh-plugin-tts#main"
本地开发时可指向目录:
dsh plugin --profile web add "file:/path/to/dsh-plugin-tts"
安装后重启 dsh web,插件作为 profile bundle 自动加载。
典型用法¶
1. 安装并打开 Web 界面¶
按上一节命令安装插件,重启 dsh web,在浏览器打开 DSH Web 会话页。
2. 点读单条回复¶
在任意已完成的助手消息上,点击操作行中的朗读按钮。朗读过程中按钮显示均衡器动画;再次点击停止。若该条正在自动朗读,点同一按钮也会停止。
3. 开启自动朗读¶
在输入区工具行找到自动朗读开关并打开。之后每条新完成的助手回复会自动开始朗读;新消息完成时会打断当前朗读。切换会话仅停止自动朗读,不影响其他行为逻辑(见 README「Edge cases handled」)。
4. 配置音色与试听¶
进入 设置 → 插件 → 语音:
- 选择 Edge TTS 作为提供商(无需 API Key)。
- 在音色列表中选择目标声音(例如默认晓萱,或云希、云扬等简体中文音色)。
- 按需调整语速、音调、音量。
- 在试听框输入文字,点播放按钮确认效果。
5. 朗读选中片段¶
在消息正文中拖选一段文字,点击出现的「朗读选中」芯片,仅朗读选中内容。
6. 下载 MP3¶
消息朗读后(或合成缓存仍有效时),使用消息操作行的下载按钮,将音频保存为 MP3。
7. 使用 RVC 声线(进阶)¶
若需自定义声线,按仓库 User Guide 与 RVC Guide 启动本地 RVC 服务;在语音设置中将提供商切换为 RVC,并按文档上传模型或从 voice-pack registry 一键安装。macOS 用户参见 User Guide §4.2 与 RVC Guide「启动本地 RVC 服务」。
适用场景与注意¶
适合谁
- 长时间使用 DSH Web 对话、希望解放双眼或边做别的事边听回复的开发者。
- 需要中文及多语种 Edge TTS、且不想申请第三方 TTS API Key 的用户。
- 已有 RVC 模型、希望在 DSH 里用同一声线朗读助手回复的用户。
使用前请注意
- 插件仅适用于
dsh web配置文件,不是 CLI 或其它 profile 的通用扩展。 - Edge TTS 依赖 Microsoft 在线端点;网络或端点变更可能导致个别音色不可用,插件会 prune 失效音色并回退默认。
- RVC 路径需要本地 GPU/CPU 资源及额外服务进程,配置成本高于纯 Edge TTS。
- 插件以安装它的
dsh进程权限运行,安装前请阅读源码与 MIT 许可证,确认可接受其 Host 路由(如/dsh-tts-api/speak、/dsh-tts-audio/<id>等)与 worker 行为。 - SkillHub(https://www.skillhub.cn/plugins/1624318455/dsh-plugin-tts)为社区目录站点,与 DeepSeek / 幻方无官方从属关系;DSH 生态理念是「一切皆插件」,本插件是社区维护的独立扩展。
结尾¶
dsh-plugin-tts 把 Edge TTS 与可选 RVC 声线集成进 DSH Web:消息级朗读、自动朗读、设置面板与长文无缝分块,均无需 Edge TTS 的 API Key。若你已在用 dsh web,可按官方命令安装并在 设置 → 插件 → 语音 里完成首次配置。
- 社区目录:https://www.skillhub.cn/plugins/1624318455/dsh-plugin-tts
- GitHub:https://github.com/1624318455/dsh-plugin-tts
- 中文 README:https://github.com/1624318455/dsh-plugin-tts/blob/main/README.zh.md
- 用户执行手册:https://github.com/1624318455/dsh-plugin-tts/blob/main/docs/USER-GUIDE.md