前言¶
DSH 的插件机制可以扩展客户端能力,但 DeepSeek 的聊天接口目前只处理文本:模型不直接接收音频,也不直接输出音频。dsh-voice 是一个面向 DSH Web 客户端的语音插件,由 zhuiyueya 维护,许可证为 MIT。它在输入边界把语音转成文字,在输出边界把文字读出来,并提供音频文件转写与合成工具。下面介绍它的功能、安装方式和典型用法。
功能¶
- Web UI 的 composer 提供麦克风按钮,用于将语音转文字并写入输入框。
- Web UI 的每条助手回复提供朗读按钮,通过
speechSynthesis朗读回复。 - 提供
voice_transcribe工具,通过 Whisper 兼容的/audio/transcriptions端点转写附件音频文件。 - 提供
voice_speak工具,通过 OpenAI 兼容的/audio/speech端点将文本合成为音频文件。 - README 标注 Web UI 零 API key、零新模型,DeepSeek 保持文本模型。
- 支持配置 Whisper、Kokoro 等本地或兼容后端。
安装与启用¶
本地路径安装:
dsh plugin --profile web add "file:/path/to/dsh-voice"
README 给出 npm 发布后的安装方式:
dsh plugin --profile web add dsh-voice
资料未确认该 npm 包已发布,建议先使用本地路径安装。安装后重启 dsh web,或等待 HMR。启用后,composer 会出现麦克风按钮,每条助手回复会出现朗读按钮。
典型用法¶
麦克风按钮需要配置后端地址:
voice.stt.apiBase
将其指向一个 Whisper 兼容后端。浏览器侧完成语音输入后,将文字写入输入框。
朗读按钮无需额外配置,使用浏览器 speechSynthesis 能力。
工具调用方面:
voice_transcribe:参数path(音频文件)、language?,返回{ text, language }。voice_speak:参数text、outPath?、voice?,返回{ path, bytes }。
适用场景与注意¶
适合需要 Web 端语音输入、朗读助手回复,或需要 DSH 智能体处理附件音频并生成音频文件的场景。插件以当前 dsh 进程权限运行,安装前应检查源码、依赖和许可证。麦克风按钮依赖 Whisper 兼容后端,后端地址、可用性和网络情况需要自行确认;朗读按钮依赖浏览器 speechSynthesis 能力。
链接¶
社区目录页:
https://www.skillhub.cn/plugins/zhuiyueya/dsh-voice
GitHub:
https://github.com/zhuiyueya/dsh-voice