dsh-voice:DeepSeek Harness 的语音输入与朗读插件

前言

DSH 的插件机制可以扩展客户端能力,但 DeepSeek 的聊天接口目前只处理文本:模型不直接接收音频,也不直接输出音频。dsh-voice 是一个面向 DSH Web 客户端的语音插件,由 zhuiyueya 维护,许可证为 MIT。它在输入边界把语音转成文字,在输出边界把文字读出来,并提供音频文件转写与合成工具。下面介绍它的功能、安装方式和典型用法。

功能

  • Web UI 的 composer 提供麦克风按钮,用于将语音转文字并写入输入框。
  • Web UI 的每条助手回复提供朗读按钮,通过 speechSynthesis 朗读回复。
  • 提供 voice_transcribe 工具,通过 Whisper 兼容的 /audio/transcriptions 端点转写附件音频文件。
  • 提供 voice_speak 工具,通过 OpenAI 兼容的 /audio/speech 端点将文本合成为音频文件。
  • README 标注 Web UI 零 API key、零新模型,DeepSeek 保持文本模型。
  • 支持配置 Whisper、Kokoro 等本地或兼容后端。

安装与启用

本地路径安装:

dsh plugin --profile web add "file:/path/to/dsh-voice"

README 给出 npm 发布后的安装方式:

dsh plugin --profile web add dsh-voice

资料未确认该 npm 包已发布,建议先使用本地路径安装。安装后重启 dsh web,或等待 HMR。启用后,composer 会出现麦克风按钮,每条助手回复会出现朗读按钮。

典型用法

麦克风按钮需要配置后端地址:

voice.stt.apiBase

将其指向一个 Whisper 兼容后端。浏览器侧完成语音输入后,将文字写入输入框。

朗读按钮无需额外配置,使用浏览器 speechSynthesis 能力。

工具调用方面:

  • voice_transcribe:参数 path(音频文件)、language?,返回 { text, language }
  • voice_speak:参数 textoutPath?voice?,返回 { path, bytes }

适用场景与注意

适合需要 Web 端语音输入、朗读助手回复,或需要 DSH 智能体处理附件音频并生成音频文件的场景。插件以当前 dsh 进程权限运行,安装前应检查源码、依赖和许可证。麦克风按钮依赖 Whisper 兼容后端,后端地址、可用性和网络情况需要自行确认;朗读按钮依赖浏览器 speechSynthesis 能力。

链接

社区目录页:

https://www.skillhub.cn/plugins/zhuiyueya/dsh-voice

GitHub:

https://github.com/zhuiyueya/dsh-voice

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜