dsh-chatvoice:給 dsh web 增加語音輸入與回覆朗讀

前言

在 DSH 的 web 界面裏與模型對話時,長提示詞通常要逐字輸入,長回覆則要繼續看屏幕。對 DSH 使用者或智能體開發者來說,這兩步都可以做得更順手一些。

dsh-chatvoice 是一個 DSH 插件,把瀏覽器的原生語音能力接入 dsh web:輸入時可以用麥克風說話,回覆時可以一鍵朗讀。下面介紹它的定位、安裝方式、典型用法和需要注意的限制。

這是什麼

dsh-chatvoice 由 FuzzySoul 維護,許可證爲 MIT。

它給 DeepSeek Harness (dsh) 增加一條「語音輸入 + AI 回覆朗讀」閉環,基於瀏覽器原生 Web Speech API,零配置、零成本、免 API key。插件自身沒有網絡請求、沒有子進程、沒有 API key。

核心能力

語音輸入

在輸入框工具條上點麥克風按鈕後,瀏覽器會請求麥克風權限。

說話時,識別結果會逐句進入輸入框,中間結果即時顯示在上方氣泡。聆聽過程中可以隨時打字修改錯字或刪除文字;語音只往輸入框尾部追加,停止後不會把已刪除內容回填。

回覆朗讀

每條助手回覆旁邊會有一個喇叭按鈕。

點一次開始朗讀,再點一次停止,也可以隨時打斷。

自動朗讀

在設置頁開啓後,新回覆完成後會自動朗讀,同樣可以隨時打斷。

設置頁

在 dsh 設置裏進入 ChatVoice,可以配置:

  • 識別語言
  • 自動朗讀
  • 音色
  • 語速

保存即生效,無需重啓。

中文場景下,插件默認使用 zh-CN 識別,並自動選擇 Edge 內置的 Xiaoxiao Online (Natural) 免費中文自然音色。

錯誤提示

以下情況都會顯示可讀的 toast,不會靜默失敗:

  • 麥克風權限被拒
  • 瀏覽器不支持
  • 非安全上下文
  • 識別網絡失敗

安裝與啓用

安裝命令:

dsh plugin --profile web add dsh-chatvoice

安裝後重啓 dsh web:

dsh web

打開:

http://127.0.0.1:3080

這裏必須用 127.0.0.1 訪問。語音識別需要安全上下文,也就是 HTTPS 或 localhost。

如果通過局域網 IP 直連,瀏覽器會禁用麥克風;插件會自動禁用輸入功能並提示,朗讀仍可用。

典型用法

1、語音輸入:點輸入框工具條上的麥克風按鈕,允許瀏覽器麥克風授權,開始說話;再點一次麥克風停止,然後回車發送。識別過程中可以打字改字或刪除,語音只追加,不回填。

2、朗讀某條回覆:點助手回覆旁的喇叭按鈕開始朗讀;再點一次停止。

3、開啓自動朗讀:進入設置 -> ChatVoice,勾選「自動朗讀新回覆」,保存後立即生效。

適用場景與注意

適合在 DSH web 中頻繁輸入提示詞,或希望把長回覆變成朗讀輸出的場景。中文場景優先,資料中建議使用 Edge 試用。

使用注意:

  • Chrome 的語音識別走 Google 服務器,國內網絡可能報 network 錯誤;資料建議換 Edge(走 Azure)。
  • Edge 在線音色需要聯網;離線時回退到系統本地音色。
  • Firefox / Safari 不支持 SpeechRecognition,按鈕自動置灰提示,朗讀仍可用。
  • 語音識別準確性取決於瀏覽器與系統麥克風,與插件本身無關。
  • 插件配置持久化到:
~/.dsh/chatvoice.json

該插件以當前 dsh 進程權限運行,並用於 dsh web 客戶端;安裝前建議檢查源碼,並確認其 MIT 許可證。

鏈接

  • 目錄頁:https://www.skillhub.cn/plugins/FuzzySoul/dsh-chatvoice
  • GitHub:https://github.com/FuzzySoul/dsh-chatvoice
羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜