前言¶
在 DSH 的 web 界面裏與模型對話時,長提示詞通常要逐字輸入,長回覆則要繼續看屏幕。對 DSH 使用者或智能體開發者來說,這兩步都可以做得更順手一些。
dsh-chatvoice 是一個 DSH 插件,把瀏覽器的原生語音能力接入 dsh web:輸入時可以用麥克風說話,回覆時可以一鍵朗讀。下面介紹它的定位、安裝方式、典型用法和需要注意的限制。
這是什麼¶
dsh-chatvoice 由 FuzzySoul 維護,許可證爲 MIT。
它給 DeepSeek Harness (dsh) 增加一條「語音輸入 + AI 回覆朗讀」閉環,基於瀏覽器原生 Web Speech API,零配置、零成本、免 API key。插件自身沒有網絡請求、沒有子進程、沒有 API key。
核心能力¶
語音輸入¶
在輸入框工具條上點麥克風按鈕後,瀏覽器會請求麥克風權限。
說話時,識別結果會逐句進入輸入框,中間結果即時顯示在上方氣泡。聆聽過程中可以隨時打字修改錯字或刪除文字;語音只往輸入框尾部追加,停止後不會把已刪除內容回填。
回覆朗讀¶
每條助手回覆旁邊會有一個喇叭按鈕。
點一次開始朗讀,再點一次停止,也可以隨時打斷。
自動朗讀¶
在設置頁開啓後,新回覆完成後會自動朗讀,同樣可以隨時打斷。
設置頁¶
在 dsh 設置裏進入 ChatVoice,可以配置:
- 識別語言
- 自動朗讀
- 音色
- 語速
保存即生效,無需重啓。
中文場景下,插件默認使用 zh-CN 識別,並自動選擇 Edge 內置的 Xiaoxiao Online (Natural) 免費中文自然音色。
錯誤提示¶
以下情況都會顯示可讀的 toast,不會靜默失敗:
- 麥克風權限被拒
- 瀏覽器不支持
- 非安全上下文
- 識別網絡失敗
安裝與啓用¶
安裝命令:
dsh plugin --profile web add dsh-chatvoice
安裝後重啓 dsh web:
dsh web
打開:
http://127.0.0.1:3080
這裏必須用 127.0.0.1 訪問。語音識別需要安全上下文,也就是 HTTPS 或 localhost。
如果通過局域網 IP 直連,瀏覽器會禁用麥克風;插件會自動禁用輸入功能並提示,朗讀仍可用。
典型用法¶
1、語音輸入:點輸入框工具條上的麥克風按鈕,允許瀏覽器麥克風授權,開始說話;再點一次麥克風停止,然後回車發送。識別過程中可以打字改字或刪除,語音只追加,不回填。
2、朗讀某條回覆:點助手回覆旁的喇叭按鈕開始朗讀;再點一次停止。
3、開啓自動朗讀:進入設置 -> ChatVoice,勾選「自動朗讀新回覆」,保存後立即生效。
適用場景與注意¶
適合在 DSH web 中頻繁輸入提示詞,或希望把長回覆變成朗讀輸出的場景。中文場景優先,資料中建議使用 Edge 試用。
使用注意:
- Chrome 的語音識別走 Google 服務器,國內網絡可能報 network 錯誤;資料建議換 Edge(走 Azure)。
- Edge 在線音色需要聯網;離線時回退到系統本地音色。
- Firefox / Safari 不支持 SpeechRecognition,按鈕自動置灰提示,朗讀仍可用。
- 語音識別準確性取決於瀏覽器與系統麥克風,與插件本身無關。
- 插件配置持久化到:
~/.dsh/chatvoice.json
該插件以當前 dsh 進程權限運行,並用於 dsh web 客戶端;安裝前建議檢查源碼,並確認其 MIT 許可證。
鏈接¶
- 目錄頁:https://www.skillhub.cn/plugins/FuzzySoul/dsh-chatvoice
- GitHub:https://github.com/FuzzySoul/dsh-chatvoice