前言¶
DSH 的 Web 界面通常以文本輸入爲主。當需要用語音補充指令、自然語言或快速記錄內容時,鍵盤輸入不一定最合適。dsh-ears 是 DeepSeek Harness 的開源語音輸入插件,把語音識別、轉寫和可選潤色接入 DSH Web UI。它不會替用戶自動發送消息,而是把語音轉成可編輯草稿。
這是什麼¶
先說明對象。dsh-ears 是面向 DSH Web 的語音輸入插件,倉庫位於:
WizisCool/dsh-ears
許可證爲 MIT。package.json 中記錄的版本爲:
0.2.1
它主要處理三件事:選擇語音識別後端、把轉寫結果寫入草稿、在需要時用潤色模型優化轉寫文本。
核心功能¶
識別後端¶
下面介紹它支持的識別後端:
Web Speech
本地 Whisper
Groq
Deepgram
阿里雲百鍊
騰訊雲
小米 MiMo
硅基流動
自定義 OpenAI 兼容識別後端
本地 Whisper 後端需要在設置頁下載 GGML 模型。部分雲後端的額外要求如下:
阿里雲百鍊: 單次最長 300 秒
騰訊雲: AppID、SecretID、SecretKey、engine_type
小米 MiMo: Token Plan 需選擇區域集羣
潤色與草稿¶
潤色默認開啓。模型可以使用 dsh 默認 Agent 模型,也可以從 dsh 已配置模型中選擇;提示詞可以自定義。
轉寫結果始終寫入可編輯草稿,不會自動發送。開啓潤色後,原始轉寫會先寫入草稿,潤色完成後再更新。
安裝與更新¶
前置依賴¶
安裝前先確認版本範圍:
DeepSeek Harness: 0.1.0-rc.6 至 0.1.1-rc.2
Node.js: ^22.19.0 || >=24.0.0
安裝¶
先添加插件:
dsh plugin --profile web add dsh-ears
更新¶
更新時使用同一條 add 命令:
dsh plugin --profile web add dsh-ears
然後重啓 dsh web 並刷新 Web UI,以加載新的 Host 代碼。
卸載¶
dsh plugin --profile web remove dsh-ears
典型用法¶
經過上面的安裝,使用流程如下:
1、點擊麥克風圖標,或按下:
Ctrl+Shift+Space
開始說話。
2、再次按下同一快捷鍵,或點擊麥克風圖標,停止錄音並開始轉寫。
3、如果選擇本地 Whisper 後端,先在設置頁下載 GGML 模型。
4、開啓潤色後,原始轉寫先寫入草稿,潤色完成後再更新。
5、檢查草稿內容後,手動發送。
適用場景與注意¶
適合的場景:
- 已在 DSH Web 環境中使用 DeepSeek Harness,並希望用語音輸入指令或補充上下文。
- 希望轉寫結果先進入草稿,再人工檢查後發送。
- 需要選擇 Web Speech、本地 Whisper、雲端識別後端或自定義 OpenAI 兼容後端。
需要注意:
- 插件會以當前 dsh 進程權限運行;安裝前建議檢查源碼、依賴和 MIT 許可證。
- 所有 API key 和憑據由 Host 保存,瀏覽器不接觸。
- 版本兼容範圍爲:
DeepSeek Harness: 0.1.0-rc.6 至 0.1.1-rc.2
Node.js: ^22.19.0 || >=24.0.0
- 轉寫結果不會自動發送,最終仍需要人工確認。
結尾¶
dsh-ears 把語音輸入做成 DSH Web 插件:先選擇識別後端,再把轉寫結果放進草稿,最後由用戶手動發送。
倉庫地址:
https://github.com/WizisCool/dsh-ears