dsh-voice-input:DeepSeek Harness 的語音聽寫與轉錄清理插件

前言

在 DeepSeek Harness 裏,往 composer 輸入的內容常常是口語化的:補充上下文、描述需求、交代約束。這類內容說出來比打字快,但聽寫拿到的是原始轉錄——有口頭語、有重複、有說到一半再改口的自我更正,貼進輸入框之前還得手動整理一遍。

dsh-voice-input 的思路是把兩步分開:聽寫交給瀏覽器識別或系統聽寫,清理交給當前 Session 已經選定的模型,不需要另外配置 API key。下面介紹這個插件的定位、安裝方法和日常用法。

這是什麼

dsh-voice-input 是由 lhenlihai-hub 維護的開源插件,許可證爲 MIT。它爲 DeepSeek Harness 提供語音聽寫與轉錄清理,使用當前 Session 選定的模型:先聽寫,再用這個模型做一次清理,最後把結果插入輸入框。

幾個邊界值得先說清楚:

  • 它不翻譯、不回答所聽寫的內容,只處理轉錄文本本身;
  • 它沒有 API-key 設置,模型路由與憑證完全由 Harness 管理;
  • 當前版本 0.3.1,針對 DeepSeek Harness 0.1.0-rc.6 的 Host、Client Modules、Slot 與 Typert 接口構建。

核心功能

  • 在官方 conversation.input.left Slot 中添加麥克風與設置控件;
  • 在可用時使用 SpeechRecognition / webkitSpeechRecognition
  • 瀏覽器識別不可用時回退到系統聽寫:macOS 爲 Fn×2,Windows 爲 Win+H
  • 默認快捷鍵 Ctrl+Alt+V,支持自定義組合鍵或 F1F24
  • 支持自動語言檢測,以及普通話、繁體中文、粵語、英語、日語、韓語識別模式;
  • 每次清理調用前即時讀取當前 Session 選定的模型,使用 Harness 的路由與憑證;
  • 清理失敗時保留原始識別文本,並避免覆蓋清理期間的編輯;
  • 根據瀏覽器語言自動提供中文或英文界面;
  • 提供當前 profile 內確認後的一鍵卸載。

有一處限制需要提前知道:瀏覽器插件無法註冊系統級全局快捷鍵,自定義快捷鍵只在 Harness 頁面獲得焦點時生效。

安裝與啓用

使用官方安裝命令,把 <profile> 替換爲你實際使用的 profile:

dsh plugin --profile <profile> add github:lhenlihai-hub/dsh-voice-input

插件按 profile 安裝,卸載也在同一 profile 內進行。若要從源碼構建或參與開發,要求 Node.js 22 或更新版本。

日常用法

以默認配置爲例:

1、點擊麥克風或按 Ctrl+Alt+V 開始,說完後再點擊或按一次快捷鍵停止;
2、當前 Session 模型清理轉錄文本,插件將其插入輸入框;
3、點擊旁邊的設置按鈕,可修改快捷鍵或識別語言。

當瀏覽器識別不可用時,插件回退到系統聽寫:輸入框自動獲得焦點,啓動系統聽寫快捷鍵(macOS 爲 Fn×2,Windows 爲 Win+H)後直接說話,草稿約 1.2 秒無變化後開始清理。

清理效果可以看這個例子:

輸入:我們現在對軟件進行重新的review
輸出:我們現在對軟件進行重新的review。

清理步驟在句末補上了標點;按它遵循的公開聽寫產品原則,口頭語、重複和顯式自我更正會被去除。

隱私與模型調用

  • 音頻由瀏覽器識別實現或系統聽寫處理,不經 Harness 模型;只有識別出的文本會發送給當前 Session 模型做清理;
  • 瀏覽器識別是否將音頻發送給其供應商,取決於該瀏覽器的實現與隱私政策;
  • 插件設置僅存儲在瀏覽器 localStorage 中。

卸載

插件提供當前 profile 內確認後的一鍵卸載。同時要留意卸載的邊界:卸載按鈕不會刪除你單獨克隆的源碼目錄,也不會清除 pnpm 的共享內容尋址緩存。

適用場景與注意事項

適合兩類讀者:一是經常在 Harness composer 裏口述輸入、想省掉手動整理轉錄的開發者;二是想在 DeepSeek Harness 0.1.0-rc.6 的 Slot 與 Typert 接口上寫插件的作者,可以參考它對接官方接口的方式。

安裝任何插件前都建議先做兩件事:檢查源碼、確認許可證。插件以當前 dsh 進程的權限運行;dsh-voice-input 採用 MIT 許可證,源碼公開在 GitHub 上。

其他注意事項:

  • 自定義快捷鍵僅在 Harness 頁面獲得焦點時生效;
  • 插件設置僅存儲在瀏覽器 localStorage,換瀏覽器或設備需要重新配置;
  • 若在意音頻是否發送給瀏覽器供應商,可改用系統聽寫回退。

小結

dsh-voice-input 把聽寫和整理拆成兩步:前者交給瀏覽器或系統,後者交給當前 Session 的模型,全程不引入額外憑證。如果你的輸入大量依賴口述,可以在自己的 profile 裏裝上試一試。

  • 社區插件目錄頁:https://www.skillhub.cn/plugins/lhenlihai-hub/dsh-voice-input
  • GitHub 倉庫:https://github.com/lhenlihai-hub/dsh-voice-input

(社區插件目錄爲獨立站點,與 DeepSeek、幻方無官方從屬關係。)

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜