dsh-dictate:把語音輸入接入 DSH Composer

前言

在 DSH 中寫長提示詞、整理命令或補全代碼說明時,鍵盤輸入有時不夠直接。dsh-dictate 把語音輸入作爲 Composer 的一種輸入方式:先錄音,再轉寫,最後把文字停在 Composer 裏,由用戶繼續審閱、修改和發送。

它不是即時語音對話插件:不會朗讀模型回覆,也不會啓動雙向語音會話。下面介紹它的定位、能力、安裝方式和需要注意的運行邊界。

這是什麼

dsh-dictate 是面向 DeepSeek Harness(DSH)Composer 的上下文感知語音輸入插件,GitHub owner 爲 franksong2702

它默認使用瀏覽器 Web Speech 識別,安裝後即可使用;在受支持平臺上,也可以選擇本地 SenseVoice 增強轉寫。停止錄音後,轉寫結果會留在 Composer 中;如果啓用模型潤色,它會參考當前 Session 中可見的用戶/Assistant 文本整理用詞和標點;發送動作始終由用戶控制。

核心能力

默認瀏覽器識別

  • 麥克風入口位於 DSH Composer 工具欄,錄音和狀態顯示在 Composer 上方。
  • Web Speech 模式下,錄音時顯示即時轉寫,最終文字寫入 Composer。
  • 需要 Chrome 或 Edge 的 Web Speech API。
  • 首次使用需要授予麥克風權限。
  • Web Speech API 的音頻由瀏覽器語音服務處理,不經過 DSH 服務端。

可選本地 SenseVoice

  • 本地 SenseVoice 是實驗性增強轉寫,適用於 Apple Silicon Mac 和 Windows x64。
  • 可以從插件設置頁安裝、啓動、停止、檢查狀態。
  • 可以顯式開啓“隨 DSH 自動啓動”;該選項默認關閉。
  • 首次安裝需下載約 253 MB 的 SenseVoice Q8 模型。
  • 運行程序隨插件包提供,並經過 SHA-256 校驗。
  • 本地識別是停止錄音後的最終轉寫,提供 VAD 語音確認和約 600 ms 尾音保護,不提供即時臨時文字。

上下文增強

  • 上下文詞彙提取基於當前 Session 和 Composer;模型不可用時使用規則詞彙。
  • 選擇普通話、粵語或繁體中文時,可以啓用“優化中英混合識別”。
  • 可選模型潤色使用當前 DSH 可用模型,參考最近 6 條可見用戶/Assistant 文本整理用詞和標點。
  • 模型潤色失敗時保留原始轉寫。

發送控制

  • 模型潤色和自動發送默認關閉。
  • 自動發送僅在用戶主動結束錄音時提交。
  • 瀏覽器自行結束識別時不會自動發送。
  • 本地識別不可用時不會靜默回退,需要用戶明確選擇本次改用瀏覽器識別。
  • 已錄製音頻轉寫失敗不會發送到其他服務。

安裝與啓用

先安裝到 Web profile:

dsh plugin --profile web add dsh-dictate@latest

安裝完成後,重啓對應的 DSH Web 進程:

dsh web

當前 package.json 版本爲:

0.4.0-alpha.9

快速安裝說明給出的兼容範圍爲:

DSH >=0.1.2-alpha.3 <0.2.0

配置入口如下:

設置 → 插件 → 插件配置 → 上下文語音輸入

瀏覽器語音識別保持默認即可,不需要安裝本地模型。本地 SenseVoice 在受支持平臺上從插件設置頁安裝和啓動。

DSH Web 首次啓動會打印一條帶認證 token 的本機 URL。訪問時應使用啓動輸出中的完整 URL;不要複製或分享其中的 token。

dsh-dictate 作爲 DSH 插件加載運行,會按當前 dsh 進程權限訪問本地文件、迴環接口和系統資源;安裝前應檢查源碼、LICENSETHIRD_PARTY_NOTICES.md 等文件。

典型用法

1、單擊 Composer 工具欄中的麥克風開始錄音;再次單擊麥克風或同一個右側修飾鍵結束錄音。

2、macOS 在 Composer 聚焦時單擊右 Command,Windows/Linux 單擊右 Control;按一次開始,再按一次結束。

3、啓用“按住鼠標錄音”後,在 Composer 內按住鼠標 500 ms 開始錄音,鬆開結束並將最終結果寫入輸入框。

4、本地 SenseVoice 模式檢測到持續語音後顯示“已檢測到語音”;停止後由 SenseVoice 返回最終文字。

5、啓用模型潤色後,插件會等待所選模型潤色完成再填入 Composer;潤色失敗時保留原始轉寫。

6、啓用自動發送後,只有用戶主動結束錄音才自動提交;瀏覽器自行結束識別時不會自動發送。

數據範圍與運行環境

模型潤色會發送原始轉寫和當前 Session 最近 6 條可見用戶/Assistant 文本給所選模型提供商。它不讀取系統提示詞、工具調用、工具結果、圖片或 Assistant 推理內容;上下文最多 12 KB。

本地端點模式將單聲道音頻轉換爲 16 kHz PCM WAV 後發送到迴環地址的 OpenAI 兼容接口:

/v1/audio/transcriptions

本地運行程序安裝到當前 DSH_HOME:

DSH_HOME

它不修改系統 Python、PATH 或全局軟件包。

從 0.4.0-alpha.8 起,本地 ASR 支持 Apple Silicon Mac 和 Windows x64;macOS Intel、Windows ARM64 和 Linux 繼續使用 Web Speech。

macOS 隨包運行程序採用 ad-hoc 簽名,尚未使用 Apple Developer ID 公證;Windows .exe 明確未簽名並顯示命令行窗口。

插件輔助模型調用不寫入 DSH Session 日誌。

適用場景與注意

dsh-dictate 適合在 DSH Composer 中用語音輸入長句、命令、提示詞或代碼說明,並且希望先編輯再發送的場景。它不適合需要朗讀模型回覆、雙向語音會話或即時語音對話的場景。

使用瀏覽器識別時,需要 Chrome 或 Edge 的 Web Speech API;使用本地識別時,需要瀏覽器麥克風與 Web Audio 能力。首次使用兩種模式都需要授予麥克風權限。

資料未明確許可證類型,只出現 LICENSE 文件和 THIRD_PARTY_NOTICES.md。安裝前應按本機安全策略和許可要求檢查來源。

結尾

dsh-dictate 的價值在於把聽寫放進 Composer,同時保留用戶編輯和發送控制權。已確認的 GitHub 地址是:

https://github.com/franksong2702/dsh-dictate

所給資料未提供可確認的目錄頁 URL。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜