用 transcribe Skill 把會議錄音和播客轉成可檢索文本

介紹 OpenAI 官方 Agent Skill「transcribe」:基於 gpt-4o-mini-transcribe 與 gpt-4o-transcribe-diarize,將音頻/視頻轉爲文本,支持說話人分離與已知說話人提示。文章說明在 Codex、Cursor、Claude Code 中的安裝目錄與啓用方式,並給出捆綁 CLI 的快速轉寫、diarized_json 輸出等可復現示例,以及 25MB 限制、長音頻 auto 分塊、diarize 模型不支持 prompt 等注意事項。

閱讀全文
基於Pytorch實現的說話人日誌(說話人分離)

本文介紹了基於Pytorch實現的聲紋識別框架(`VoiceprintRecognition_Pytorch`)的說話人日誌功能,支持多種先進的模型和數據預處理方法。通過執行`infer_speaker_diarization.py`腳本或使用GUI界面程序,可以對音頻進行說話人分離並顯示結果。輸出包括每個說話人的起止時間和身份識別信息(需先註冊)。此外,文章還提供了在Ubuntu系統中解決中文名

閱讀全文