用 transcribe Skill 把会议录音和播客转成可检索文本

介绍 OpenAI 官方 Agent Skill「transcribe」:基于 gpt-4o-mini-transcribe 与 gpt-4o-transcribe-diarize,将音频/视频转为文本,支持说话人分离与已知说话人提示。文章说明在 Codex、Cursor、Claude Code 中的安装目录与启用方式,并给出捆绑 CLI 的快速转写、diarized_json 输出等可复现示例,以及 25MB 限制、长音频 auto 分块、diarize 模型不支持 prompt 等注意事项。

阅读全文
基于Pytorch实现的说话人日志(说话人分离)

本文介绍了基于Pytorch实现的声纹识别框架(`VoiceprintRecognition_Pytorch`)的说话人日志功能,支持多种先进的模型和数据预处理方法。通过执行`infer_speaker_diarization.py`脚本或使用GUI界面程序,可以对音频进行说话人分离并显示结果。输出包括每个说话人的起止时间和身份识别信息(需先注册)。此外,文章还提供了在Ubuntu系统中解决中文名

阅读全文