OpenAI 把 GPT-Live 全双工语音接入 Codex,编码 Agent 走向免提操作

前言

7 月下旬,OpenAI 在 ChatGPT 桌面版 26.715 更新中,将 GPT-Live 全双工语音能力正式接入 CodexChatGPT Work。开发者不再局限于键盘输入,可以用自然语音在 Chat、Work、Codex 三个工作面之间发起任务、查询进度、调整方向——编码 Agent 的交互范式,从「打字指挥」迈向「免提编排」。

这不是把移动端语音简单搬到桌面。根据 OpenAI Codex ChangelogChatGPT Voice 官方文档,桌面版 Voice 的核心价值在于跨线程协调 Agent 工作:一边持续对话,一边让后台 Codex 任务并行执行。对日常写代码、审 PR、跑测试的工程师来说,值得认真看一眼这次更新的边界与用法。

GPT-Live 是什么:全双工语音层

GPT-Live 是 OpenAI 于 2026 年 7 月 8 日 推出的连续音频模型,核心特性是全双工(full-duplex)——模型可以在你说话的同时监听并回应,不必像传统语音助手那样严格「你说完我再答」。对话中可以自然打断、追问、改口,模型也会用「好的」「明白」等短句做即时反馈,而不打断你的思路。

架构上,OpenAI 将实时语音交互层后台推理引擎解耦:GPT-Live 负责维持流畅对话与工具调度决策,复杂推理与代码修改则交给后台模型(如 GPT-5.5)异步处理。VentureBeat 在 相关报道 中将这种设计比作「结对编程」——你口头描述问题,Agent 在后台改代码,两边状态保持同步。

7 月 8 日的 GPT-Live 首发主要面向移动端与 Web 对话场景;7 月 23 日 的桌面版集成,才是它第一次深度接入 Agentic Coding 工作流。

7 月 23 日更新:Voice 进了 Codex 桌面壳

这次发布随 ChatGPT 桌面版 build 26.715 全球 rollout,覆盖 macOSWindows。几个关键事实:

  1. 统一桌面应用:7 月 9 日(build 26.707),Codex 已并入 ChatGPT 桌面应用,Chat、Work、Codex 三个视图共存于同一客户端。Voice 可直接在这三个模式下切换,上下文不丢。
  2. 跨线程调度:进入语音模式后,你可以让 ChatGPT 在其他线程里启动、检查或调整 Codex / Work 任务。官方示例包括「跑测试并调查失败项」「汇总当前阻塞项」等。
  3. 多文件夹项目(同版本附带):本地项目可挂载多个相关目录,指定一个主文件夹用于 Git 操作及 AGENTS.md、skills、config.toml 的自动发现,其余目录可用于搜索与编辑。
  4. iOS Remote:桌面端开启 Voice 后,可通过 ChatGPT iOS 应用的 Remote 功能远程查看进度、回答 Agent 提问;Android Remote 官方标注为即将支持。

VentureBeat 援引 OpenAI 发言人的话指出,这是 Voice 首次与 Codex 这类 Agent 执行引擎深度绑定;OpenAI 在 X 上的宣传也强调:「Anything you can do with Codex, you can now drive through voice.」

开发者能用它做什么

官方文档与媒体实测归纳出的典型场景如下。

1. 并行发起多路编码任务

用一句语音同时布置多条工作线,例如:

  • 调查一个 open 状态的认证 bug;
  • 审查某个 API 迁移的 Pull Request;
  • 为缺失覆盖的模块生成单元测试。

桌面应用会在 Slack 对话、GitHub 仓库、本地代码库等上下文间协调追踪,你无需逐条切换窗口手动粘贴指令。

2. 口头审查与远程指导 Agent

任务运行中,你可以随时问「Agent 2 进展如何」,或口头改方向——全双工引擎会在不打断对话的前提下,决定是否插话、暂停或调用工具。配合 iOS Remote,离开工位也能继续指挥长时任务。

3. macOS 屏幕上下文(Appshots)

Settings > Voice 中开启 Screen context 后,说「Take a look at this」,ChatGPT 会截取最前台窗口的快照作为上下文,可结合本地文件、代码结构与插件信息分析界面。注意:快照可能包含可见区域外的可访问文本,分享前需确认窗口内无敏感信息;企业管理员也可禁用此能力。

4. Voice 与语音听写的边界

官方明确区分两种模式:

模式 适用场景
ChatGPT Voice 实时对话、跨线程编排 Agent
Voice dictation(语音听写) 仅将语音转成 prompt 文本再发送

Voice 适合「指挥与协调」,不适合「口述写一整段 React 组件」——后者仍应交给 Codex 任务线程在后台生成。

如何开始用

前提条件:

  • 订阅计划:Plus、Pro、Business、Edu、Enterprise(Free / Go 不在此次桌面 Voice 覆盖范围内;Enterprise / Edu 有两周 early access 期)。
  • 客户端:ChatGPT 桌面应用 26.715 及以上。
  • 任务必须从 Voice 模式启动:新聊天或新任务需先点 Start new voice chat;已在文本模式开启的对话只能使用听写,不能切换为全功能 Voice。

简要步骤:

  1. 打开 ChatGPT 桌面应用,进入 Chat / Work / Codex 任一视图。
  2. 新建空白聊天或任务,选择 Start new voice chat,授权麦克风;macOS 用户按需配置 Screen context 权限。
  3. 口头描述目标,例如:「Start a Codex task to run the tests and investigate anything that doesn’t pass.」
  4. 持续对话中查询进度、追加指令;任务完成后在对应线程查看 diff 与日志。

可在 Settings > Voice > Voice chat hotkey 设置快捷键,减少鼠标操作。

配额、权限与局限

使用前建议了解以下约束(均来自 官方 Voice 文档):

  1. 双重用量:Voice 对话本身按套餐享有独立的滚动 5 小时窗口配额;通过 Voice 触发的 Codex 任务仍消耗 Codex 用量
  2. 单会话限制:整个桌面应用同时只能有一个活跃 Voice 聊天。
  3. 权限继承:Voice 调度的任务遵循 Chat / Work / Codex 各自的工具与权限边界,不会越权执行。
  4. 闭源商业模型:Voice 管线与 Agent 状态架构均为 OpenAI 专有服务,无法自托管或修改权重;Voice 触发的 Agent workload 与常规 Codex 任务计费方式一致。
  5. 无公开 API:截至此次发布,开发者无法通过 API 复刻同等全双工 + Codex 编排能力,能力限定在 ChatGPT 桌面生态内。

与 Agent 控制面的同频演进

如果把时间线拉长,7 月的 Codex 更新并不只有 Voice 一项。OpenAI 在 7 月 20 日 iOS 版中还加入了任务转录内的交互式表单、Mermaid 渲染、阻塞/用量耗尽后的任务恢复等「控制面」能力;Claude Code、GitHub Copilot 也在同期强化审批模式、MCP 鉴权与 artifacts 分享。

Voice 解决的是输入与编排侧的摩擦——少打字、少切窗、多线程口头调度;表单、恢复、审批解决的是信任与可运维性。两者叠加,才构成可落地的 Agentic Coding,而不是 demo 级「会说话写代码」。

小结

GPT-Live 全双工语音接入 Codex,标志着编码 Agent 从「单线程打字交互」进入「免提多线程编排」阶段。对个体开发者,价值在于离开键盘也能推进测试、审 PR、查 bug;对团队,则需同步评估 Voice 配额、屏幕上下文的数据安全策略,以及 Voice 触发任务与常规 Codex 用量叠加后的成本。

如果你已在 Plus 及以上套餐并使用 ChatGPT 桌面版,建议直接升到 26.715,在 Codex 视图下试一次「语音发起测试任务 + 口头查进度」的完整闭环——全双工体验与旧版「对讲机式」语音差别很明显。更复杂的工程治理(审批、MCP 范围、跨设备任务恢复)仍要回到任务线程与控制面配置,Voice 是加速器,不是替代品。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜