前言¶
7 月下旬,OpenAI 在 ChatGPT 桌面版 26.715 更新中,將 GPT-Live 全雙工語音能力正式接入 Codex 與 ChatGPT Work。開發者不再侷限於鍵盤輸入,可以用自然語音在 Chat、Work、Codex 三個工作面之間發起任務、查詢進度、調整方向——編碼 Agent 的交互範式,從「打字指揮」邁向「免提編排」。
這不是把移動端語音簡單搬到桌面。根據 OpenAI Codex Changelog 與 ChatGPT Voice 官方文檔,桌面版 Voice 的核心價值在於跨線程協調 Agent 工作:一邊持續對話,一邊讓後臺 Codex 任務並行執行。對日常寫代碼、審 PR、跑測試的工程師來說,值得認真看一眼這次更新的邊界與用法。
GPT-Live 是什麼:全雙工語音層¶
GPT-Live 是 OpenAI 於 2026 年 7 月 8 日 推出的連續音頻模型,核心特性是全雙工(full-duplex)——模型可以在你說話的同時監聽並回應,不必像傳統語音助手那樣嚴格「你說完我再答」。對話中可以自然打斷、追問、改口,模型也會用「好的」「明白」等短句做即時反饋,而不打斷你的思路。
架構上,OpenAI 將即時語音交互層與後臺推理引擎解耦:GPT-Live 負責維持流暢對話與工具調度決策,複雜推理與代碼修改則交給後臺模型(如 GPT-5.5)異步處理。VentureBeat 在 相關報道 中將這種設計比作「結對編程」——你口頭描述問題,Agent 在後臺改代碼,兩邊狀態保持同步。
7 月 8 日的 GPT-Live 首發主要面向移動端與 Web 對話場景;7 月 23 日 的桌面版集成,纔是它第一次深度接入 Agentic Coding 工作流。
7 月 23 日更新:Voice 進了 Codex 桌面殼¶
這次發佈隨 ChatGPT 桌面版 build 26.715 全球 rollout,覆蓋 macOS 與 Windows。幾個關鍵事實:
- 統一桌面應用:7 月 9 日(build 26.707),Codex 已併入 ChatGPT 桌面應用,Chat、Work、Codex 三個視圖共存於同一客戶端。Voice 可直接在這三個模式下切換,上下文不丟。
- 跨線程調度:進入語音模式後,你可以讓 ChatGPT 在其他線程裏啓動、檢查或調整 Codex / Work 任務。官方示例包括「跑測試並調查失敗項」「彙總當前阻塞項」等。
- 多文件夾項目(同版本附帶):本地項目可掛載多個相關目錄,指定一個主文件夾用於 Git 操作及
AGENTS.md、skills、config.toml的自動發現,其餘目錄可用於搜索與編輯。 - iOS Remote:桌面端開啓 Voice 後,可通過 ChatGPT iOS 應用的 Remote 功能遠程查看進度、回答 Agent 提問;Android Remote 官方標註爲即將支持。
VentureBeat 援引 OpenAI 發言人的話指出,這是 Voice 首次與 Codex 這類 Agent 執行引擎深度綁定;OpenAI 在 X 上的宣傳也強調:「Anything you can do with Codex, you can now drive through voice.」
開發者能用它做什麼¶
官方文檔與媒體實測歸納出的典型場景如下。
1. 並行發起多路編碼任務¶
用一句語音同時佈置多條工作線,例如:
- 調查一個 open 狀態的認證 bug;
- 審查某個 API 遷移的 Pull Request;
- 爲缺失覆蓋的模塊生成單元測試。
桌面應用會在 Slack 對話、GitHub 倉庫、本地代碼庫等上下文間協調追蹤,你無需逐條切換窗口手動粘貼指令。
2. 口頭審查與遠程指導 Agent¶
任務運行中,你可以隨時問「Agent 2 進展如何」,或口頭改方向——全雙工引擎會在不打斷對話的前提下,決定是否插話、暫停或調用工具。配合 iOS Remote,離開工位也能繼續指揮長時任務。
3. macOS 屏幕上下文(Appshots)¶
在 Settings > Voice 中開啓 Screen context 後,說「Take a look at this」,ChatGPT 會截取最前臺窗口的快照作爲上下文,可結合本地文件、代碼結構與插件信息分析界面。注意:快照可能包含可見區域外的可訪問文本,分享前需確認窗口內無敏感信息;企業管理員也可禁用此能力。
4. Voice 與語音聽寫的邊界¶
官方明確區分兩種模式:
| 模式 | 適用場景 |
|---|---|
| ChatGPT Voice | 即時對話、跨線程編排 Agent |
| Voice dictation(語音聽寫) | 僅將語音轉成 prompt 文本再發送 |
Voice 適合「指揮與協調」,不適合「口述寫一整段 React 組件」——後者仍應交給 Codex 任務線程在後臺生成。
如何開始用¶
前提條件:
- 訂閱計劃:Plus、Pro、Business、Edu、Enterprise(Free / Go 不在此次桌面 Voice 覆蓋範圍內;Enterprise / Edu 有兩週 early access 期)。
- 客戶端:ChatGPT 桌面應用 26.715 及以上。
- 任務必須從 Voice 模式啓動:新聊天或新任務需先點 Start new voice chat;已在文本模式開啓的對話只能使用聽寫,不能切換爲全功能 Voice。
簡要步驟:
- 打開 ChatGPT 桌面應用,進入 Chat / Work / Codex 任一視圖。
- 新建空白聊天或任務,選擇 Start new voice chat,授權麥克風;macOS 用戶按需配置 Screen context 權限。
- 口頭描述目標,例如:「Start a Codex task to run the tests and investigate anything that doesn’t pass.」
- 持續對話中查詢進度、追加指令;任務完成後在對應線程查看 diff 與日誌。
可在 Settings > Voice > Voice chat hotkey 設置快捷鍵,減少鼠標操作。
配額、權限與侷限¶
使用前建議瞭解以下約束(均來自 官方 Voice 文檔):
- 雙重用量:Voice 對話本身按套餐享有獨立的滾動 5 小時窗口配額;通過 Voice 觸發的 Codex 任務仍消耗 Codex 用量。
- 單會話限制:整個桌面應用同時只能有一個活躍 Voice 聊天。
- 權限繼承:Voice 調度的任務遵循 Chat / Work / Codex 各自的工具與權限邊界,不會越權執行。
- 閉源商業模型:Voice 管線與 Agent 狀態架構均爲 OpenAI 專有服務,無法自託管或修改權重;Voice 觸發的 Agent workload 與常規 Codex 任務計費方式一致。
- 無公開 API:截至此次發佈,開發者無法通過 API 復刻同等全雙工 + Codex 編排能力,能力限定在 ChatGPT 桌面生態內。
與 Agent 控制面的同頻演進¶
如果把時間線拉長,7 月的 Codex 更新並不只有 Voice 一項。OpenAI 在 7 月 20 日 iOS 版中還加入了任務轉錄內的交互式表單、Mermaid 渲染、阻塞/用量耗盡後的任務恢復等「控制面」能力;Claude Code、GitHub Copilot 也在同期強化審批模式、MCP 鑑權與 artifacts 分享。
Voice 解決的是輸入與編排側的摩擦——少打字、少切窗、多線程口頭調度;表單、恢復、審批解決的是信任與可運維性。兩者疊加,才構成可落地的 Agentic Coding,而不是 demo 級「會說話寫代碼」。
小結¶
GPT-Live 全雙工語音接入 Codex,標誌着編碼 Agent 從「單線程打字交互」進入「免提多線程編排」階段。對個體開發者,價值在於離開鍵盤也能推進測試、審 PR、查 bug;對團隊,則需同步評估 Voice 配額、屏幕上下文的數據安全策略,以及 Voice 觸發任務與常規 Codex 用量疊加後的成本。
如果你已在 Plus 及以上套餐並使用 ChatGPT 桌面版,建議直接升到 26.715,在 Codex 視圖下試一次「語音發起測試任務 + 口頭查進度」的完整閉環——全雙工體驗與舊版「對講機式」語音差別很明顯。更復雜的工程治理(審批、MCP 範圍、跨設備任務恢復)仍要回到任務線程與控制面配置,Voice 是加速器,不是替代品。