模型不是勝負手:2026 年中 CLI 編碼 Agent 的 Harness 之爭

前言

2024 年,業界的主流判斷還是 IDE 會贏——Copilot 嵌在編輯器裏,Cursor 快速起量,「Agent」多半隻是帶 Shell 權限的聊天框。到了 2026 年中,真正扛住 CI、SSH、無 GUI 服務器場景的,反而是終端裏的 CLI 編碼 Agent。據 Arinbjörn Kolbeinsson 在 2026 年 7 月整理的清單,僅活躍維護的 CLI 編碼 Agent 就有 35 款以上。

但開發者社區近幾個月討論的焦點,已經從「哪個模型最強」轉向另一個問題:Harness(代理腳手架) 纔是決定任務能否真正落地的變量。系統提示、重試邏輯、上下文壓縮、Subagent 編排——這些包裹在模型外面的工程細節,在 Terminal-Bench 2.1 等基準上造成的分數差距,往往大於換一款基座模型。

本文基於 2026 年 6–7 月公開的一手資料與第三方排行榜,梳理 Harness 之爭的來龍去脈,並對 Claude Code、Codex CLI、OpenCode、GitHub Copilot CLI 等主流工具做橫向對照。

什麼是 Harness:模型之外的那一層

一個 CLI 編碼 Agent 可以拆成兩部分:

  1. 模型:負責推理、生成代碼、理解指令。
  2. Harness:負責把文件餵給模型、執行 Shell 命令、管理權限、壓縮上下文、編排子 Agent、在失敗時重試。

Capital and Compute 在 2026 年 6 月的綜述裏用一句話點破了誤區:排行榜上「哪個模型最好」是錯誤問題,「哪個 Agent 能把任務做完」纔是正確問題。同一款 GPT-5.5,跑在 Codex CLI 裏和跑在別的 Harness 裏,Terminal-Bench 分數可以差出好幾個百分點。

Naman Vats 2026 年的預印本論文 The Scaffold Effect 進一步量化了這個現象:在 Terminal-Bench Pro 的 50 任務切片上,固定模型、只換 Harness(Goose、OpenCode、OpenHands-SDK),成本方差往往比換模型更大。Harness 裏的 system prompt、turn budget、retry policy、skill 注入,每一項都在悄悄改寫最終結果。

Terminal-Bench 2.1:Harness 差距的試金石

Terminal-Bench 是 Laude Institute、Stanford 研究者與開源社區共同維護的終端 Agent 基準,每個任務都有獨立 Docker 環境、人工編寫的參考解和自動化驗證腳本。2026 年中的 Terminal-Bench 2.1 是對 2.0 的驗證修訂版,保留 89 道任務,修復了約 28 道題的環境依賴、資源預算和「指令與測試不一致」等問題,使分數更能反映 Agent 能力而非基準本身的 bug。

官方排行榜(tbench.ai)要求每個 Agent/模型組合至少跑 k=5 次取均值。截至 2026 年 7 月,Snorkel AI 彙總的第三方驗證結果大致如下(置信區間重疊處可視爲「膠着」):

排名 Agent 模型 準確率
1 Claude Code Claude 5 Fable 83.8% ±1.2
2 Codex CLI GPT-5.5 83.1% ±1.1
3 Terminus 2 Claude 5 Fable 80.4% ±1.2
4 Cursor CLI Grok 4.5 79.3% ±1.5
5 Claude Code Claude Opus 4.8 78.9% ±1.3

幾個值得細讀的細節:

同一模型,不同 Harness,分數不同。 Terminus 2 是 Terminal-Bench 項目自帶的參考 Harness;Claude Code 與 Terminus 2 都接 Fable 5,前者 83.8%,後者 80.4%。差距來自 Anthropic 自研 Harness 在工具調用、上下文管理和重試策略上的調優。

同一 Harness,換模型也會變,但 Harness 的上限往往更關鍵。 Claude Code 接 Opus 4.8 得 78.9%,接 Fable 5 得 83.8%——模型升級有效,但 Codex CLI + GPT-5.5 仍與其同處第一梯隊,說明 OpenAI 的 Harness 工程同樣到位。

統一腳手架下的「裸模型分」更低。 Scale 的 SWE-bench Pro 公開榜把所有模型放進同一套 SWE-Agent scaffold,榜首約在 59% 左右;而各廠商在自己 Harness 上公佈的 SWE-bench Verified 數字可達 90% 上下。中間三四十個點的落差,就是 Harness 在 benchmark 標題裏藏掉的工作量。

四家主流 CLI Agent 的 Harness 路線

Claude Code:品類模板,編排最深

Anthropic 2025 年 2 月發佈的 Claude Code 基本定義了後續 CLI Agent 的「標準骨架」:Agentic 循環、文件/Shell 工具、項目記憶文件、權限提示、Plan 模式、Hooks、Skills、Subagent。到 2026 年中,它又多了實驗性的 Agent Teams(多會話互發消息)和獨立的 Agent SDK 計費池。

Harness 側的長處在於編排深度:自定義 Subagent、worktree 隔離並行、跨會話持久 memory、/rewind 檢查點。Terminal-Bench 2.1 上 Fable 5 的榜首成績,與「模型 + Harness 聯合調優」的 bundled 策略一致。代價是模型鎖定、閉源 Harness,以及 headless/SDK 用量單獨計費的賬單形態。

Codex CLI:開源 Harness 的強 counterweight

OpenAI 2025 年 4 月開源 Codex CLI(Apache-2.0,後重寫爲 Rust 核心),2026 年上半年陸續加入 Goals 持久化、線程級 Subagent 委託、插件市場、瀏覽器控制、加密遠程執行,甚至提供 一鍵導入 Claude Code 配置 的遷移路徑。

Harness 賣點是 OS 級沙箱(Seatbelt/Landlock)、開放可審計、可接本地模型。Terminal-Bench 2.1 上 GPT-5.5 得 83.1%,與 Claude Code 幾乎打平。對需要在髒倉庫裏跑真實 Shell、又要獨立審查 Harness 行爲的團隊,Codex 是目前唯一同時具備「Lab 級模型接入 + 開源 Harness + 內核隔離」的選項之一。

OpenCode:模型無關的 portable base

OpenCode(Anomaly/SST 團隊維護,MIT 協議)是 2026 年 GitHub 上 star 數最高的 Agent 項目之一(約 18 萬+),支持 75+ 模型提供商,採用 client-server 架構:opencode serve 可跑無頭服務,TUI、桌面端、IDE 插件都是客戶端。

它的 Terminal-Bench 分數 不獨立於模型——接 Opus 4.8 接近 Claude Code,接 GPT-5.5 接近 Codex CLI。Harness 的價值在於中立與可移植:AGENTS.md、自定義 Agent/Subagent JSON、MCP、LSP、JS/TS 插件。適合 BYOK、本地模型、批量自動化等「不想被單一訂閱綁死」的場景。需要注意的是,Anthropic 禁止在 OpenCode 中使用 Claude Pro/Max 訂閱,Claude 需走 API Key。

GitHub Copilot CLI:平臺 Harness 的「懶人默認」

Copilot CLI 2025 年 9 月預覽、2026 年 2 月 GA,入門價 $10/月,是目前主流產品裏最便宜的 dedicated plan 之一。Harness 深度綁定 GitHub 工作流:內置 GitHub MCP、按倉庫 Copilot Memory、自動分派 explore/plan/review/build 專家 Agent,前綴 & 可把任務交給雲端 Coding Agent。

在 Terminal-Bench 官方榜上,Copilot CLI 尚未進入前幾名——平臺 Agent 的強項不在極限刷榜,而在 PR、Issue、Review、Actions 的原生打通。2026 年 7 月,Copilot 還接入了 Moonshot 的開權重模型 Kimi K2.7 Code(經 Azure),成爲少數在閉源平臺 Harness 裏提供 open-weight 選項的工具。

上下文壓縮:Harness 的隱形戰場

長會話裏,Agent 每一步都會把任務描述、相關文件、歷史工具輸出重新塞進上下文。Bai 等人 2026 年預印本 How Do AI Agents Spend Your Money?(Stanford Digital Economy Lab / Microsoft Research)指出:Agentic 編碼任務的 token 消耗可達普通代碼聊天的 三個數量級,且同一任務的總 token 可相差 30 倍。輸入 token 是成本大頭——Harness 怎麼「瘦身」上下文,直接決定賬單。

2026 年社區形成的做法大致四類:

  1. 自動 Compaction:Claude Code、Codex CLI、Copilot CLI(約 95% 窗口觸發)、OpenCode 均支持會話接近上限時自動摘要並重啓窗口。摘要保留什麼(決策、未竟事項、不變量)是 Harness 工程決策。
  2. 工具輸出沙箱化:流行模式是把 Shell/瀏覽器輸出留在子進程,只讓摘要進入對話。社區項目 context-mode 的公開 benchmark 稱:56 KB 的 Playwright 快照可壓到 299 B 進入上下文。
  3. Hook 級壓縮器squeezcontext-compress 等工具通過 PreToolUse Hook 對接 Claude Code、Copilot CLI、OpenCode、Codex CLI,對 Bash 輸出做最高約 95% 的壓縮,並儘量保留 SHA、UUID、ticket 等精確標識符。
  4. Subagent 隔離:把 explore、review、implement 拆到獨立上下文窗口,避免噪聲交叉污染——Claude Code、Copilot CLI、OpenCode 均已內置,Pi 則走相反路線:核心只保留 read/write/edit/bash 四個工具、system prompt 控制在千 token 以內,用「極簡 Harness」把壓力還給模型。

Amazon CloudWatch 2026 年推出的 Coding Agent Insights 已能拉取 Claude Code、Codex、Copilot 的組織級遙測——說明上下文與 Harness 效率已從個人技巧上升爲工程管理層面的觀測指標。

開發者該怎麼選

沒有「唯一最強」的 CLI Agent。Arinbjörn Kolbeinsson 在 2026 年 7 月的結論與 Capital and Compute 一致:Claude Code、Codex CLI 結果質量接近,排名 1-2-3 意義不大;更大 swing 來自任務描述是否清晰、倉庫是否有 AGENTS.md/CLAUDE.md、權限策略是否合理。

可按場景快速對號入座:

場景 優先考慮 原因
已付 Claude/OpenAI/GitHub 訂閱 Claude Code / Codex CLI / Copilot CLI 捆綁推理通常是最便宜的前沿模型入口
多文件重構、大型代碼庫調試 Claude Code、Codex CLI Terminal-Bench 第一梯隊,終端 Harness 讀文件更精準
模型無關、BYOK、自託管 OpenCode 75+ 提供商、MIT、client-server
GitHub 中心化團隊 Copilot CLI PR/Review/雲端委託原生集成,$10 入門
審計 Harness、本地模型 Codex CLI、OpenCode 開源可讀;Codex 額外有 OS 沙箱
極限省 token DeepSeek-Reasonix 等 cache-first Harness 項目報告稱重度日可接近 99.8% 前綴緩存命中

無論選哪一款,把 AGENTS.md、MCP 列表、構建/測試命令、Review 規則放進倉庫,比追逐月度 leaderboard 更有長期價值。MCP、AGENTS.md、ACP 已在 2025 年 12 月納入 Linux Foundation 旗下 Agentic AI Foundation 治理——Harness 之爭激烈,遷移成本卻在下降。

小結

2026 年中的 CLI 編碼 Agent 賽道,模型仍是必要組件,但 Harness 正在成爲差異化的主戰場。Terminal-Bench 2.1 上 Claude Code 與 Codex CLI 的膠着、同一模型在不同 Scaffold 下的分數漂移、SWE-bench Pro 統一腳手架與廠商自測分數之間的巨大鴻溝,都在指向同一件事:選 Agent 時,先看它能不能在你的倉庫裏穩定地讀文件、跑測試、壓縮上下文、在失敗時正確重試——然後再看裏面裝的是哪一款模型。

工具 churn 很快,Harness 工程化的方法論會留得更久。把上下文當一門獨立學科來經營,可能是 2026 年下半年每個嚴肅開發團隊都該補上的一課。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜