模型不是胜负手:2026 年中 CLI 编码 Agent 的 Harness 之争

前言

2024 年,业界的主流判断还是 IDE 会赢——Copilot 嵌在编辑器里,Cursor 快速起量,「Agent」多半只是带 Shell 权限的聊天框。到了 2026 年中,真正扛住 CI、SSH、无 GUI 服务器场景的,反而是终端里的 CLI 编码 Agent。据 Arinbjörn Kolbeinsson 在 2026 年 7 月整理的清单,仅活跃维护的 CLI 编码 Agent 就有 35 款以上。

但开发者社区近几个月讨论的焦点,已经从「哪个模型最强」转向另一个问题:Harness(代理脚手架) 才是决定任务能否真正落地的变量。系统提示、重试逻辑、上下文压缩、Subagent 编排——这些包裹在模型外面的工程细节,在 Terminal-Bench 2.1 等基准上造成的分数差距,往往大于换一款基座模型。

本文基于 2026 年 6–7 月公开的一手资料与第三方排行榜,梳理 Harness 之争的来龙去脉,并对 Claude Code、Codex CLI、OpenCode、GitHub Copilot CLI 等主流工具做横向对照。

什么是 Harness:模型之外的那一层

一个 CLI 编码 Agent 可以拆成两部分:

  1. 模型:负责推理、生成代码、理解指令。
  2. Harness:负责把文件喂给模型、执行 Shell 命令、管理权限、压缩上下文、编排子 Agent、在失败时重试。

Capital and Compute 在 2026 年 6 月的综述里用一句话点破了误区:排行榜上「哪个模型最好」是错误问题,「哪个 Agent 能把任务做完」才是正确问题。同一款 GPT-5.5,跑在 Codex CLI 里和跑在别的 Harness 里,Terminal-Bench 分数可以差出好几个百分点。

Naman Vats 2026 年的预印本论文 The Scaffold Effect 进一步量化了这个现象:在 Terminal-Bench Pro 的 50 任务切片上,固定模型、只换 Harness(Goose、OpenCode、OpenHands-SDK),成本方差往往比换模型更大。Harness 里的 system prompt、turn budget、retry policy、skill 注入,每一项都在悄悄改写最终结果。

Terminal-Bench 2.1:Harness 差距的试金石

Terminal-Bench 是 Laude Institute、Stanford 研究者与开源社区共同维护的终端 Agent 基准,每个任务都有独立 Docker 环境、人工编写的参考解和自动化验证脚本。2026 年中的 Terminal-Bench 2.1 是对 2.0 的验证修订版,保留 89 道任务,修复了约 28 道题的环境依赖、资源预算和「指令与测试不一致」等问题,使分数更能反映 Agent 能力而非基准本身的 bug。

官方排行榜(tbench.ai)要求每个 Agent/模型组合至少跑 k=5 次取均值。截至 2026 年 7 月,Snorkel AI 汇总的第三方验证结果大致如下(置信区间重叠处可视为「胶着」):

排名 Agent 模型 准确率
1 Claude Code Claude 5 Fable 83.8% ±1.2
2 Codex CLI GPT-5.5 83.1% ±1.1
3 Terminus 2 Claude 5 Fable 80.4% ±1.2
4 Cursor CLI Grok 4.5 79.3% ±1.5
5 Claude Code Claude Opus 4.8 78.9% ±1.3

几个值得细读的细节:

同一模型,不同 Harness,分数不同。 Terminus 2 是 Terminal-Bench 项目自带的参考 Harness;Claude Code 与 Terminus 2 都接 Fable 5,前者 83.8%,后者 80.4%。差距来自 Anthropic 自研 Harness 在工具调用、上下文管理和重试策略上的调优。

同一 Harness,换模型也会变,但 Harness 的上限往往更关键。 Claude Code 接 Opus 4.8 得 78.9%,接 Fable 5 得 83.8%——模型升级有效,但 Codex CLI + GPT-5.5 仍与其同处第一梯队,说明 OpenAI 的 Harness 工程同样到位。

统一脚手架下的「裸模型分」更低。 Scale 的 SWE-bench Pro 公开榜把所有模型放进同一套 SWE-Agent scaffold,榜首约在 59% 左右;而各厂商在自己 Harness 上公布的 SWE-bench Verified 数字可达 90% 上下。中间三四十个点的落差,就是 Harness 在 benchmark 标题里藏掉的工作量。

四家主流 CLI Agent 的 Harness 路线

Claude Code:品类模板,编排最深

Anthropic 2025 年 2 月发布的 Claude Code 基本定义了后续 CLI Agent 的「标准骨架」:Agentic 循环、文件/Shell 工具、项目记忆文件、权限提示、Plan 模式、Hooks、Skills、Subagent。到 2026 年中,它又多了实验性的 Agent Teams(多会话互发消息)和独立的 Agent SDK 计费池。

Harness 侧的长处在于编排深度:自定义 Subagent、worktree 隔离并行、跨会话持久 memory、/rewind 检查点。Terminal-Bench 2.1 上 Fable 5 的榜首成绩,与「模型 + Harness 联合调优」的 bundled 策略一致。代价是模型锁定、闭源 Harness,以及 headless/SDK 用量单独计费的账单形态。

Codex CLI:开源 Harness 的强 counterweight

OpenAI 2025 年 4 月开源 Codex CLI(Apache-2.0,后重写为 Rust 核心),2026 年上半年陆续加入 Goals 持久化、线程级 Subagent 委托、插件市场、浏览器控制、加密远程执行,甚至提供 一键导入 Claude Code 配置 的迁移路径。

Harness 卖点是 OS 级沙箱(Seatbelt/Landlock)、开放可审计、可接本地模型。Terminal-Bench 2.1 上 GPT-5.5 得 83.1%,与 Claude Code 几乎打平。对需要在脏仓库里跑真实 Shell、又要独立审查 Harness 行为的团队,Codex 是目前唯一同时具备「Lab 级模型接入 + 开源 Harness + 内核隔离」的选项之一。

OpenCode:模型无关的 portable base

OpenCode(Anomaly/SST 团队维护,MIT 协议)是 2026 年 GitHub 上 star 数最高的 Agent 项目之一(约 18 万+),支持 75+ 模型提供商,采用 client-server 架构:opencode serve 可跑无头服务,TUI、桌面端、IDE 插件都是客户端。

它的 Terminal-Bench 分数 不独立于模型——接 Opus 4.8 接近 Claude Code,接 GPT-5.5 接近 Codex CLI。Harness 的价值在于中立与可移植:AGENTS.md、自定义 Agent/Subagent JSON、MCP、LSP、JS/TS 插件。适合 BYOK、本地模型、批量自动化等「不想被单一订阅绑死」的场景。需要注意的是,Anthropic 禁止在 OpenCode 中使用 Claude Pro/Max 订阅,Claude 需走 API Key。

GitHub Copilot CLI:平台 Harness 的「懒人默认」

Copilot CLI 2025 年 9 月预览、2026 年 2 月 GA,入门价 $10/月,是目前主流产品里最便宜的 dedicated plan 之一。Harness 深度绑定 GitHub 工作流:内置 GitHub MCP、按仓库 Copilot Memory、自动分派 explore/plan/review/build 专家 Agent,前缀 & 可把任务交给云端 Coding Agent。

在 Terminal-Bench 官方榜上,Copilot CLI 尚未进入前几名——平台 Agent 的强项不在极限刷榜,而在 PR、Issue、Review、Actions 的原生打通。2026 年 7 月,Copilot 还接入了 Moonshot 的开权重模型 Kimi K2.7 Code(经 Azure),成为少数在闭源平台 Harness 里提供 open-weight 选项的工具。

上下文压缩:Harness 的隐形战场

长会话里,Agent 每一步都会把任务描述、相关文件、历史工具输出重新塞进上下文。Bai 等人 2026 年预印本 How Do AI Agents Spend Your Money?(Stanford Digital Economy Lab / Microsoft Research)指出:Agentic 编码任务的 token 消耗可达普通代码聊天的 三个数量级,且同一任务的总 token 可相差 30 倍。输入 token 是成本大头——Harness 怎么「瘦身」上下文,直接决定账单。

2026 年社区形成的做法大致四类:

  1. 自动 Compaction:Claude Code、Codex CLI、Copilot CLI(约 95% 窗口触发)、OpenCode 均支持会话接近上限时自动摘要并重启窗口。摘要保留什么(决策、未竟事项、不变量)是 Harness 工程决策。
  2. 工具输出沙箱化:流行模式是把 Shell/浏览器输出留在子进程,只让摘要进入对话。社区项目 context-mode 的公开 benchmark 称:56 KB 的 Playwright 快照可压到 299 B 进入上下文。
  3. Hook 级压缩器squeezcontext-compress 等工具通过 PreToolUse Hook 对接 Claude Code、Copilot CLI、OpenCode、Codex CLI,对 Bash 输出做最高约 95% 的压缩,并尽量保留 SHA、UUID、ticket 等精确标识符。
  4. Subagent 隔离:把 explore、review、implement 拆到独立上下文窗口,避免噪声交叉污染——Claude Code、Copilot CLI、OpenCode 均已内置,Pi 则走相反路线:核心只保留 read/write/edit/bash 四个工具、system prompt 控制在千 token 以内,用「极简 Harness」把压力还给模型。

Amazon CloudWatch 2026 年推出的 Coding Agent Insights 已能拉取 Claude Code、Codex、Copilot 的组织级遥测——说明上下文与 Harness 效率已从个人技巧上升为工程管理层面的观测指标。

开发者该怎么选

没有「唯一最强」的 CLI Agent。Arinbjörn Kolbeinsson 在 2026 年 7 月的结论与 Capital and Compute 一致:Claude Code、Codex CLI 结果质量接近,排名 1-2-3 意义不大;更大 swing 来自任务描述是否清晰、仓库是否有 AGENTS.md/CLAUDE.md、权限策略是否合理。

可按场景快速对号入座:

场景 优先考虑 原因
已付 Claude/OpenAI/GitHub 订阅 Claude Code / Codex CLI / Copilot CLI 捆绑推理通常是最便宜的前沿模型入口
多文件重构、大型代码库调试 Claude Code、Codex CLI Terminal-Bench 第一梯队,终端 Harness 读文件更精准
模型无关、BYOK、自托管 OpenCode 75+ 提供商、MIT、client-server
GitHub 中心化团队 Copilot CLI PR/Review/云端委托原生集成,$10 入门
审计 Harness、本地模型 Codex CLI、OpenCode 开源可读;Codex 额外有 OS 沙箱
极限省 token DeepSeek-Reasonix 等 cache-first Harness 项目报告称重度日可接近 99.8% 前缀缓存命中

无论选哪一款,把 AGENTS.md、MCP 列表、构建/测试命令、Review 规则放进仓库,比追逐月度 leaderboard 更有长期价值。MCP、AGENTS.md、ACP 已在 2025 年 12 月纳入 Linux Foundation 旗下 Agentic AI Foundation 治理——Harness 之争激烈,迁移成本却在下降。

小结

2026 年中的 CLI 编码 Agent 赛道,模型仍是必要组件,但 Harness 正在成为差异化的主战场。Terminal-Bench 2.1 上 Claude Code 与 Codex CLI 的胶着、同一模型在不同 Scaffold 下的分数漂移、SWE-bench Pro 统一脚手架与厂商自测分数之间的巨大鸿沟,都在指向同一件事:选 Agent 时,先看它能不能在你的仓库里稳定地读文件、跑测试、压缩上下文、在失败时正确重试——然后再看里面装的是哪一款模型。

工具 churn 很快,Harness 工程化的方法论会留得更久。把上下文当一门独立学科来经营,可能是 2026 年下半年每个严肃开发团队都该补上的一课。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜