Harness Arena:盲评 Agent Harness 而非模型
Harness Arena:盲评 Agent Harness 而非模型
一句话结论
Harness Arena 把 Chatbot Arena 式 blind judging 移到 agent harness 层:同一任务、同一模型、隔离 workspace 下跑 Claude Code、Codex CLI、OpenClaw、Hermes、opencode、OnDemand 等 harness,先匿名展示产物让人评分,再揭示身份,并从完整历史重算 Elo。
为什么对用户重要
用户的实践已经不只是“哪个模型强”,而是 Hermes、Claude Code、Codex、skills、plugins、MCP、workflow 组合后哪种 harness 更可靠。Harness Arena 的核心价值是把 harness 当成可测变量:CLI、工具、prompt、权限、执行环境和产物收集方式都可能改变最终质量。
机制 / 一阶原理
运行流程包含:导入任务数据集;每个 harness 在独立 workdir 下使用相同 provider/model config 执行;收集 deliverables;评审者在身份隐藏的 A/B/C 输出上评分;提交后才 reveal harness;leaderboard 用完整 score history 重新派生 Elo,而不是把某个增量 rating 当永久真相。
这降低了两个偏差:一是“我期待某工具赢”的品牌锚定;二是 leaderboard stale state。它也提醒 agent benchmark 里的 matched-model comparison 必须把 harness 和模型分开归因。
与已有概念的关系
- 对 Agent-Benchmarks:补充 blind judging、same-model harness comparison 与 Elo recomputation。
- 对 Harness-Engineering:harness 不是背景变量,而是实验对象。
- 对 Agentic-Coding:coding agent 质量应归因到模型 × harness × task × evaluator,而不是单一“模型能力”。
可执行启发
- Hermes 可维护小型内部 harness arena:同一 wiki ingest/coding task,让 Hermes/Claude Code/Codex 在相同模型或相同任务下对比。
- 评估结果先匿名 review,再 reveal tool identity,避免偏见影响判断。
- leaderboard/score 应从原始 verdict 派生,保留可重算性和纠错能力。
- 每次 benchmark 记录 model、harness version、task id、workspace isolation、cost、duration 和 deliverables hash。
失败模式 / 边界
- 人类 blind judging 仍可能主观,rubric 不清会造成噪声。
- 若任务数据集质量低或泄漏,arena 只是在公平地评低质量任务。
- early/v0 项目,本轮未验证线上 arena、后端实现和数据集质量。
深度判断
本轮晋升为正式 source 页,因为它直接命中 agent benchmark 的 harness 归因与 blind evaluation 主题,能改进用户未来比较 Hermes/Claude/Codex 等 agentic workflow 的评测设计。
写入记录
- 2026-08-28 09:00 CST:新增 Harness Arena 分析,提炼同模型隔离运行、匿名评审、身份揭示与 Elo 重算对 agent harness 评测的启发。