RepoAgentBench:把真实合并 PR 变成私有 coding-agent benchmark
RepoAgentBench:把真实合并 PR 变成私有 coding-agent benchmark
核心判断
RepoAgentBench 将团队自己仓库里的 merged PR 转成可重复、可回放、可 diff 的 coding-agent benchmark task;它强调 PR description 作为目标、PR tests 作为验收、diff 拆成测试/源码两半,并保留 diff.patch、agent.log、events.jsonl。
为什么对用户重要
它直接命中企业内部 coding-agent benchmark:公开榜单不能说明 agent 是否适合你的仓库、测试和约束;从 post-training-cutoff PR 挖任务可以降低污染风险,并把 harness/model 的选择变成团队本地证据。
机制 / 一阶原理
机制上,它把 Git history 中的真实修复还原成 BASE/任务/验收材料:agent 在 base 状态上尝试修复,runner 执行项目真实测试,最终 artifact 包含补丁、日志、事件流和报告。README 还给出同一 PR 上 aider+Opus 与 Claude Code native 结果不同的例子,说明 harness 是被测系统的一部分而非透明通道。
与既有 wiki 概念的关系
- 关联页面:Agent-Benchmarks, Harness-Engineering, IssueBenchKit-private-repo-coding-agent-benchmark, OpenBenchmark-trajectory-to-benchmark。
- 本页补充的是 2026-08-23 雷达中的工程样本,重点不在新闻性,而在可迁移的 benchmark / harness / runtime 设计。
对 Hermes / llm-wiki 的可执行启发
Hermes/llm-wiki 可借鉴的不是具体跑分,而是“用本地历史生成私有回归集”:未来评估 Hermes coding workflow、skills 或 prompt 改动时,应优先用自己的 repo 任务、真实测试和 run artifacts,而不是只看公开 SWE-bench 排名。
失败模式、边界条件与未解问题
边界条件:任务挖掘质量取决于 PR 是否有清晰描述和测试;真实测试可能慢或 flaky;若只选择容易 PR 会高估能力;不同 agent adapter 的权限、上下文和默认行为必须版本化,否则无法解释差异。
深度判断
本条被晋升为正式 source page,因为它满足至少一个高权重主题,并且 README/项目描述提供了可复用机制,而不只是发布新闻或单工具介绍。后续若要采用到 Hermes 运行时,仍需本地复验、权限审计和最小任务实验。
写入记录
- 2026-08-23 09:00 CST:新增 2026-08-23 AI 雷达 source page,覆盖重要性、机制、既有概念关系、Hermes 启发与边界条件。