IssueBenchKit:把真实 GitHub issue 变成私有 coding-agent benchmark
IssueBenchKit:把真实 GitHub issue 变成私有 coding-agent benchmark
一句话结论
IssueBenchKit 提供小型本地 benchmark builder:从真实 issue/PR/local bug 创建包含 base commit、复现命令、测试命令、before/after 结果和报告的任务包。
深度判断
- 评分:relevance 5/5, novelty 4/5, durability 5/5, actionability 5/5, source-quality 4/5, depth-potential 5/5。
- 是否符合本轮高权重主题:是。它与 agent benchmark 可复现性、harness/runtime/control-plane、长程 computer-use 或企业内部 coding-agent benchmark 至少一个方向强相关。
- 晋升理由:不是单纯新闻/工具介绍;README/项目说明中包含可迁移的机制、评测合同或治理结构,能改进 Hermes / llm-wiki 的自动化实践。
为什么这对用户重要
它命中企业内部 coding-agent benchmark:团队不一定需要公开 leaderboard,更需要能把自己仓库里的真实 bug 变成 CI 可跑、可审计、可复用的小任务池。
机制 / 一阶原理
每个 task directory 保存 issuebench.json:source repo、issue URL、base commit、reproduction/validation command、expected signal、notes/tags;run 结果记录 exit code、duration、stdout/stderr tail 和 verdict;validate 证明 before fails、after passes 且同一 task command 被使用。
与既有 wiki 概念的关系
| 该来源主要连接:Agent-Benchmarks, Repository-Exploration, Harness-Engineering, [[tenx-bench-kit-internal-agent-benchmark | 10x-bench-kit]]。它把既有概念从原则推进到可执行机制:benchmark 不只看分数,harness 不只写 prompt,loop 不只自动重复,而是要有版本、证据、权限、轨迹和成本。 |
对 Hermes / llm-wiki / agentic workflow 的启发
Hermes/llm-wiki 可用它的 schema 设计内部评测任务:从真实历史 bug 创建 BASE/RED/GOLD 三态,隐藏修复说明,只给 agent issue context 和测试命令;报告同时保存 patch、测试输出、耗时和 token 成本。
失败模式、边界条件与未解问题
它不自动生成测试,也不解决隐藏材料泄漏;若任务作者把修复思路写进 issue/context,agent benchmark 仍会污染。下一步需要 task linter、hidden fixtures 和成本字段。
来源
- GitHub: https://github.com/he-yufeng/IssueBenchKit
- Raw archive:
raw/articles/issuebenchkit-private-repo-coding-agent-benchmark-2026-08-22.md
写入记录
- 2026-08-22 09:30 CST:AI 知识雷达根据项目 README 深度入库,记录机制、与既有概念关系、实践启发和边界条件。