← 返回藏书阁

IssueBenchKit:把真实 GitHub issue 变成私有 coding-agent benchmark

wiki/ai/sources/issuebenchkit-private-repo-coding-agent-benchmark.md
分类:ai / sources · 更新:2026-08-22 09:08

IssueBenchKit:把真实 GitHub issue 变成私有 coding-agent benchmark

一句话结论

IssueBenchKit 提供小型本地 benchmark builder:从真实 issue/PR/local bug 创建包含 base commit、复现命令、测试命令、before/after 结果和报告的任务包。

深度判断

  • 评分:relevance 5/5, novelty 4/5, durability 5/5, actionability 5/5, source-quality 4/5, depth-potential 5/5。
  • 是否符合本轮高权重主题:是。它与 agent benchmark 可复现性、harness/runtime/control-plane、长程 computer-use 或企业内部 coding-agent benchmark 至少一个方向强相关。
  • 晋升理由:不是单纯新闻/工具介绍;README/项目说明中包含可迁移的机制、评测合同或治理结构,能改进 Hermes / llm-wiki 的自动化实践。

为什么这对用户重要

它命中企业内部 coding-agent benchmark:团队不一定需要公开 leaderboard,更需要能把自己仓库里的真实 bug 变成 CI 可跑、可审计、可复用的小任务池。

机制 / 一阶原理

每个 task directory 保存 issuebench.json:source repo、issue URL、base commit、reproduction/validation command、expected signal、notes/tags;run 结果记录 exit code、duration、stdout/stderr tail 和 verdict;validate 证明 before fails、after passes 且同一 task command 被使用。

与既有 wiki 概念的关系

该来源主要连接:Agent-Benchmarks, Repository-Exploration, Harness-Engineering, [[tenx-bench-kit-internal-agent-benchmark10x-bench-kit]]。它把既有概念从原则推进到可执行机制:benchmark 不只看分数,harness 不只写 prompt,loop 不只自动重复,而是要有版本、证据、权限、轨迹和成本。

对 Hermes / llm-wiki / agentic workflow 的启发

Hermes/llm-wiki 可用它的 schema 设计内部评测任务:从真实历史 bug 创建 BASE/RED/GOLD 三态,隐藏修复说明,只给 agent issue context 和测试命令;报告同时保存 patch、测试输出、耗时和 token 成本。

失败模式、边界条件与未解问题

它不自动生成测试,也不解决隐藏材料泄漏;若任务作者把修复思路写进 issue/context,agent benchmark 仍会污染。下一步需要 task linter、hidden fixtures 和成本字段。

来源

  • GitHub: https://github.com/he-yufeng/IssueBenchKit
  • Raw archive: raw/articles/issuebenchkit-private-repo-coding-agent-benchmark-2026-08-22.md

写入记录

  • 2026-08-22 09:30 CST:AI 知识雷达根据项目 README 深度入库,记录机制、与既有概念关系、实践启发和边界条件。