← 返回藏书阁

10x-bench-kit:企业内部 coding-agent benchmark 模板

wiki/ai/sources/tenx-bench-kit-internal-agent-benchmark.md
分类:ai / sources · 更新:2026-08-21 09:09

10x-bench-kit:企业内部 coding-agent benchmark 模板

一句话结论

10x-bench-kit 是一个用于企业内部 coding-agent benchmark instance 的模板:把 kit 自身、共享 skills、公司私有 tasks/evaluation-pool/config 分区,并在隔离容器中按 model × task × trial 跑 OpenCode,最后输出 metrics、patch、evaluation 和带版本戳的 result。

为什么对用户重要

用户关心的不是公开榜单上的抽象分数,而是“某个 agent/harness/skill 在我的仓库和任务上是否稳定有用”。10x-bench-kit 的价值在于给本地评测提供结构:私有任务、隔离 workspace、隐藏评测材料、版本 era、成本/时间/质量三指标。这可迁移到 Hermes 的 skills、llm-wiki radar、coding-agent workflow 回归测试。

机制 / 一阶原理

README 把 repo 分为三块:.bench-kit/ 由 kit 原子替换,.agents/skills/ 由共享层提出 diff,公司决定是否接受,tasks/evaluation-pool/bench.config.yaml 属于公司且 update 不覆盖。单次 trial 在 throwaway container 中运行:pinned base repo + task overlay;执行阶段不能看到 evaluation materials;执行后才挂载 assertions,按 static/tests/e2e/LLM-as-judge 加权评分;result 带 template version、task hash、judge model、rubric version,只有同一 era 内可比较。

与已有 wiki 的关系

  • Agent-Benchmarks:补充“本地私有 benchmark instance”范式,而不是只追公开 leaderboard。
  • Harness-Engineering:强调 benchmark 自身也是 harness,需要隔离、hidden eval、version stamps 和 artifact receipts。
  • External-Agent-Skills-Design-Patterns.agents/skills/ 作为可协商 diff,而非自动覆盖,适合 skill 生命周期治理。

对 Hermes / llm-wiki 的可执行启发

  1. 可以把每日 radar 的结构要求做成最小 benchmark:orient、raw hash、source page、concept update、index/log、write-record、reindex receipt。
  2. 对 Hermes skills 变更,应区分 kit-owned 模板、shared skills、user-owned task/eval pool,避免升级覆盖用户知识。
  3. 评测报告要记录 era:模型、工具、prompt/skill、rubric 变化后,结果不能简单横比。

失败模式 / 边界

  • 当前 README 显示 initial harness 只支持 OpenCode;对 Claude Code/Hermes/Codex 的横向比较还需要 adapter 扩展。
  • LLM-as-judge 仍可能引入评分噪音,需要校准 rubrics 和人工抽检。
  • 项目星数较低、文档较短,因此作为方法模板入库,confidence 保持 medium。

写入记录

  • 2026-08-21 09:06 CST:新增 10x-bench-kit source page,沉淀企业内部 agent benchmark 分区、trial lifecycle、hidden eval 和 era versioning。