← 返回藏书阁

OpenBenchmark:从真实 agent 轨迹生成任务、rubric 与成本榜单

wiki/ai/sources/openbenchmark-trajectory-to-benchmark.md
分类:ai / sources · 更新:2026-08-22 09:08

OpenBenchmark:从真实 agent 轨迹生成任务、rubric 与成本榜单

一句话结论

OpenBenchmark 从 OpenAI/Anthropic/LangSmith/Langfuse/JSONL 轨迹导入真实工作流,再由 build agent 草拟任务和 rubric,比较模型、harness 与成本。

深度判断

  • 评分:relevance 4/5, novelty 4/5, durability 4/5, actionability 4/5, source-quality 3/5, depth-potential 4/5。
  • 是否符合本轮高权重主题:是。它与 agent benchmark 可复现性、harness/runtime/control-plane、长程 computer-use 或企业内部 coding-agent benchmark 至少一个方向强相关。
  • 晋升理由:不是单纯新闻/工具介绍;README/项目说明中包含可迁移的机制、评测合同或治理结构,能改进 Hermes / llm-wiki 的自动化实践。

为什么这对用户重要

它把“日常 agent 使用轨迹”转成团队私有 benchmark,适合让 Hermes 的 cron/wiki/coding 工作从不可比较的自然语言历史变成可重跑评测集。

机制 / 一阶原理

导入器把不同平台 trace 归一为 TrajectoryStep,并保留 raw 与 warning;build agent 先读轨迹再写任务,用户审查后 finalized;评测支持 rubric judge、pairwise 双顺序消偏、Elo,以及 score/cost/speed。

与既有 wiki 概念的关系

该来源主要连接:Agent-Benchmarks, Harness-Engineering, Loop-Engineering, [[traceprobe-trajectory-structure-diagnosticsTraceProbe]]。它把既有概念从原则推进到可执行机制:benchmark 不只看分数,harness 不只写 prompt,loop 不只自动重复,而是要有版本、证据、权限、轨迹和成本。

对 Hermes / llm-wiki / agentic workflow 的启发

llm-wiki 雷达可把每日候选、入库、验证失败轨迹导出为 JSONL,周期性生成“哪些模型/工具组合更会维护 wiki”的私有 benchmark,而不是只凭主观感受调 prompt。

失败模式、边界条件与未解问题

由 build agent 从轨迹草拟任务有二阶幻觉风险;rubric 可能继承原始 workflow 的偏见。必须保留人审、原始轨迹、rubric diff 和 pairwise order-swap 结果。

来源

  • GitHub: https://github.com/crispyberry/OpenBenchmark
  • Raw archive: raw/articles/openbenchmark-trajectory-to-benchmark-2026-08-22.md

写入记录

  • 2026-08-22 09:30 CST:AI 知识雷达根据项目 README 深度入库,记录机制、与既有概念关系、实践启发和边界条件。