OpenBenchmark:从真实 agent 轨迹生成任务、rubric 与成本榜单
OpenBenchmark:从真实 agent 轨迹生成任务、rubric 与成本榜单
一句话结论
OpenBenchmark 从 OpenAI/Anthropic/LangSmith/Langfuse/JSONL 轨迹导入真实工作流,再由 build agent 草拟任务和 rubric,比较模型、harness 与成本。
深度判断
- 评分:relevance 4/5, novelty 4/5, durability 4/5, actionability 4/5, source-quality 3/5, depth-potential 4/5。
- 是否符合本轮高权重主题:是。它与 agent benchmark 可复现性、harness/runtime/control-plane、长程 computer-use 或企业内部 coding-agent benchmark 至少一个方向强相关。
- 晋升理由:不是单纯新闻/工具介绍;README/项目说明中包含可迁移的机制、评测合同或治理结构,能改进 Hermes / llm-wiki 的自动化实践。
为什么这对用户重要
它把“日常 agent 使用轨迹”转成团队私有 benchmark,适合让 Hermes 的 cron/wiki/coding 工作从不可比较的自然语言历史变成可重跑评测集。
机制 / 一阶原理
导入器把不同平台 trace 归一为 TrajectoryStep,并保留 raw 与 warning;build agent 先读轨迹再写任务,用户审查后 finalized;评测支持 rubric judge、pairwise 双顺序消偏、Elo,以及 score/cost/speed。
与既有 wiki 概念的关系
| 该来源主要连接:Agent-Benchmarks, Harness-Engineering, Loop-Engineering, [[traceprobe-trajectory-structure-diagnostics | TraceProbe]]。它把既有概念从原则推进到可执行机制:benchmark 不只看分数,harness 不只写 prompt,loop 不只自动重复,而是要有版本、证据、权限、轨迹和成本。 |
对 Hermes / llm-wiki / agentic workflow 的启发
llm-wiki 雷达可把每日候选、入库、验证失败轨迹导出为 JSONL,周期性生成“哪些模型/工具组合更会维护 wiki”的私有 benchmark,而不是只凭主观感受调 prompt。
失败模式、边界条件与未解问题
由 build agent 从轨迹草拟任务有二阶幻觉风险;rubric 可能继承原始 workflow 的偏见。必须保留人审、原始轨迹、rubric diff 和 pairwise order-swap 结果。
来源
- GitHub: https://github.com/crispyberry/OpenBenchmark
- Raw archive:
raw/articles/openbenchmark-trajectory-to-benchmark-2026-08-22.md
写入记录
- 2026-08-22 09:30 CST:AI 知识雷达根据项目 README 深度入库,记录机制、与既有概念关系、实践启发和边界条件。