Claw-Eval — trustworthy evaluation of autonomous agents
Claw-Eval — trustworthy evaluation of autonomous agents
一句话结论
Claw-Eval 是一个面向 autonomous agents 的可信评测基准:300 个 human-verified tasks、2,159 个 rubrics、9 个类别,按 Completion / Safety / Robustness 评估,并使用 Pass^3 减少 lucky run。它值得入库,因为它把 agent benchmark 从一次性成功率推进到 rubric、重复试验和全轨迹审计。
为什么对用户重要
用户的 Hermes 自动任务需要避免“看起来完成”但实际未验证。Claw-Eval 的 Pass^3 和 human-verified rubrics 提醒我们:一次 run 成功不等于 workflow 稳定;同样,日报入库一次跑通也不等于雷达质量长期可靠。对 llm-wiki,真正要评估的是:发现是否覆盖、来源是否读取、raw 是否可追溯、页面是否有深度、报告 claim 是否被文件/命令证据支撑。
机制 / 一阶原理
Claw-Eval 把任务分成 general、multimodal、multi_turn,并用任务 fixture、rubric 和 leaderboard 组织结果。它的关键更新是 Pass^3:模型必须三次独立运行都满足成功标准才算通过。这比单次 pass 更接近真实部署中的稳定性要求,也能暴露 fragile planning、tool instability、对话澄清和多模态任务中的偶然性。
与既有 wiki 概念的关系
- 对 Agent-Benchmarks:补充 human-verified rubric、Pass^3 和 Completion/Safety/Robustness 三维评估。
- 对 Harness-Engineering:评测结果依赖 sandbox、fixtures、API 稳定和人工重跑策略,说明 benchmark 必须报告 harness variables。
- 对 Context-Engineering:multi-turn 和 multimodal task 提醒 context provider 不能只测文本检索,还要测 clarification 与视觉/文件证据。
对 Hermes / llm-wiki 的可执行启发
- 将每日 radar 的结构检查设计成最小 rubric:orient、search、read source、raw hash、deep note、concept update、index/log、write record、reindex/verification、未入库原因。
- 对自动化 workflow 不应只看单次 PASS;关键流程可抽样做 repeat run 或至少做结构化回归检查。
- 报告中把 Completion(文件是否写入)、Safety(是否越界/是否安全 HOLD)、Robustness(是否可重复/是否依赖失败 API)分开说。
失败模式 / 边界
- README 宣称正在审计 reproducibility;在审计完成前,leaderboard 仍应以 medium confidence 使用。
- Human-verified rubrics 成本高,个人 Hermes 不可能照搬完整规模;适合迁移为小型本地 rubric。
- 评测 API 波动可能影响结果,Claw-Eval 的人工重跑策略也提示要记录 infrastructure failure,而不是把它算成模型失败。
写入记录
- 2026-08-09 09:00 CST:新增 Claw-Eval source note,提炼 Pass^3、human-verified rubrics、Completion/Safety/Robustness 对 Hermes radar micro-benchmark 的启发。