← 返回藏书阁

Claw-Eval — trustworthy evaluation of autonomous agents

wiki/ai/sources/claw-eval-trustworthy-agent-evaluation.md
分类:ai / sources · 更新:2026-08-09 09:03

Claw-Eval — trustworthy evaluation of autonomous agents

一句话结论

Claw-Eval 是一个面向 autonomous agents 的可信评测基准:300 个 human-verified tasks、2,159 个 rubrics、9 个类别,按 Completion / Safety / Robustness 评估,并使用 Pass^3 减少 lucky run。它值得入库,因为它把 agent benchmark 从一次性成功率推进到 rubric、重复试验和全轨迹审计。

为什么对用户重要

用户的 Hermes 自动任务需要避免“看起来完成”但实际未验证。Claw-Eval 的 Pass^3 和 human-verified rubrics 提醒我们:一次 run 成功不等于 workflow 稳定;同样,日报入库一次跑通也不等于雷达质量长期可靠。对 llm-wiki,真正要评估的是:发现是否覆盖、来源是否读取、raw 是否可追溯、页面是否有深度、报告 claim 是否被文件/命令证据支撑。

机制 / 一阶原理

Claw-Eval 把任务分成 general、multimodal、multi_turn,并用任务 fixture、rubric 和 leaderboard 组织结果。它的关键更新是 Pass^3:模型必须三次独立运行都满足成功标准才算通过。这比单次 pass 更接近真实部署中的稳定性要求,也能暴露 fragile planning、tool instability、对话澄清和多模态任务中的偶然性。

与既有 wiki 概念的关系

  • Agent-Benchmarks:补充 human-verified rubric、Pass^3 和 Completion/Safety/Robustness 三维评估。
  • Harness-Engineering:评测结果依赖 sandbox、fixtures、API 稳定和人工重跑策略,说明 benchmark 必须报告 harness variables。
  • Context-Engineering:multi-turn 和 multimodal task 提醒 context provider 不能只测文本检索,还要测 clarification 与视觉/文件证据。

对 Hermes / llm-wiki 的可执行启发

  1. 将每日 radar 的结构检查设计成最小 rubric:orient、search、read source、raw hash、deep note、concept update、index/log、write record、reindex/verification、未入库原因。
  2. 对自动化 workflow 不应只看单次 PASS;关键流程可抽样做 repeat run 或至少做结构化回归检查。
  3. 报告中把 Completion(文件是否写入)、Safety(是否越界/是否安全 HOLD)、Robustness(是否可重复/是否依赖失败 API)分开说。

失败模式 / 边界

  • README 宣称正在审计 reproducibility;在审计完成前,leaderboard 仍应以 medium confidence 使用。
  • Human-verified rubrics 成本高,个人 Hermes 不可能照搬完整规模;适合迁移为小型本地 rubric。
  • 评测 API 波动可能影响结果,Claw-Eval 的人工重跑策略也提示要记录 infrastructure failure,而不是把它算成模型失败。

写入记录

  • 2026-08-09 09:00 CST:新增 Claw-Eval source note,提炼 Pass^3、human-verified rubrics、Completion/Safety/Robustness 对 Hermes radar micro-benchmark 的启发。