Everdict — harness-agnostic agent evaluation runtime
Everdict — harness-agnostic agent evaluation runtime
Everdict 是一个自托管、harness-agnostic 的 agent evaluation runtime。它强调“任何 agent、任何框架、针对你的数据”运行评测:Claude Code、Codex、LangGraph 或任意 CLI 都可以作为被测 harness;结果可以做 baseline/candidate diff、leaderboard、CI gate,并通过 MCP/API 让 agent 或 CI 驱动评测。
为什么这对用户重要
用户关注的不是公开 leaderboard 本身,而是 Hermes、llm-wiki、coding-agent workflow 是否真的在变好。Everdict 的价值在于把本地 workflow 从“凭感觉更顺”变成可回归的 eval cell:同一任务、同一 grader 下比较不同 prompt、skill、harness、模型或上下文包。对 Agent-Benchmarks 来说,它补足了“公开 benchmark 之外的本地评测平台”;对 Harness-Engineering 来说,它把 harness 作为可测变量,而不只是执行工具。
机制 / 一阶原理
Everdict 把一次 agent eval 拆为五个关注点:
- Harness:被测 agent 或 CLI。
- Environment:repo、browser、OS 或任务世界。
- Driver:sandbox 内执行逻辑。
- Grader/Judge:tests、cost、latency、steps、LLM/VLM/agent judge 等评分方式。
- Backend:Local、Nomad、K8s、runner 等运行位置。
这个拆分很关键:agent 失败不一定是模型差,可能是环境、driver、grader、权限、成本或 harness scaffolding 的问题。Everdict 的 baseline/candidate diff 和 CI gate 让这种差异可以被版本化追踪。
与已有 wiki 概念的关系
- 与 Agent-Benchmarks:Everdict 是本地/私有 benchmark runtime,而不是单个公开任务集。
- 与 Harness-Engineering:它把 harness、environment、driver、grader、backend 分离,有助于避免把所有结果都归因于模型。
- 与 External-Agent-Skills-Design-Patterns:skill 或 MCP 接入后应能通过代表性任务证明 adoption 与净收益。
- 与 Context-Engineering:context bundle 的效果也可以用 baseline/candidate 方式评估,而不是只看检索命中。
对 Hermes / llm-wiki 的可执行启发
- 把每日雷达做成最小 eval cell:任务是“发现并深度入库高价值 AI/工程材料”,grader 检查 orient、raw hash、source/concept page、写入记录、_index/log、未入库理由。
- skill 改动要有 baseline:修改 llm-wiki skill 或 coding-agent skill 后,用固定样例任务比较 old vs new。
- 报告中分离 harness 变量:本次 arXiv 失败是 API/网络边界,不是“没有论文”;GitHub README 成功是发现路径变量。
- CI gate 不应只看 pass/fail:还应看 cost、latency、tool count、evidence completeness 和 reporting honesty。
失败模式 / 边界条件
- eval runtime 本身不保证 grader 正确;如果 grader 太弱,会把 agent 投机行为误判为成功。
- 自托管平台有运维成本;对个人 llm-wiki 应先做轻量检查脚本,而不是立刻部署完整平台。
- LLM judge 仍有不稳定性;对关键 workflow 应优先使用 deterministic tests、文件存在、hash、lint、runner output。
- 本地数据评测容易过拟合;需要保留 held-out tasks 和周期性任务轮换。
写入记录
- 2026-08-08 09:00 CST:新增 Everdict 的 source page,提炼其 harness/environment/driver/grader/backend 拆分与 llm-wiki 本地 eval cell 启发。