Agent Evaluation & Harness Engineering
Agent Evaluation & Harness Engineering
专题定位
Agent Evaluation & Harness Engineering 是 llm-wiki 当前 AI 工程知识里的一个专题入口。它关注的问题不是“哪个模型榜单最高”,而是:行动型 agent 在真实工程、长期循环、工具调用、桌面操作和企业内部代码库里,怎样被可靠评测、受控运行、持续复盘。
这个专题把五条主线合并成一张地图:
- Agent-Benchmarks:定义 agent 能力、可靠性、安全性和轨迹健康如何被评估。
- Harness-Engineering:定义一次 agent run 的上下文、工具、权限、验证和生命周期控制。
- Loop-Engineering:定义多个 agent run 如何被调度、持续、停止、恢复和外部化状态。
- Agentic-Engineering:定义人如何组织多个 agent 在规格、评估和控制层下完成工程工作。
- MCP-Gateway-Runtime:定义工具调用和推理流量如何进入网关化 runtime,而不是裸露在单个 agent 进程里。
一句话框架
成熟的 agent 工程不是“给更强模型更多工具”,而是四层共同成立:
| 层级 | 核心问题 | 代表页面 |
| Evaluation | 怎样知道 agent 真的做对了、稳不稳、有没有越界 | Agent-Benchmarks |
| Harness | 怎样让单次运行可控、可验证、可恢复 | Harness-Engineering |
| Loop | 怎样让可靠运行自动重复,并在失败时停住 | Loop-Engineering |
| Runtime / Control Plane | 怎样治理工具、模型流量、凭据、审计和端点选择 | MCP-Gateway-Runtime |
Agentic-Engineering 是使用这些层之后的工作形态:人类从直接写代码,转向定义目标、上下文、评估标准、权限边界和合并判断。
重点阅读路径
1. 先读评测:什么才算 agent 能力
从 Agent-Benchmarks 开始。重点不是排行榜,而是评测对象如何从短任务扩展到:
- 长程任务与轨迹健康;
- 工具调用与 MCP server 采用;
- UI / computer-use / 多模态任务;
- 私有仓库、企业业务状态和领域 verifier;
- 报告诚实度、claim-level receipt 与可重放轨迹;
- benchmark integrity、污染控制和 hidden verifier 边界。
相关来源优先读:
| - [[Agents-Last-Exam | Agents' Last Exam]]:真实经济任务和公开 benchmark 的断层。 |
- SWE-Explore:仓库探索能力应单独评测。
| - [[deepswe-long-horizon-coding-agent-benchmark | DeepSWE]]:原创长程 coding 任务、污染控制和功能级 verifier。 |
| - [[repotrials-private-repository-coding-agent-eval | RepoTrials]]:企业内部 coding-agent benchmark 该如何构造。 |
| - [[longhorizon-harness-long-horizon-computer-use | LongHorizon-Harness]]:长程 computer-use agent 需要 verified state、Manager/Executor/Auditor 和失败归因。 |
| - [[mcp-gauntlet-agentic-mcp-server-evaluator | mcp-gauntlet]]:MCP server 不能只看 schema,要看 agent 是否正确采用工具并安全完成任务。 |
2. 再读 Harness:单次运行如何被约束
Harness-Engineering 解释一次 agent run 应该怎样被“套上挽具”:上下文、工具、权限、验证、状态、human gate 和恢复策略共同构成运行边界。
关键来源:
| - [[agentops-coding-agent-verification | AgentOps coding-agent verification membrane]]:完成声明必须经过独立 verdict 和证据账本。 | |
| - [[dscc-compositional-agent-policies | DSCC]] 与 [[underspecbench-action-boundary | UnderSpecBench]]:工具组合、意图不明和 side effect 需要 session-level policy。 |
| - [[harness-score-maturity-scanner | Harness Score]]:harness maturity 可以被静态扫描和结构化评分。 | |
| - [[nemo-relay-agent-runtime-control | NeMo Relay]]:运行时轨迹和生命周期事件应成为评测输入。 | |
| - [[proof-or-stop-evidence-gated-lifecycle-control | Proof-or-Stop]]:没有证据就不推进生命周期状态。 |
3. 然后读 Loop:自动化如何避免变成 slop machine
Loop-Engineering 关注的是外层循环:发现任务、分派、执行、验证、记录、重试、停止。它把 agent 从“人类逐轮提示”推进到“系统自己触发和复盘”。
关键来源:
| - [[loop-engineering-autonomous-log-to-staging | Loop Engineering 实战:日志扫描到预发部署]]:生产维护 loop 的五动作六组件。 |
| - [[preloop-agent-control-plane | Preloop]]:把工具调用、审批、预算、审计纳入控制面。 |
| - [[workflow-as-knowledge-semantic-persistence | Workflow as Knowledge]]:workflow 定义、状态和依赖关系本身也是知识对象。 |
| - [[chancery-agent-identity-writ-control | Chancery]]:长期 loop 需要身份、授权、TTL 和审计。 |
4. 最后读 Runtime:工具和模型流量如何进入控制面
MCP-Gateway-Runtime 把专题落到基础设施层:远程 MCP 工具调用、Gateway API、推理扩展、Endpoint Picker、凭据隔离和 served endpoint 回传。
关键来源:
| - [[higress-mcp-gateway-api-inference-extension | Higress v2.2.4:MCP、Gateway API 与推理扩展]]:MCP 2026-07-28 无状态 HTTP Tools、Gateway API v1.6、Inference Extension v1.4。 | ||
| - [[provekit-mcp-redteam-hardened-mcp-server | ProveKit MCP]]、[[mcp-guardrail-sql-authorizer-boundary | MCP Guardrail]]、[[cyclops-deterministic-mcp-toxic-flow-proxy | Cyclops]]:MCP / tool boundary 的安全评测样本。 |
当前专题判断
- Agent benchmark 正在从 leaderboard 变成 engineering instrument。 真正有价值的是复现性、污染控制、hidden verifier、轨迹、成本、失败归因和报告诚实度。
- Harness 和 runtime 是评测的隐含变量。 同一个模型在不同工具面、权限策略、上下文格式、审批门禁和网关路由下,结果不可直接比较。
- 长程 computer-use agent 的失败不只是“模型没看懂屏幕”。 常见失败包括状态漂移、不可验证 UI 状态、错误工具例程固化、视觉/CLI 混合路径切换失败、恢复策略缺失和最终报告夸大。
- 企业内部 coding-agent benchmark 比公开榜单更有决策价值。 私有仓库、真实修复、隐藏 verifier、BASE/RED/GOLD、成本和版本戳,才能回答“在我的流程里是否稳定”。
- MCP / Gateway / control plane 会成为 Agentic Engineering 的下层地基。 只靠 prompt 或 SDK 管工具是不够的;生产系统需要协议、凭据、路由、限流、审计和端点回传。
雷达采集规则
短期应提高以下方向权重:
- agent benchmark 的可复现评测设计;
- harness / runtime / control plane;
- 长程 computer-use agent 的失败模式;
- 企业内部 coding-agent benchmark。
同时降低以下内容的采集优先级:
- 仅新闻发布,无方法、数据或实现细节;
- 单工具介绍,但没有可复用 workflow / harness / eval 设计;
- 不能解释 agent 成败机制、不能进入本地流程复盘、也没有工程复用价值的材料。
后续应补的专题资产
Agent Benchmark Reproducibility Checklist:任务新鲜度、hidden verifier、污染控制、轨迹、成本、重复次数、报告证据。Long-Horizon Computer-Use Failure Modes:状态漂移、视觉误读、工具换挡失败、恢复失败、报告诚实度。Private Coding-Agent Benchmark Playbook:从企业 Git history 构造 BASE/RED/GOLD、隐藏材料和本地评测池。MCP / Tool Runtime Policy:只读、写操作、需审批、需 sandbox、需审计回放的分级策略。
写入记录
- 2026-08-21 12:21 CST:新增专题索引页,串联 Agent-Benchmarks、Harness-Engineering、Loop-Engineering、Agentic-Engineering、MCP-Gateway-Runtime 及关键来源页,并记录后续雷达权重调整方向。