← 返回藏书阁

Agent Evaluation & Harness Engineering

wiki/ai/concepts/Agent-Evaluation-and-Harness-Engineering.md
分类:ai / concepts · 更新:2026-08-21 12:26

Agent Evaluation & Harness Engineering

专题定位

Agent Evaluation & Harness Engineering 是 llm-wiki 当前 AI 工程知识里的一个专题入口。它关注的问题不是“哪个模型榜单最高”,而是:行动型 agent 在真实工程、长期循环、工具调用、桌面操作和企业内部代码库里,怎样被可靠评测、受控运行、持续复盘。

这个专题把五条主线合并成一张地图:

  1. Agent-Benchmarks:定义 agent 能力、可靠性、安全性和轨迹健康如何被评估。
  2. Harness-Engineering:定义一次 agent run 的上下文、工具、权限、验证和生命周期控制。
  3. Loop-Engineering:定义多个 agent run 如何被调度、持续、停止、恢复和外部化状态。
  4. Agentic-Engineering:定义人如何组织多个 agent 在规格、评估和控制层下完成工程工作。
  5. MCP-Gateway-Runtime:定义工具调用和推理流量如何进入网关化 runtime,而不是裸露在单个 agent 进程里。

一句话框架

成熟的 agent 工程不是“给更强模型更多工具”,而是四层共同成立:

层级核心问题代表页面
Evaluation怎样知道 agent 真的做对了、稳不稳、有没有越界Agent-Benchmarks
Harness怎样让单次运行可控、可验证、可恢复Harness-Engineering
Loop怎样让可靠运行自动重复,并在失败时停住Loop-Engineering
Runtime / Control Plane怎样治理工具、模型流量、凭据、审计和端点选择MCP-Gateway-Runtime

Agentic-Engineering 是使用这些层之后的工作形态:人类从直接写代码,转向定义目标、上下文、评估标准、权限边界和合并判断。

重点阅读路径

1. 先读评测:什么才算 agent 能力

Agent-Benchmarks 开始。重点不是排行榜,而是评测对象如何从短任务扩展到:

  • 长程任务与轨迹健康;
  • 工具调用与 MCP server 采用;
  • UI / computer-use / 多模态任务;
  • 私有仓库、企业业务状态和领域 verifier;
  • 报告诚实度、claim-level receipt 与可重放轨迹;
  • benchmark integrity、污染控制和 hidden verifier 边界。

相关来源优先读:

- [[Agents-Last-ExamAgents' Last Exam]]:真实经济任务和公开 benchmark 的断层。
- [[deepswe-long-horizon-coding-agent-benchmarkDeepSWE]]:原创长程 coding 任务、污染控制和功能级 verifier。
- [[repotrials-private-repository-coding-agent-evalRepoTrials]]:企业内部 coding-agent benchmark 该如何构造。
- [[longhorizon-harness-long-horizon-computer-useLongHorizon-Harness]]:长程 computer-use agent 需要 verified state、Manager/Executor/Auditor 和失败归因。
- [[mcp-gauntlet-agentic-mcp-server-evaluatormcp-gauntlet]]:MCP server 不能只看 schema,要看 agent 是否正确采用工具并安全完成任务。

2. 再读 Harness:单次运行如何被约束

Harness-Engineering 解释一次 agent run 应该怎样被“套上挽具”:上下文、工具、权限、验证、状态、human gate 和恢复策略共同构成运行边界。

关键来源:

- [[agentops-coding-agent-verificationAgentOps coding-agent verification membrane]]:完成声明必须经过独立 verdict 和证据账本。
- [[dscc-compositional-agent-policiesDSCC]] 与 [[underspecbench-action-boundaryUnderSpecBench]]:工具组合、意图不明和 side effect 需要 session-level policy。
- [[harness-score-maturity-scannerHarness Score]]:harness maturity 可以被静态扫描和结构化评分。
- [[nemo-relay-agent-runtime-controlNeMo Relay]]:运行时轨迹和生命周期事件应成为评测输入。
- [[proof-or-stop-evidence-gated-lifecycle-controlProof-or-Stop]]:没有证据就不推进生命周期状态。

3. 然后读 Loop:自动化如何避免变成 slop machine

Loop-Engineering 关注的是外层循环:发现任务、分派、执行、验证、记录、重试、停止。它把 agent 从“人类逐轮提示”推进到“系统自己触发和复盘”。

关键来源:

- [[loop-engineering-autonomous-log-to-stagingLoop Engineering 实战:日志扫描到预发部署]]:生产维护 loop 的五动作六组件。
- [[preloop-agent-control-planePreloop]]:把工具调用、审批、预算、审计纳入控制面。
- [[workflow-as-knowledge-semantic-persistenceWorkflow as Knowledge]]:workflow 定义、状态和依赖关系本身也是知识对象。
- [[chancery-agent-identity-writ-controlChancery]]:长期 loop 需要身份、授权、TTL 和审计。

4. 最后读 Runtime:工具和模型流量如何进入控制面

MCP-Gateway-Runtime 把专题落到基础设施层:远程 MCP 工具调用、Gateway API、推理扩展、Endpoint Picker、凭据隔离和 served endpoint 回传。

关键来源:

- [[higress-mcp-gateway-api-inference-extensionHigress v2.2.4:MCP、Gateway API 与推理扩展]]:MCP 2026-07-28 无状态 HTTP Tools、Gateway API v1.6、Inference Extension v1.4。
- [[provekit-mcp-redteam-hardened-mcp-serverProveKit MCP]]、[[mcp-guardrail-sql-authorizer-boundaryMCP Guardrail]]、[[cyclops-deterministic-mcp-toxic-flow-proxyCyclops]]:MCP / tool boundary 的安全评测样本。

当前专题判断

  1. Agent benchmark 正在从 leaderboard 变成 engineering instrument。 真正有价值的是复现性、污染控制、hidden verifier、轨迹、成本、失败归因和报告诚实度。
  2. Harness 和 runtime 是评测的隐含变量。 同一个模型在不同工具面、权限策略、上下文格式、审批门禁和网关路由下,结果不可直接比较。
  3. 长程 computer-use agent 的失败不只是“模型没看懂屏幕”。 常见失败包括状态漂移、不可验证 UI 状态、错误工具例程固化、视觉/CLI 混合路径切换失败、恢复策略缺失和最终报告夸大。
  4. 企业内部 coding-agent benchmark 比公开榜单更有决策价值。 私有仓库、真实修复、隐藏 verifier、BASE/RED/GOLD、成本和版本戳,才能回答“在我的流程里是否稳定”。
  5. MCP / Gateway / control plane 会成为 Agentic Engineering 的下层地基。 只靠 prompt 或 SDK 管工具是不够的;生产系统需要协议、凭据、路由、限流、审计和端点回传。

雷达采集规则

短期应提高以下方向权重:

  • agent benchmark 的可复现评测设计;
  • harness / runtime / control plane;
  • 长程 computer-use agent 的失败模式;
  • 企业内部 coding-agent benchmark。

同时降低以下内容的采集优先级:

  • 仅新闻发布,无方法、数据或实现细节;
  • 单工具介绍,但没有可复用 workflow / harness / eval 设计;
  • 不能解释 agent 成败机制、不能进入本地流程复盘、也没有工程复用价值的材料。

后续应补的专题资产

  • Agent Benchmark Reproducibility Checklist:任务新鲜度、hidden verifier、污染控制、轨迹、成本、重复次数、报告证据。
  • Long-Horizon Computer-Use Failure Modes:状态漂移、视觉误读、工具换挡失败、恢复失败、报告诚实度。
  • Private Coding-Agent Benchmark Playbook:从企业 Git history 构造 BASE/RED/GOLD、隐藏材料和本地评测池。
  • MCP / Tool Runtime Policy:只读、写操作、需审批、需 sandbox、需审计回放的分级策略。

写入记录

  • 2026-08-21 12:21 CST:新增专题索引页,串联 Agent-Benchmarks、Harness-Engineering、Loop-Engineering、Agentic-Engineering、MCP-Gateway-Runtime 及关键来源页,并记录后续雷达权重调整方向。