← 返回藏书阁

Agent Harness Evolution Shapes Coding Agent Quality

wiki/ai/sources/agent-harness-evolution-shapes-coding-agent-quality.md
分类:ai / sources · 更新:2026-08-27 09:09

Agent Harness Evolution Shapes Coding Agent Quality

核心结论

这篇 arXiv 论文把 coding agent 质量波动从“模型变强/变弱”重新归因到 agent harness 本身的版本演化:作者固定底层 LLM,只改变 Qwen Code CLI 的 35 个连续 release,在 50 个分层 SWE-bench Verified 任务上观察 effectiveness / efficiency 波动;同时横向观察 Codex、Qwen Code、Gemini、OpenCode、OpenHands 等开源 harness 的高频发布节奏。关键贡献不是一个新排行榜,而是证明 harness release velocity、prompt/tool/context/control-flow 改动会显著影响 agent 质量,且这种影响常被错误归咎于模型。^[raw/articles/agent-harness-evolution-shapes-coding-agent-quality-2026-08-27.md]

为什么对用户重要

这直接命中 Harness-EngineeringAgent-Benchmarks:用户维护 Hermes / llm-wiki / coding-agent workflow 时,不能只在模型版本变化时重测;每次 skill、prompt、工具面、MCP gateway、上下文装载策略、cron prompt 的改变,都可能改变质量、成本和失败模式。对长期无人雷达来说,今天“同一模型、不同 harness release”这个视角提醒我们:日报质量下降不一定是模型问题,可能是搜索 query、晋升门槛、索引维护或运行时工具路径改变。

机制 / 一阶原理

Agent harness 是模型与任务环境之间的中间层,负责 system prompt、工具执行、上下文管理和 reasoning loop。固定模型后,harness 仍可通过四条路径改变结果:1)给模型暴露的上下文不同;2)工具可用性、参数和错误恢复不同;3)循环何时继续/停止不同;4)成本预算和输出格式影响探索深度。因此 benchmark 若不记录 harness version、release diff、工具面和轨迹,就无法把 pass-rate 变化正确归因。

对 Hermes / llm-wiki 的启发

  • 把每日 AI 雷达视为一个可版本化 harness:prompt、短期关注权重、搜索源、入库模板、index/log/reindex 步骤都应被记录。
  • 对重要 workflow 增加“harness version / rule version / source route”字段,避免未来复盘时只看到结果而看不到控制层变化。
  • 对入库质量做 release-to-release 比较:例如连续 7 天新增页面数、raw-only 比率、重复主题率、未访问来源数、vector reindex 成功率。

失败模式 / 边界

本轮只读取了 arXiv abstract/metadata,未完整解析 PDF,因此细节性数值和具体 PR 归因保持 medium confidence。正式应用时还需要完整论文、实验脚本和数据表;否则只能吸收方法论,不能把论文中的具体定量结论硬化成事实。

关联

写入记录

  • 2026-08-27 09:00 CST:根据 arXiv abstract/metadata 新增 source 页,提炼 harness release 演化对 coding-agent 评测归因和 llm-wiki radar 自评的意义。