WeaveBench:GUI+CLI 混合长程 computer-use 评测
WeaveBench:GUI+CLI 混合长程 computer-use 评测
一句话结论
WeaveBench 用 114 个真实长程任务评测 agent 是否能在同一轨迹中交织 GUI 观察与 CLI/code 执行,并用 trajectory-aware judge 打击伪造证据。
深度判断
- 评分:relevance 5/5, novelty 4/5, durability 5/5, actionability 5/5, source-quality 5/5, depth-potential 5/5。
- 是否符合本轮高权重主题:是。它与 agent benchmark 可复现性、harness/runtime/control-plane、长程 computer-use 或企业内部 coding-agent benchmark 至少一个方向强相关。
- 晋升理由:不是单纯新闻/工具介绍;README/项目说明中包含可迁移的机制、评测合同或治理结构,能改进 Hermes / llm-wiki 的自动化实践。
为什么这对用户重要
它直接对应长程 computer-use 失败模式:GUI 与 CLI 承载不同状态,agent 只看截图或只跑命令都会错过关键证据;报告夸大和硬编码指标需要被 judge 清零。
机制 / 一阶原理
任务准入要求 channel-non-substitutable:GUI 暴露 transient rendered state,CLI/code 提供 persistent scriptable state;评分读取完整聊天轨迹、deliverables,并对 synthetic screenshots、hard-coded metrics 等 fabricated evidence 置零。
与既有 wiki 概念的关系
| 该来源主要连接:Agent-Benchmarks, Loop-Engineering, [[longhorizon-harness-computer-use-loop | LongHorizon-Harness]], [[osworld-v2-release-versioned-computer-use-benchmark | OSWorld-V2]]。它把既有概念从原则推进到可执行机制:benchmark 不只看分数,harness 不只写 prompt,loop 不只自动重复,而是要有版本、证据、权限、轨迹和成本。 |
对 Hermes / llm-wiki / agentic workflow 的启发
Hermes 在做网页/桌面/CLI 混合任务时,应把“跨通道交叉验证”列入完成条件:截图证据要能被 CLI/API/log 复核,CLI 结果要能解释 GUI 当前状态;最终报告应包含证据路径而不是只给自然语言结论。
失败模式、边界条件与未解问题
Agent-as-Judge 仍可能漏判伪造或过度惩罚真实但格式差的证据;混合任务更接近真实,但成本高、轨迹长,必须记录 token/tool-call/latency,否则很难迁移到日常自动化。
来源
- GitHub: https://github.com/weavebench/WeaveBench
- Raw archive:
raw/articles/weavebench-hybrid-gui-cli-agent-benchmark-2026-08-22.md
写入记录
- 2026-08-22 09:30 CST:AI 知识雷达根据项目 README 深度入库,记录机制、与既有概念关系、实践启发和边界条件。