← 返回藏书阁

WeaveBench:GUI+CLI 混合长程 computer-use 评测

wiki/ai/sources/weavebench-hybrid-gui-cli-agent-benchmark.md
分类:ai / sources · 更新:2026-08-22 09:09

WeaveBench:GUI+CLI 混合长程 computer-use 评测

一句话结论

WeaveBench 用 114 个真实长程任务评测 agent 是否能在同一轨迹中交织 GUI 观察与 CLI/code 执行,并用 trajectory-aware judge 打击伪造证据。

深度判断

  • 评分:relevance 5/5, novelty 4/5, durability 5/5, actionability 5/5, source-quality 5/5, depth-potential 5/5。
  • 是否符合本轮高权重主题:是。它与 agent benchmark 可复现性、harness/runtime/control-plane、长程 computer-use 或企业内部 coding-agent benchmark 至少一个方向强相关。
  • 晋升理由:不是单纯新闻/工具介绍;README/项目说明中包含可迁移的机制、评测合同或治理结构,能改进 Hermes / llm-wiki 的自动化实践。

为什么这对用户重要

它直接对应长程 computer-use 失败模式:GUI 与 CLI 承载不同状态,agent 只看截图或只跑命令都会错过关键证据;报告夸大和硬编码指标需要被 judge 清零。

机制 / 一阶原理

任务准入要求 channel-non-substitutable:GUI 暴露 transient rendered state,CLI/code 提供 persistent scriptable state;评分读取完整聊天轨迹、deliverables,并对 synthetic screenshots、hard-coded metrics 等 fabricated evidence 置零。

与既有 wiki 概念的关系

该来源主要连接:Agent-Benchmarks, Loop-Engineering, [[longhorizon-harness-computer-use-loopLongHorizon-Harness]], [[osworld-v2-release-versioned-computer-use-benchmarkOSWorld-V2]]。它把既有概念从原则推进到可执行机制:benchmark 不只看分数,harness 不只写 prompt,loop 不只自动重复,而是要有版本、证据、权限、轨迹和成本。

对 Hermes / llm-wiki / agentic workflow 的启发

Hermes 在做网页/桌面/CLI 混合任务时,应把“跨通道交叉验证”列入完成条件:截图证据要能被 CLI/API/log 复核,CLI 结果要能解释 GUI 当前状态;最终报告应包含证据路径而不是只给自然语言结论。

失败模式、边界条件与未解问题

Agent-as-Judge 仍可能漏判伪造或过度惩罚真实但格式差的证据;混合任务更接近真实,但成本高、轨迹长,必须记录 token/tool-call/latency,否则很难迁移到日常自动化。

来源

  • GitHub: https://github.com/weavebench/WeaveBench
  • Raw archive: raw/articles/weavebench-hybrid-gui-cli-agent-benchmark-2026-08-22.md

写入记录

  • 2026-08-22 09:30 CST:AI 知识雷达根据项目 README 深度入库,记录机制、与既有概念关系、实践启发和边界条件。