← 返回藏书阁

Cua:computer-use drivers、sandboxes 与 Cua-Bench

wiki/ai/sources/cua-computer-use-drivers-sandboxes-benchmarks.md
分类:ai / sources · 更新:2026-08-23 09:12

Cua:computer-use drivers、sandboxes 与 Cua-Bench

核心判断

Cua 提供跨 OS computer-use 组件:background drivers、agent-ready sandboxes、Cua-Bench benchmark/RL environments,以及 Lume macOS virtualization;README 强调 agents 可以在 macOS/Windows/Linux/Android 等环境中截图、点击、输入、运行 shell,并导出 trajectories。

为什么对用户重要

它命中长程 computer-use agent 的运行时基底:评测不只需要任务和模型,还需要可复制的 OS/VM/container、后台输入、截图/鼠标/键盘 API、trajectory export 和 benchmark registry。

机制 / 一阶原理

机制上,Cua 把 computer-use 拆成 driver、sandbox、bench、virtualization 四层:driver 控制本机应用且不抢焦点;Sandbox 给 agent 一个统一 API;Cua-Bench 跑 OSWorld/ScreenSpot/Windows Arena/custom tasks 并导出轨迹;Lume 管理 Apple Silicon 上的 macOS/Linux VM。

与既有 wiki 概念的关系

  • 关联页面:Loop-Engineering, Agent-Benchmarks, OSWorld-V2-release-versioned-computer-use-benchmark, WeaveBench-hybrid-gui-cli-agent-benchmark
  • 本页补充的是 2026-08-23 雷达中的工程样本,重点不在新闻性,而在可迁移的 benchmark / harness / runtime 设计。

对 Hermes / llm-wiki 的可执行启发

Hermes 若将来评估 GUI/CLI 混合任务,应把 Cua 这类 runtime 当作 harness 变量记录:OS image、driver route、输入通道、截图状态、trajectory artifact、并发数和任务 registry 都要进入 run manifest。

失败模式、边界条件与未解问题

边界条件:README 是平台说明而非独立 benchmark 论文;后台输入在不同 OS/Wayland/compositor 上限制不同;VM/image 漂移会影响可复现性;接入本机 GUI 自动化有权限与安全风险,不能由无人 cron 自动安装。

深度判断

本条被晋升为正式 source page,因为它满足至少一个高权重主题,并且 README/项目描述提供了可复用机制,而不只是发布新闻或单工具介绍。后续若要采用到 Hermes 运行时,仍需本地复验、权限审计和最小任务实验。

写入记录

  • 2026-08-23 09:00 CST:新增 2026-08-23 AI 雷达 source page,覆盖重要性、机制、既有概念关系、Hermes 启发与边界条件。