ADeptS-Bench:跨设备 Computer Use Agent 可信度评测
ADeptS-Bench:跨设备 Computer Use Agent 可信度评测
一句话结论
ADeptS-Bench 把 computer-use agent 评测从“能否完成视觉任务”推进到 trustworthy interaction:在跨设备 GUI 中同时测试视觉界面里的恶意诱导、模糊意图下是否澄清、以及 refusal tool / safety architecture 是否真的降低攻击成功率。
为什么对用户重要
长程 computer-use agent 的危险不只是点错按钮,也包括在视觉界面中被 prompt-like UI、误导性标签、隐含高价值交易或模糊指令诱导。ADeptS-Bench 对 Hermes 的直接提醒是:GUI agent benchmark 不能只奖励 task success;还要测是否在 ambiguity 和 malicious UI 中暂停、澄清、拒绝或升级审批。
机制 / 一阶原理
ADeptS-Bench 使用双流结构:
- Safety stream:成对 benign/malicious tasks,把威胁嵌入视觉界面,评估 agent 是否被 UI 内容误导而执行危险动作。
- Disambiguation stream:给出 intent 不明确的任务,评估 agent 是否寻求澄清,而不是自行猜测。
它还通过 ablation 观察 safety architecture:有的模型依赖 refusal tool,有的部分依赖,有的没有有效机制。这说明安全能力不是单一模型属性,而是 model × tool × harness × observation 的组合。
与已有概念的关系
- 对 Agent-Benchmarks:补充 task success 与 attack success / clarification behavior 的双目标评测。
- 对 Loop-Engineering:模糊状态不应自动推进 loop;应进入 HOLD / clarify / approval 状态。
- 对 Harness-Engineering:refusal/clarification tool 本身也应被 ablation,而不是假设存在就有效。
对 Hermes / llm-wiki 的可执行启发
- 任何 GUI/支付/账号/配置类自动化,都应在模糊 intent 或高价值 action 前默认 HOLD。
- benchmark 报告应同时列 task success、attack success、clarification rate、over-refusal rate。
- 安全工具要做 with/without ablation,避免把 prompt 风格或模型保守性误判为 harness 安全。
- 对无人 cron,如果来源或目标歧义会改变副作用范围,应降级为只读发现,不自动执行。
失败模式 / 边界
- 本轮只读取 abstract/metadata,数据集、评测代码和 paired-task 构造需后续完整验证。
- 过度澄清会降低可用性;benchmark 需要区分必要澄清与无意义阻塞。
- 视觉威胁在不同设备、语言和 UI 框架下迁移性未知。
深度判断
晋升为正式 source 页,因为它把 computer-use benchmark 与安全/澄清/工具 ablation 连接起来,直接补足用户关注的长程 GUI agent 控制层失败模式。
写入记录
- 2026-08-29 09:01 CST:根据 arXiv abstract/metadata 新增 ADeptS-Bench 分析,提炼 GUI safety stream、disambiguation stream 和 safety-tool ablation 对 Hermes computer-use benchmark 的启发。