Boundary-Bench — sandbox policy benchmark for coding agents
Boundary-Bench — sandbox policy benchmark for coding agents
一句话结论
boundary-bench/boundary-bench 把 coding-agent benchmark 从“能否完成 Terminal-Bench 任务”推进到“在真实企业/NIST 风格沙箱政策下还能保留多少能力”。它固定 Terminal-Bench 2.1 任务与 Harbor verifier,把变量显式放在 harness、模型、policy 和成本上,因此特别适合补充 Agent-Benchmarks 与 Harness-Engineering 的安全/能力折衷维度。
为什么对用户重要
用户的 Hermes / llm-wiki 工作流经常在无人 cron、文件写入、网页读取、代码修改和发布之间切换。Boundary-Bench 的价值不是提供一个更高分排行榜,而是提醒:权限收紧本身会改变 agent 能力曲线。如果未来 Hermes 给不同任务设置 read-only、workspace-only、网络 allowlist、非 root、沙箱执行等策略,就需要知道这些策略让哪些任务不可行、哪些只是成本上升、哪些应该被标记为不适用,而不是把失败都归因于模型。
机制 / 一阶原理
Boundary-Bench 使用 Network × Filesystem × Privilege 的 policy lattice:网络可从 full egress 收紧到 per-task allowlist,文件系统可从 open 收紧到 read-only OS / frozen home,权限可从 root 收紧到 non-admin、no_new_privs 和 capability drop。关键点是 policy denial 表现为普通 OS 错误(如 EROFS、EPERM、connection refused),没有给 agent 一个“安全评测提示词 shim”。这更接近真实企业环境:agent 只能通过工具反馈发现边界。
它还区分 policy applicability 与模型失败:某些 Terminal-Bench 任务本来就要求写 /etc、系统级安装或访问非 allowlisted host;在 hardened policy 下强跑这些任务,只会把“不适用”误记成能力差。Boundary-Bench 因此在样本元数据中记录 adapted verifier、not-applicable task、policy 和 harness provenance,让结果可解释。
与已有 wiki 概念的关系
- 对 Agent-Benchmarks:补充 policy-graded evaluation,不只看 pass rate,还看 capability loss、policy blockage、cost 和 not-applicable strata。
- 对 Harness-Engineering:把 sandbox / permission policy 从安全背景变成可测变量;harness 好坏必须在同一模型、同一任务、同一 verifier 下比较。
- 对 Context-Engineering:policy 也是上下文边界。agent 需要知道哪些资源不可写、哪些网络不可达,但评测也要防止把边界提示变成泄漏答案。
对 Hermes / llm-wiki 的可执行启发
- 把权限策略纳入 workflow receipt:未来报告“任务失败/跳过”时,应记录是否因为网络、文件系统、权限或人为审批策略导致,而不是只写 timeout。
- 给 cron/radar 增加 not-applicable 分类:例如 arXiv 429、OpenAI 403、raw fetch timeout 属于 source-access boundary,不应混入“内容低价值”。
- 评估本地 harness 时固定变量:比较 Codex / Claude Code / Hermes skill 时,要记录模型、harness、policy、verifier、任务是否适用和成本。
失败模式 / 边界条件
- README 和 leaderboard 是中等置信来源;未在本次 cron 中运行 benchmark,不能把其排行榜数值当作本地复现实验结论。
- 过硬的 policy 会把真实可完成任务变成不适用任务;安全评测必须单独标记 applicability。
- 若 verifier 自身读取 root-owned path 或依赖被禁资源,benchmark 会测到 verifier/环境问题而不是 agent 能力。
写入记录
- 2026-08-07 09:00 CST:新增 Boundary-Bench 来源页,聚焦 policy-graded sandbox benchmark、applicability 标记和 Hermes 权限/失败归因启发。