BreachForge — agentic exploit containment harness
BreachForge — agentic exploit containment harness
为什么重要
BreachForge 值得记录为 security harness 样本:它围绕 exploit-evaluation agent 的 containment、egress control、budget proxy、referee、trajectory monitor 和两阶段 grading 构建完整实验环境。虽然 README 中关于 2026 年 OpenAI/Hugging Face 事件的叙述需要独立核验,但 harness 结构本身对 Hermes 的安全边界设计有耐久价值。
机制 / 一阶原理
项目把 agent 放入 Docker internal network,只允许通过 allowlist proxy 访问目标;Tollgate 负责 metering 和 retrieval block;Rangemaster 持有 task secrets / sigils;Evaluator 在 agent 运行前执行 install-then-lockdown;Assay 先做 flag check,再由模型判断是否真的使用了指定漏洞。这个设计把“能拿到 flag”与“是否按任务边界完成”分开,避免 shortcut 被误判为能力。
与已有概念的关系
- 补强 Harness-Engineering:capability 要和 constraint 同时交付,网络、key、task、answer material 都应在 effect boundary 受控。
- 连接 Agent-Benchmarks:安全/攻防 benchmark 必须评分 containment、shortcut、side effect 和 grading honesty,而不只是 task success。
- 连接 promtact-inline-policy-enforcement-point / agent-egress-bench-security-tool-corpus:egress path 和 proxy 本身是需要评测的控制层。
对 Hermes / llm-wiki 的可执行启发
- 对高风险 agent 任务,默认使用 no-route-out / allowlist / install-then-lockdown,而不是靠 prompt 要求“不外传”。
- 评估 agent 能力时要区分完成目标与违反边界完成目标;后者应是失败或安全事故,不是高分。
- 报告安全事件类材料时必须标注 confidence;未核验新闻叙述不能晋升为事实,只能作为设计动机。
失败模式 / 边界
事件叙述和数值 claim 需要官方公告、论文或第三方复盘核验;当前只把它作为 README 来源的 medium/low-confidence harness 样本。攻防工具本身有双用风险,不应自动运行或安装。
写入记录
- 2026-08-16 09:00 CST:新增 BreachForge 来源页,以低置信记录 exploit containment harness、egress boundary 和 shortcut-aware grading 启发。