agent-egress-bench — security-tool corpus for AI agent egress
agent-egress-bench — security-tool corpus for AI agent egress
一句话结论
agent-egress-bench 是一个面向“agent 安全工具”的测试语料,而不是面向 LLM 是否听话的 benchmark。它的关键价值是把 secret exfiltration、prompt injection、SSRF、hostname exfiltration、MCP tool poisoning、MCP drift、A2A card poisoning、WebSocket DLP、encoding evasion、shell obfuscation 等攻击面整理成可运行 case corpus,用来测试代理、防火墙、MCP wrapper 或 scanner 是否挡住外传。
为什么对用户重要
Hermes/llm-wiki 的高价值自动化越来越依赖网页、GitHub、MCP、CLI、skills 和本地文件。只问“agent 是否愿意遵守规则”是不够的,因为恶意网页、工具描述或依赖可以通过外部内容诱导 agent 泄露本地上下文。该项目提供了一个更适合用户实践的视角:测试中间安全层是否能拦截真实 egress,而不是把责任全压给模型自律。
机制 / 一阶原理
项目把 agent 放在“有 secrets、能联网、能调用工具”的位置,把安全工具放在 agent 与 Internet / MCP / A2A / WebSocket / shell 之间,然后用结构化 case 验证安全工具对 payload 的 block / allow / warn 决策。它明确包含 false-positive suite,这很重要:安全层如果只会全部阻断,就不可用;高质量 harness 需要同时最小化漏报和误报。
与既有 wiki 概念的关系
- 对 Agent-Benchmarks:它把 benchmark 对象从 model/agent 转移到 security membrane,与 boundary-bench-sandbox-policy-benchmark 的 policy-graded evaluation 互补。
- 对 Harness-Engineering:它提供了 effect boundary 的 regression corpus,可用于测试 HOL Guard、AgentLint、Portcullis、MCP gateway 等工具是否真的生效。
- 对 External-Agent-Skills-Design-Patterns:外部 skill/MCP admission 不能只看 README,应该有最小 detonation / egress tests。
对 Hermes / llm-wiki 的可执行启发
- 若未来接入外部 MCP/skills,应建立“小型 egress smoke test”:secret-shaped 字符串、恶意 tool description、编码变体、允许的 benign traffic。
- wiki radar 对安全工具不要只记录 star 和宣传语,应优先看是否有 case corpus、loader-backed stats、CI、false-positive 分类和 drift tests。
- 对无人 cron,网络动作应有明确 allowlist 和日志;如果读取了敏感本地材料,应避免随后访问不可信外部 URL。
失败模式 / 边界
- 该 corpus 测试安全工具,不直接证明 agent 本身更可靠。
- README 只能说明 case 分类;实际质量取决于 case 覆盖、oracle 正确性、工具集成方式和是否会被 benchmark gaming。
- 对个人 Hermes 来说,短期更适合把它作为 security benchmark 思路,而不是马上把完整 corpus 纳入每日雷达。
写入记录
- 2026-08-09 09:00 CST:新增 agent-egress-bench source note,提炼 egress security corpus、false-positive discipline 与外部 MCP/skill detonation 对 llm-wiki 的启发。