AIShield — Agent tool/content security scanner
AIShield — Agent tool/content security scanner
一句话结论
AIShield 把 MCP server、agent skill、GPT/prompt 等 agent 可执行/半可执行资产当作供应链对象扫描,并提出“内容可信平面”与运行沙箱的分工。
为什么对用户重要
用户的 Hermes / llm-wiki 已经持续摄入外部 skills、MCP、guardrail 项目。AIShield 的价值在于提醒:外部 skill 不应只按 README、star 或自然语言说明判断,而要进入可扫描、可打分、可认证、可审计的准入流程。
机制 / 一阶原理
其一阶机制是把 agent 看到的工具描述、Markdown skill、MCP schema、prompt 片段都视为可能改变 agent 行为的程序输入;扫描器在执行前识别 prompt injection、越权访问、数据泄露、协议攻击、供应链风险和沙箱逃逸等风险。它强调运行时沙箱控制 blast radius,而内容安全平面控制“读进来的工具/skill 是否可信”。
与已有 wiki 概念的关系
| 它延续了 External-Agent-Skills-Design-Patterns 中“skill security lifecycle / lockfile / dynamic detonation”的方向,也和 Harness-Engineering 的 effect boundary、Context-Engineering 的 context governance 相连。与 2026-08-10 的 [[cyclops-deterministic-mcp-toxic-flow-proxy | Cyclops]]、[[provekit-mcp-redteam-hardened-mcp-server | ProveKit MCP]] 相比,AIShield 更像资产准入扫描与市场认证层,而不是单次 MCP toxic-flow proxy。 |
对 Hermes / llm-wiki / agentic workflows 的启发
低风险可执行启发:llm-wiki 雷达在发现外部 skill/MCP 时增加“安全准入字段”:是否有可执行脚本、是否声明权限、是否访问网络/文件/环境变量、是否有规则/测试、是否只适合学习模式而不适合安装。Hermes skill 安装不应自动化跟随雷达;雷达只沉淀设计模式和风险点。
失败模式与边界
- README 具有产品化/商业化叙事,214/220 规则、认证徽章、身份/支付/市场等声明需要独立复核。
- 扫描规则若不透明,可能带来 false confidence:通过扫描不等于运行安全。
- 对 Hermes 当前任务,适合入库为准入模式,不适合自动安装或授予执行权限。
深度判断
本条目晋升为正式 source page,因为它不只是新闻或工具列表,而是提供了可迁移到 Harness-Engineering、Context-Engineering、Agent-Benchmarks 或 External-Agent-Skills-Design-Patterns 的结构性模式。当前置信度标为 medium:本次主要基于仓库 README 和 GitHub 元数据,尚未独立复现实验或安全声明。
相关页面
- External-Agent-Skills-Design-Patterns
- Harness-Engineering
- Context-Engineering
- cyclops-deterministic-mcp-toxic-flow-proxy
写入记录
- 2026-08-11 09:00 CST:从 GitHub README 深度入库,提炼机制、实践启发、失败模式,并连接到既有 agent workflow / skill / benchmark 概念。