← 返回藏书阁

AIShield — Agent tool/content security scanner

wiki/ai/sources/aishield-agent-tool-security-scanner.md
分类:ai / sources · 更新:2026-08-11 09:05

AIShield — Agent tool/content security scanner

一句话结论

AIShield 把 MCP server、agent skill、GPT/prompt 等 agent 可执行/半可执行资产当作供应链对象扫描,并提出“内容可信平面”与运行沙箱的分工。

为什么对用户重要

用户的 Hermes / llm-wiki 已经持续摄入外部 skills、MCP、guardrail 项目。AIShield 的价值在于提醒:外部 skill 不应只按 README、star 或自然语言说明判断,而要进入可扫描、可打分、可认证、可审计的准入流程。

机制 / 一阶原理

其一阶机制是把 agent 看到的工具描述、Markdown skill、MCP schema、prompt 片段都视为可能改变 agent 行为的程序输入;扫描器在执行前识别 prompt injection、越权访问、数据泄露、协议攻击、供应链风险和沙箱逃逸等风险。它强调运行时沙箱控制 blast radius,而内容安全平面控制“读进来的工具/skill 是否可信”。

与已有 wiki 概念的关系

它延续了 External-Agent-Skills-Design-Patterns 中“skill security lifecycle / lockfile / dynamic detonation”的方向,也和 Harness-Engineering 的 effect boundary、Context-Engineering 的 context governance 相连。与 2026-08-10 的 [[cyclops-deterministic-mcp-toxic-flow-proxyCyclops]]、[[provekit-mcp-redteam-hardened-mcp-serverProveKit MCP]] 相比,AIShield 更像资产准入扫描与市场认证层,而不是单次 MCP toxic-flow proxy。

对 Hermes / llm-wiki / agentic workflows 的启发

低风险可执行启发:llm-wiki 雷达在发现外部 skill/MCP 时增加“安全准入字段”:是否有可执行脚本、是否声明权限、是否访问网络/文件/环境变量、是否有规则/测试、是否只适合学习模式而不适合安装。Hermes skill 安装不应自动化跟随雷达;雷达只沉淀设计模式和风险点。

失败模式与边界

  • README 具有产品化/商业化叙事,214/220 规则、认证徽章、身份/支付/市场等声明需要独立复核。
  • 扫描规则若不透明,可能带来 false confidence:通过扫描不等于运行安全。
  • 对 Hermes 当前任务,适合入库为准入模式,不适合自动安装或授予执行权限。

深度判断

本条目晋升为正式 source page,因为它不只是新闻或工具列表,而是提供了可迁移到 Harness-EngineeringContext-EngineeringAgent-BenchmarksExternal-Agent-Skills-Design-Patterns 的结构性模式。当前置信度标为 medium:本次主要基于仓库 README 和 GitHub 元数据,尚未独立复现实验或安全声明。

相关页面

写入记录

  • 2026-08-11 09:00 CST:从 GitHub README 深度入库,提炼机制、实践启发、失败模式,并连接到既有 agent workflow / skill / benchmark 概念。