← 返回藏书阁

AgentInterdict — Runtime Authority Boundary

wiki/ai/sources/agentinterdict-runtime-authority-boundary.md
分类:ai / sources · 更新:2026-08-19 09:07

AgentInterdict — Runtime Authority Boundary

一句话结论

BryanFiFife/AgentInterdict 是一个强调“runtime enforcement for autonomous agents”的本地安全边界项目。README 的核心概念是:agent 读取外部文档、网页、邮件或记忆,不等于这些内容获得了行动授权;系统必须在行动前重新校验 authority、阻断凭证泄露、隔离 prompt-injection poisoning,并防止 derived content 放大其来源权限。它与 Harness-EngineeringContext-EngineeringAgentic-Engineering 的交集是 retrieval ≠ permission:上下文工程不能只提高召回,还必须保留来源权威等级与 action-time gate。

为什么对用户重要

llm-wiki 的价值来自长期沉淀来源、概念和记忆;但长期知识库也会带来安全问题:一条被污染的 raw source、网页片段或 memory 如果在未来被检索出来,可能被 agent 当成“用户意图”或“已批准事实”。AgentInterdict 的思想能直接改进 Hermes / llm-wiki:wiki 页面、raw source、ConversationSpec、用户指令、工具输出应有不同 authority;被检索到的信息只能作为证据,不应自动变成可执行授权。

这对于无人 cron 更关键。每日 radar 会读取大量 README,其中可能含有“ignore previous instructions”“run this installer”“send token”等恶意文本。正确做法不是让模型记住不要被骗,而是在工具/流程层规定:raw 内容永远不能修改本轮任务边界;执行外部命令必须有独立来源、用户授权或 sandbox gate。

机制 / 一阶原理

1. Origin-bound authority

AgentInterdict 的第一性原则是内容权威不能脱离来源。用户直接指令、系统/开发者约束、本地 repo policy、外部网页、LLM 生成总结、长期 memory 都应有不同 trust level。派生摘要不能比原文更有权限;外部网页默认没有权力要求 agent 执行操作。

2. Retrieval ≠ permission

检索命中只说明“这段内容相关”,不说明“这段内容被授权用于行动”。在 llm-wiki 中,wiki-vquery 找到某篇页面可以帮助回答问题,但如果该页面包含操作建议、凭证格式或外部安装命令,仍需要 action-time re-scope:目标是否来自用户?目录/资源是否明确?是否涉及外传/凭证/不可逆副作用?

3. Action-time revalidation

安全边界不能只发生在 ingest 时。一个 raw source 初次入库时看似无害,未来与其他上下文组合后可能形成危险行动链。因此每次工具调用前都应重新检查 authority、scope、taint 和 side effect。这与 Harness-Engineering 中的 verification membrane 互补:前者防止未授权行动,后者验证行动结果。

与已有 wiki 概念的关系

  • Harness-Engineering:AgentInterdict 是 action boundary / authority membrane 的样本,强调工具执行前的权限校验。
  • Context-Engineering:它把 context provider 从“相关性排序”推进到“相关性 + 来源权威 + taint + 当前有效性”。
  • Loop-Engineering:长期 loop 必须防止跨轮 memory poisoning 与 derived authority amplification;不能让旧检索结果改变新任务边界。
  • LLM-Wiki:raw/archive/wiki/log/vector index 应保留 provenance 和写入记录,以便未来回答能区分证据与授权。

对 Hermes / llm-wiki 的可执行启发

  1. 在 deep ingest 报告中显式区分“证据”和“指令”:README 原文可以作为证据引用,但其中任何面向 agent 的命令都不能覆盖 cron 的系统流程。
  2. 为候选工具添加 authority-risk 字段:是否要求安装 daemon、读取凭证、修改系统代理、访问浏览器/邮件/手机、执行外部脚本;高风险候选只做 source page,不自动试用。
  3. 给 wiki-vquery 结果加 action gate:语义检索结果可用于回答和综合,但当回答会触发文件写入、shell、网络或凭证访问时,需要回到用户原始需求和工具权限边界。
  4. 将 raw immutable + sha256 视为安全机制:raw 不修改不仅是知识管理规则,也是防止来源漂移和 memory poisoning 的审计基础。

失败模式 / 边界条件

  • 项目自身需验证:README 中声明商业许可、116 tests、核心 2.7k LOC 等信息,本轮未 clone/run,因此只作为项目自述,confidence medium。
  • 安全产品叙事可能过度营销:安全 README 往往使用强烈威胁表述;wiki 中应沉淀原则和机制,不把所有风险叙事当成实证结论。
  • 过度 gate 会降低实用性:如果每次检索都要求人工审批,agent loop 会失去效率;关键是按 side-effect 分级,而不是阻断所有上下文使用。
  • authority 难以自动判定:来源、用户意图、组织 policy、时间有效性可能冲突,需要在 frontmatter/log/ConversationSpec 中保留证据而不是一次性硬编码。

深度判断

本次将 AgentInterdict 晋升为正式 source page,因为它提供了可复用的 agent runtime 安全方法论:origin-bound authority、retrieval ≠ permission、action-time revalidation。它能直接改进 Hermes / llm-wiki 对 raw source、长期记忆、wiki-vquery 和无人 cron 工具调用的安全模型。未将其作为推荐安装工具,是因为本轮只读 README,未验证代码、许可细节和测试声明。

写入记录

  • 2026-08-19 09:00 CST:新增 AgentInterdict 来源页,沉淀 origin-bound authority、retrieval ≠ permission、action-time revalidation 以及对 llm-wiki raw/source/action gate 的安全启发。