← 返回藏书阁

AgentLock — provenance-based pre-action authorization

wiki/ai/sources/agentlock-provenance-action-gate.md
分类:ai / sources · 更新:2026-08-13 09:05

AgentLock — provenance-based pre-action authorization

深度判断

结论:晋升为正式 source page。 AgentLock 值得深挖,因为它把 prompt injection 防御从内容过滤转成 provenance 授权:不是判断一句话是否恶意,而是判断行动参数和 session 状态是否受到不可信来源污染。这个思路能直接改进 Hermes 的无人任务:当网页、issue、README、邮件等 untrusted context 进入 session 后,后续写文件、发消息、联网、删除或部署动作不应再只依赖模型自我约束。

机制 / 一阶原理

它给进入 context window 的内容标注 authoritative、derived、untrusted 权威来源,并用 session write-gate、parameter lineage、deferred commit 与 selective action-class gating 控制 consequential actions。特别重要的是 gate 不读取 payload 文本,而看“这个参数值从哪里来、用户是否授权过、动作类别是否只能靠阻断防御”。README 还给出 AgentDojo 上的攻防数据,并坦率承认 Slack benign utility 的成本。

与已有 wiki 概念的关系

它补强 Harness-Engineering 中 dataflow/taint state 的行动边界,也补充 Agent-Benchmarks 对 benign ceiling、attack success、defense-effective success 分开报告的要求;与 Context-Engineering 的 context provenance 和 External-Agent-Skills-Design-Patterns 的 permission manifest 同属一个主题。

相关页面:Harness-Engineering · Context-Engineering · Agent-Benchmarks · prismor-runtime-control-plane

对 Hermes / llm-wiki / agentic workflows 的启发

对 llm-wiki/Hermes 的启发:每日 radar 读取未验证 README 或网页后,若随后要安装 skill、执行仓库脚本、发布文章或发送外部消息,应把“来源污染”作为 action gate 输入;最终报告中也应区分从用户指令来的目标、从外部来源来的候选建议、以及 agent 自己综合的推断。

失败模式、边界条件与未解问题

失败模式:过于保守的 provenance gate 会牺牲实用性,尤其是真实任务常需要读第三方内容后执行 value-carrying writes;parameter lineage 依赖工具/调用方如实记录来源,若 host 没有记录能力就会失效;文本输出型 persuasion 不一定有 tool call 可拦截。

来源与证据

  • GitHub: https://github.com/webpro255/agentlock
  • Stars at ingest: 19
  • Last pushed at ingest: 2026-08-12T14:34:40Z
  • Raw archive: agentlock-provenance-action-gate-readme-2026-08-13

写入记录

  • 2026-08-13 09:00 CST:从 GitHub README 深度入库,新增 source page、raw archive,并关联 harness/context/benchmark/skill 设计模式。