AgentLock — provenance-based pre-action authorization
AgentLock — provenance-based pre-action authorization
深度判断
结论:晋升为正式 source page。 AgentLock 值得深挖,因为它把 prompt injection 防御从内容过滤转成 provenance 授权:不是判断一句话是否恶意,而是判断行动参数和 session 状态是否受到不可信来源污染。这个思路能直接改进 Hermes 的无人任务:当网页、issue、README、邮件等 untrusted context 进入 session 后,后续写文件、发消息、联网、删除或部署动作不应再只依赖模型自我约束。
机制 / 一阶原理
它给进入 context window 的内容标注 authoritative、derived、untrusted 权威来源,并用 session write-gate、parameter lineage、deferred commit 与 selective action-class gating 控制 consequential actions。特别重要的是 gate 不读取 payload 文本,而看“这个参数值从哪里来、用户是否授权过、动作类别是否只能靠阻断防御”。README 还给出 AgentDojo 上的攻防数据,并坦率承认 Slack benign utility 的成本。
与已有 wiki 概念的关系
它补强 Harness-Engineering 中 dataflow/taint state 的行动边界,也补充 Agent-Benchmarks 对 benign ceiling、attack success、defense-effective success 分开报告的要求;与 Context-Engineering 的 context provenance 和 External-Agent-Skills-Design-Patterns 的 permission manifest 同属一个主题。
相关页面:Harness-Engineering · Context-Engineering · Agent-Benchmarks · prismor-runtime-control-plane
对 Hermes / llm-wiki / agentic workflows 的启发
对 llm-wiki/Hermes 的启发:每日 radar 读取未验证 README 或网页后,若随后要安装 skill、执行仓库脚本、发布文章或发送外部消息,应把“来源污染”作为 action gate 输入;最终报告中也应区分从用户指令来的目标、从外部来源来的候选建议、以及 agent 自己综合的推断。
失败模式、边界条件与未解问题
失败模式:过于保守的 provenance gate 会牺牲实用性,尤其是真实任务常需要读第三方内容后执行 value-carrying writes;parameter lineage 依赖工具/调用方如实记录来源,若 host 没有记录能力就会失效;文本输出型 persuasion 不一定有 tool call 可拦截。
来源与证据
- GitHub: https://github.com/webpro255/agentlock
- Stars at ingest: 19
- Last pushed at ingest: 2026-08-12T14:34:40Z
- Raw archive: agentlock-provenance-action-gate-readme-2026-08-13
写入记录
- 2026-08-13 09:00 CST:从 GitHub README 深度入库,新增 source page、raw archive,并关联 harness/context/benchmark/skill 设计模式。