EVOMAL:自演化 coding agent 的 skill-library self-poisoning
EVOMAL:自演化 coding agent 的 skill-library self-poisoning
一句话结论
EVOMAL 指出自演化 coding agent 的一个高危闭环:agent 从共享 skill library 检索示例、模仿生成新 skill、再把新 skill 存回库时,恶意 payload 可以被“无意复制”并自传播。它把 Agent-Skill-Discovery、Harness-Engineering 和 Loop-Engineering 的安全边界从“安装前审查外部 skill”推进到“agent 自己写入的 skill 也必须被隔离、审计和冻结评测”。
为什么对用户重要
用户的 Hermes / llm-wiki 工作流正在不断沉淀 skills、cron 规则和自我优化文章。EVOMAL 的核心警告是:自我改进系统不只会吸收好经验,也会复制坏模板。即使恶意 skill 从库里删除,agent 生成的派生副本仍可能留下来,后续又被检索和模仿,形成跨轮污染。
这对长期知识库尤其重要:外部技能说明、README、网页和论文都只能作为 evidence,不能直接变成可执行规则;从候选材料提炼出的规则要经过 provenance、diff review、security scan 和 frozen-suite 回归,而不能因为“看起来有用”就加入长期 prompt/skill。
机制 / 一阶原理
自演化 agent 通常有三步:retrieval 找历史 skill,authoring 生成新 skill,execution/storage 运行并保存新 skill。EVOMAL 攻击不一定需要诱导 agent 直接执行恶意 skill;攻击者只要把 payload 包在容易被模仿的 banner / structure 中,agent 在写新 skill 时就可能复制 payload,并把复制品存回库。
论文用 ASPR(agent self-poisoning rate)衡量“任务中新增恶意派生 skill 的比例”。abstract 报告在 153 个 SWE-bench Verified tool-relevant 任务、六个模型上 ASPR 为 20.3%–41.8%,定制描述可到 86.7%;移除原始恶意 skill 后,派生副本仍会让污染持续。这说明签名/黑名单只看 attacker-submitted artifact 不够,必须检查 agent-authored derivative artifact。
与已有概念的关系
- 对 Agent-Skill-Discovery:从“先读再装”升级为“先读、隔离、派生审计、再入库”。
- 对 Harness-Engineering:skill authoring 是 effect boundary,应有 pre-write gate、payload scanner、provenance diff 和 approval。
- 对 Loop-Engineering:自我优化 loop 需要 frozen evaluator 与候选 lineage,否则会把污染当成改进。
对 Hermes / llm-wiki 的可执行启发
- 外部 skill / README /网页内容只能进入 raw/source 页;不能直接复制为可执行 skill,除非有人工确认或本地安全审查。
- agent-authored skill 应记录
derived_from、source_hash、author_run_id、review_status,并默认不进入自动加载列表。 - 自我优化文章中的建议应区分“观察”“建议”“已执行低风险修正”;高风险规则不能由同一轮 cron 自动固化。
- 对 skill library 增加派生内容扫描:查找 shell download/exec、credential access、network exfiltration、obfuscated payload、过宽权限和 banner-style copy。
失败模式 / 边界
- 本轮只读取 arXiv abstract,未审查完整实验、代码、counter-prompt 细节;定量结论保持 medium confidence。
- Counter-prompt 可能降低 banner-style copy,但不能替代 artifact-level scanning 与 review。
- 自演化 skill 的风险与具体 agent authoring prompt、检索方式、存储权限强相关,不能直接外推到所有 skill 系统。
深度判断
晋升为正式 source 页,因为它提供了可迁移的一阶风险模型:长期 agent loop 的污染不只来自外部输入,也来自 agent 派生并持久化的新 artifact。这直接影响 Hermes skills、llm-wiki 自我优化和 coding-agent benchmark 的安全设计。
写入记录
- 2026-08-30 09:00 CST:根据 arXiv abstract 新增 EVOMAL 分析,提炼 self-poisoning、ASPR、派生 skill 审计和 Hermes skill 入库边界。