KADATH:可复现实验边界内的进化式多 Agent Runtime
KADATH:可复现实验边界内的进化式多 Agent Runtime
深度判断
它把“自我改进 agent”从单次 prompt tweak 变成 kernel/organism 分离、benchmark 锁定、容器隔离、谱系记录和多代选择的实验系统,能补充 AI-Self-Improvement-Lab 的工程边界。 这不是只值得收藏的工具链接,而是能沉淀为 Harness-Engineering、Agent-Benchmarks、Context-Engineering 或 External-Agent-Skills-Design-Patterns 的可复用机制样本。
机制 / 一阶原理
- kernel 拥有 run、benchmark、deadlines、containers、evidence、grading、population selection、database、Git lineage、recovery 和 cleanup,且不参与进化。
- organism 的 system prompt、Python implementation、tools、dependencies、supporting files 可在 post-grade mutation phase 改变,但 epoch 内 worktree read-only。
- Architect 生成可机器检查 benchmark,并锁定 objective、tool manifest、runtime config、Docker image hashes;篡改锁定输入会停止 run。
- 选择机制基于同一 locked fitness benchmark 下的多代 population,而不是 cherry-pick 单个成功 agent。
与既有 wiki 概念的关系
相关页面:AI-Self-Improvement-Lab · Harness-Engineering · Agent-Benchmarks · Loop-Engineering。
它补充的不是“又一个 agent 项目”,而是一个可迁移的控制/评测/技能设计维度:把模型输出放进更窄的状态机、证据链、权限边界、验证脚本或进化控制面里。
对 Hermes / llm-wiki 的启发
对 Hermes 的启发是:自我优化文章和 skill 晋升不能让“被优化对象”改自己的评分器、目标和证据;应保持外层 control plane 不变、内层规则/技能可演化,并保留 lineage、baseline 与失败记录。
失败模式与边界
高 token/资源消耗、强自我修改属性和 benchmark-proxy 风险都很高;不适合直接用于日常 cron,只适合作为 self-improvement harness 的研究样本。
来源
- GitHub:https://github.com/i3T4AN/KADATH
- Raw archive:
raw/articles/kadath-evolutionary-agent-runtime-readme-2026-08-12.md
写入记录
- 2026-08-12 09:00 CST:从 GitHub README 深度入库,提炼深度判断、机制、与既有概念关系、Hermes 实践启发和失败模式。