RSIHub:Frozen Evaluator 驱动的 Agent 自我改进工作区
RSIHub:Frozen Evaluator 驱动的 Agent 自我改进工作区
一句话结论
| [[rsihub-frozen-evaluator-agent-self-improvement | RSIHub]] 值得入库,因为它把“agent 自我改进”从玄学口号收敛为文件化实验工作区:候选可变、evaluator 冻结、结果由机制盖章、报告从 archive records 重算。这正好对应 Loop-Engineering 和 Harness-Engineering 里反复出现的难题:系统能改进自己,但不能让候选同时改写评分规则或篡改改进证据。 |
为什么对用户重要
用户的 llm-wiki radar 已经每天生成“自我优化文章”。这类自我优化如果没有冻结评测、候选 lineage 和证据归档,很容易退化成规则膨胀:每天都新增一条看似合理的经验,但没有证明它提升了后续 ingest 质量,也没有证明它没有破坏旧能力。
RSIHub 提供一个可迁移的最低原则:
- 每个 experiment 是独立 Git repository。
- Generation tag 标记候选快照。
archive.jsonl记录 stamped outcomes。- Evaluator 在候选可变面之外。
- 报告从 stamped archive 重算,而不是相信 operator claim。
这对 Hermes 比“递归自我改权重”更现实:先让 workflow、prompt、skill、radar query、页面模板在受控 evaluator 下迭代。
机制 / 一阶原理
自我改进系统的核心风险是 Goodhart 与 evaluator tampering:如果候选能修改评分器、测试集、结果文件或报告生成逻辑,就无法区分真实改进和对评测的投机。RSIHub 的设计把 mutable surface 和 scoring mechanism 分开:operator 可以生成/修改候选,但 canonical evaluation 在 clean candidate snapshot 上运行;scores/status 由机制写入;报告基于 archive records 重算。
它支持的 recipe(A-Evolve、AHE、GEPA、Hill Climb、HyperAgents 等)不重要,重要的是共同的实验合同:候选如何产生可以变化,但 evaluator、lineage、artifact record 和 status stamping 必须稳定。
与既有 wiki 概念的关系
- 与 Loop-Engineering:给长期 loop 的“改进下一轮”提供冻结评测与 lineage 边界。
- 与 Harness-Engineering:把自我优化 harness 化,明确候选、执行、验证、归档和报告的责任边界。
- 与 Agent-Benchmarks:强调 benchmark 不只是外部排行榜,也可以是本地 workflow 的 frozen eval suite。
- 与 AI-Self-Improvement-Lab:可作为“先改 workflow/skill,再谈模型自改”的工程基底。
可执行启发
- llm-wiki radar 的自我优化不应只写建议;应维护一个小型 frozen suite,例如:模拟 3 个候选源、1 个重复页风险、1 个网页失败、1 个 raw-only 降级,检查 radar 是否 orient、打分、写 raw、拒绝/晋升、更新 index/log/write-record。
- 每条新增 radar 规则要有
intended failure mode和evidence of benefit;没有证据的规则应进入月度 rule-rent review。 - 对 prompt/skill/query 的变更应记录 generation tag 或至少记录日期、变更原因、受影响阶段和回滚方式。
- 最终报告应从文件/命令 receipts 生成或抽查,而不是完全依赖模型最后一段总结。
失败模式 / 边界条件
- README 显示 RSIHub 是框架级项目,但本轮未实际运行 experiment;因此 confidence 为 medium。
- Frozen evaluator 会防止一类投机,但也可能让系统过拟合固定 suite;需要定期加入新任务并保留旧任务回归。
- 文件化实验适合 prompt/skill/workflow;不应在无人 cron 中自动改写 Hermes runtime、凭据或 gateway 配置。
写入记录
- 2026-08-26 09:01 CST:根据 simple-agent-lab/RSIHub README 与 docs index 新增 source 页,提炼 frozen evaluator、candidate lineage、archive records 和对 llm-wiki radar 自我优化的启发。