← 返回藏书阁

llm-wiki 自我优化 2026-08-24

wiki/ai/sources/llm-wiki-optimization-2026-08-24.md
分类:ai / sources · 更新:2026-08-24 09:08

llm-wiki 自我优化 2026-08-24

今天从内容更新中学到什么

今天入库的三个材料共同指向一个主题:llm-wiki radar 不应只靠更长 prompt 维持质量,而应逐步变成可评测、可观察、可删除规则的 loop。

- [[agent-belt-black-box-cli-agent-benchmarkAgent Belt]] 提醒:评测对象要贴近真实运行的 agent CLI / skills / MCP / auth / workspace,而不是抽象模型能力。
- [[aoi-dynacu-bench-dynamic-computer-useAOI / DynaCU-Bench]] 提醒:长程 loop 的关键失败常来自 observation interface 不完整;对 radar 来说,中间候选、访问失败、写入 diff、验证输出也是 observation。
- [[token-warden-benchmark-gated-agent-memoryToken Warden]] 提醒:自我优化规则和关注主题有长期上下文租金,不能每天只新增不删除。

今天已做的低风险优化

  1. 更新 Agent-Benchmarks,把黑盒 CLI 评测、动态观察 benchmark、benchmark-gated memory 纳入评测设计维度。
  2. 更新 Harness-Engineering,强调真实 CLI/harness eval、observation contract 和 context-rent治理。
  3. 更新 Loop-Engineering,把 daily radar 视为需要回归场景、候选 tape 和规则租金检查的长期 loop。

建议加入后续雷达 / 运维 backlog

  1. 构建最小 llm-wiki-radar-eval fixture:在临时 vault 上测试 orient、raw hash、promotion/rejection、index/log/write-record、claim receipts;先用 deterministic file checks,暂不接真实外网。
  2. 维护 candidate tape:每天保存轻量候选评分与拒绝理由,避免只在日报里写自然语言;可先放在 raw/notes/radar-candidates-YYYY-MM-DD.md,但不要晋升为正式页面。
  3. 月度规则租金检查:统计最近 30 天哪些关注主题反复产生低价值候选,哪些自我优化建议重复出现;对重复规则合并为 checklist,对低信号主题降权。

深度判断

这三项值得深挖,因为它们不是新闻或单工具介绍,而是分别补齐了评测对象、观察接口和上下文治理三个可迁移机制。它们能直接改进 Hermes / llm-wiki 的无人 loop:让日报质量可测、让中间状态可见、让长期规则可删除。

写入记录

  • 2026-08-24 09:00 CST:新增当天 llm-wiki 自我优化文章,总结 Agent Belt、AOI/DynaCU-Bench、Token Warden 对 radar eval、candidate tape 和规则租金检查的启发。