llm-wiki 自我优化 2026-08-24
llm-wiki 自我优化 2026-08-24
今天从内容更新中学到什么
今天入库的三个材料共同指向一个主题:llm-wiki radar 不应只靠更长 prompt 维持质量,而应逐步变成可评测、可观察、可删除规则的 loop。
| - [[agent-belt-black-box-cli-agent-benchmark | Agent Belt]] 提醒:评测对象要贴近真实运行的 agent CLI / skills / MCP / auth / workspace,而不是抽象模型能力。 |
| - [[aoi-dynacu-bench-dynamic-computer-use | AOI / DynaCU-Bench]] 提醒:长程 loop 的关键失败常来自 observation interface 不完整;对 radar 来说,中间候选、访问失败、写入 diff、验证输出也是 observation。 |
| - [[token-warden-benchmark-gated-agent-memory | Token Warden]] 提醒:自我优化规则和关注主题有长期上下文租金,不能每天只新增不删除。 |
今天已做的低风险优化
- 更新 Agent-Benchmarks,把黑盒 CLI 评测、动态观察 benchmark、benchmark-gated memory 纳入评测设计维度。
- 更新 Harness-Engineering,强调真实 CLI/harness eval、observation contract 和 context-rent治理。
- 更新 Loop-Engineering,把 daily radar 视为需要回归场景、候选 tape 和规则租金检查的长期 loop。
建议加入后续雷达 / 运维 backlog
- 构建最小
llm-wiki-radar-evalfixture:在临时 vault 上测试 orient、raw hash、promotion/rejection、index/log/write-record、claim receipts;先用 deterministic file checks,暂不接真实外网。 - 维护 candidate tape:每天保存轻量候选评分与拒绝理由,避免只在日报里写自然语言;可先放在
raw/notes/radar-candidates-YYYY-MM-DD.md,但不要晋升为正式页面。 - 月度规则租金检查:统计最近 30 天哪些关注主题反复产生低价值候选,哪些自我优化建议重复出现;对重复规则合并为 checklist,对低信号主题降权。
深度判断
这三项值得深挖,因为它们不是新闻或单工具介绍,而是分别补齐了评测对象、观察接口和上下文治理三个可迁移机制。它们能直接改进 Hermes / llm-wiki 的无人 loop:让日报质量可测、让中间状态可见、让长期规则可删除。
写入记录
- 2026-08-24 09:00 CST:新增当天 llm-wiki 自我优化文章,总结 Agent Belt、AOI/DynaCU-Bench、Token Warden 对 radar eval、candidate tape 和规则租金检查的启发。