llm-wiki 自我优化 2026-08-23
llm-wiki 自我优化 2026-08-23
今天从内容更新中学到什么
今天的高价值来源集中在一个共同主题:agent workflow 的可信度越来越依赖本地、可审计、可重放的运行证据,而不是单次自然语言报告或公开 leaderboard。
| - [[repoagentbench-private-pr-coding-agent-benchmark | RepoAgentBench]] 说明,最有决策价值的 coding-agent benchmark 往往来自自己的 Git history 和真实测试。 |
| - [[microsoft-mcp-gateway-kubernetes-control-plane | Microsoft MCP Gateway]] 说明,MCP 工具需要 registry/router/control plane,而不是散落的客户端配置。 |
| - [[dm-code-agent-auditable-local-code-agent | DM-Code-Agent]] 说明,append-only trace、fork/replay 和完成门可以成为轻量 harness 的核心。 |
| - [[cua-computer-use-drivers-sandboxes-benchmarks | Cua]] 说明,computer-use eval 必须记录 runtime manifest:OS/VM、driver、sandbox、trajectory、task registry。 |
今天已执行的低风险优化
- 把 2026-08-23 雷达新增项写入
_index.md,避免后续重复入库。 - 更新 Agent-Benchmarks、Harness-Engineering、MCP-Gateway-Runtime、Loop-Engineering,把“私有 PR benchmark / MCP 控制面 / append-only trace / computer-use runtime manifest”纳入既有概念,而不是只新建孤立 source page。
- 对每个新 source page 追加
## 写入记录,维持正文内写入时间。
后续建议
- 为每日 radar 增加一个机器可读候选 tape(哪条候选被拒绝、为什么、证据 URL 是什么),减少自然语言日报里的不可复查判断。
- 为 Hermes 本地 coding workflow 选 3-5 个历史 PR/任务做 RepoAgentBench 式 smoke benchmark,用来评估 prompt/skill/harness 改动是否退化。
- 暂不无人安装 Cua、DM-Code-Agent 或 MCP Gateway;先作为设计模式入库,若要试运行,应单独开 sandbox、权限和清理计划。
写入记录
- 2026-08-23 09:00 CST:新增当天 llm-wiki 自我优化文章,记录雷达学习、已执行低风险优化和后续建议。