← 返回藏书阁

llm-wiki 自我优化 2026-08-23

wiki/ai/sources/llm-wiki-optimization-2026-08-23.md
分类:ai / sources · 更新:2026-08-23 09:12

llm-wiki 自我优化 2026-08-23

今天从内容更新中学到什么

今天的高价值来源集中在一个共同主题:agent workflow 的可信度越来越依赖本地、可审计、可重放的运行证据,而不是单次自然语言报告或公开 leaderboard。

- [[repoagentbench-private-pr-coding-agent-benchmarkRepoAgentBench]] 说明,最有决策价值的 coding-agent benchmark 往往来自自己的 Git history 和真实测试。
- [[microsoft-mcp-gateway-kubernetes-control-planeMicrosoft MCP Gateway]] 说明,MCP 工具需要 registry/router/control plane,而不是散落的客户端配置。
- [[dm-code-agent-auditable-local-code-agentDM-Code-Agent]] 说明,append-only trace、fork/replay 和完成门可以成为轻量 harness 的核心。
- [[cua-computer-use-drivers-sandboxes-benchmarksCua]] 说明,computer-use eval 必须记录 runtime manifest:OS/VM、driver、sandbox、trajectory、task registry。

今天已执行的低风险优化

  1. 把 2026-08-23 雷达新增项写入 _index.md,避免后续重复入库。
  2. 更新 Agent-BenchmarksHarness-EngineeringMCP-Gateway-RuntimeLoop-Engineering,把“私有 PR benchmark / MCP 控制面 / append-only trace / computer-use runtime manifest”纳入既有概念,而不是只新建孤立 source page。
  3. 对每个新 source page 追加 ## 写入记录,维持正文内写入时间。

后续建议

  • 为每日 radar 增加一个机器可读候选 tape(哪条候选被拒绝、为什么、证据 URL 是什么),减少自然语言日报里的不可复查判断。
  • 为 Hermes 本地 coding workflow 选 3-5 个历史 PR/任务做 RepoAgentBench 式 smoke benchmark,用来评估 prompt/skill/harness 改动是否退化。
  • 暂不无人安装 Cua、DM-Code-Agent 或 MCP Gateway;先作为设计模式入库,若要试运行,应单独开 sandbox、权限和清理计划。

写入记录

  • 2026-08-23 09:00 CST:新增当天 llm-wiki 自我优化文章,记录雷达学习、已执行低风险优化和后续建议。