← 返回藏书阁

llm-wiki 自我优化 2026-08-22

wiki/ai/sources/llm-wiki-optimization-2026-08-22.md
分类:ai / sources · 更新:2026-08-22 09:08

llm-wiki 自我优化 2026-08-22

今日从雷达内容学到什么

今天入库的材料共同指向一个变化:AI/工程知识雷达不能只发现“新工具”,而要优先发现能让 workflow 可复现、可审计、可控、可评估的机制。[[llm-as-a-verifier-fine-grained-agent-verifierLLM-as-a-Verifier]] 强化结果/轨迹 verifier,[[Gate22-mcp-gateway-control-planeGate22]] 强化 MCP 工具控制面,[[OSWorld-V2-release-versioned-computer-use-benchmarkOSWorld-V2]] 和 [[WeaveBench-hybrid-gui-cli-agent-benchmarkWeaveBench]] 强化 computer-use 的版本化环境与跨通道状态验证,[[IssueBenchKit-private-repo-coding-agent-benchmarkIssueBenchKit]] / [[OpenBenchmark-trajectory-to-benchmarkOpenBenchmark]] 强化私有工作流 benchmark。

已做的低风险优化

  • 今日候选评分明确增加“是否有 verifier / release manifest / trajectory / cost / permission boundary”字段,避免把浅层工具介绍误晋升为正式 wiki 页面。
  • 更新核心概念页,使 Agent-BenchmarksHarness-EngineeringMCP-Gateway-RuntimeLoop-Engineering 都能从今天的新来源反向找到设计启发。
  • _index.md 增加 2026-08-22 雷达新增入口,减少后续重复发现和找不到页面的问题。

下一步应调整的雷达策略

  1. Agent benchmark 搜索 query 应长期包含:fine-grained verifier、trajectory judge、versioned release、private issue benchmark、cost accounting、hidden fixtures。
  2. MCP/control-plane 搜索 query 应从“gateway”扩展到:bundle、function allow-list、credential mode、tool diff、audit log、budget/quota。
  3. Computer-use 搜索 query 应优先找能提供 release manifest、trajectory viewer、跨 GUI/CLI 验证和 fabricated-evidence penalty 的来源。

风险与边界

  • GitHub API 今天触发 403 rate limit,后续应优先 raw.githubusercontent 或官网文档读取,必要时减少 API 搜索数量。
  • arXiv API 多次 timeout/429,今天未把 paper-level 数值 claims 作为高置信事实写入;正式页保持 confidence: medium
  • 今日新增页面较多,已执行向量重建;后续仍应用 vector coverage / targeted link check 监控重复或断链。

写入记录

  • 2026-08-22 09:30 CST:根据 2026-08-22 AI 雷达入库内容创建自我优化文章,记录已做低风险优化与后续雷达策略。