← 返回藏书阁llm-wiki 自我优化 2026-08-22
llm-wiki 自我优化 2026-08-22
今日从雷达内容学到什么
| 今天入库的材料共同指向一个变化:AI/工程知识雷达不能只发现“新工具”,而要优先发现能让 workflow 可复现、可审计、可控、可评估的机制。[[llm-as-a-verifier-fine-grained-agent-verifier | LLM-as-a-Verifier]] 强化结果/轨迹 verifier,[[Gate22-mcp-gateway-control-plane | Gate22]] 强化 MCP 工具控制面,[[OSWorld-V2-release-versioned-computer-use-benchmark | OSWorld-V2]] 和 [[WeaveBench-hybrid-gui-cli-agent-benchmark | WeaveBench]] 强化 computer-use 的版本化环境与跨通道状态验证,[[IssueBenchKit-private-repo-coding-agent-benchmark | IssueBenchKit]] / [[OpenBenchmark-trajectory-to-benchmark | OpenBenchmark]] 强化私有工作流 benchmark。 |
已做的低风险优化
下一步应调整的雷达策略
- Agent benchmark 搜索 query 应长期包含:fine-grained verifier、trajectory judge、versioned release、private issue benchmark、cost accounting、hidden fixtures。
- MCP/control-plane 搜索 query 应从“gateway”扩展到:bundle、function allow-list、credential mode、tool diff、audit log、budget/quota。
- Computer-use 搜索 query 应优先找能提供 release manifest、trajectory viewer、跨 GUI/CLI 验证和 fabricated-evidence penalty 的来源。
风险与边界
- GitHub API 今天触发 403 rate limit,后续应优先 raw.githubusercontent 或官网文档读取,必要时减少 API 搜索数量。
- arXiv API 多次 timeout/429,今天未把 paper-level 数值 claims 作为高置信事实写入;正式页保持
confidence: medium。
- 今日新增页面较多,已执行向量重建;后续仍应用 vector coverage / targeted link check 监控重复或断链。
写入记录
- 2026-08-22 09:30 CST:根据 2026-08-22 AI 雷达入库内容创建自我优化文章,记录已做低风险优化与后续雷达策略。