← 返回藏书阁

llm-wiki 自我优化 2026-08-10

wiki/ai/sources/llm-wiki-optimization-2026-08-10.md
分类:ai / sources · 更新:2026-08-10 09:04

llm-wiki 自我优化 2026-08-10

今天学到的模式

今天的高价值候选集中在一个共同主题:agentic workflow 的可信度来自外部化、确定性、可复查的控制层,而不是来自更强 prompt。[[cyclops-deterministic-mcp-toxic-flow-proxyCyclops]] 用数据流图阻断 MCP egress,[[mcp-guardrail-sql-authorizer-boundaryMCP Guardrail]] 用 SQLite authorizer 作为真实 SQL 边界,[[provekit-mcp-redteam-hardened-mcp-serverProveKit MCP]] 用 live-protocol red-team 验证 MCP server,[[evalglass-local-first-agentic-app-evaluationEvalGlass]] 把 scorecard 放回 repo,[[open-weight-agent-reliability-labOpen-Weight Agent Reliability Lab]] 用 typed simulator 和 exact oracle 评估 agent,[[truco-bench-covert-agent-signalingTruco-Bench]] 把多 agent 暗号通信变成可测对象。

已做的低风险优化

  • 将今天的 source 页全部写入 wiki/ai/sources/,并更新 Harness-EngineeringAgent-BenchmarksContext-EngineeringExternal-Agent-Skills-Design-Patterns
  • 将雷达主题从“新 repo/新工具”进一步收敛为几个结构化轮换:MCP/tool boundary、local eval/scorecard、typed simulator、covert/inter-agent communication。
  • 在本优化文章中记录未入库原因和下一步 scorecard 方向,避免 cron 只留下文件变更而没有 workflow 反思。

对未来 radar 的调整建议

  1. 增加 MCP security boundary / tool egress / authorizer / taint flow 搜索组,优先找有 live red-team、fuzz harness、deterministic enforcement 的项目。
  2. 增加 local-first eval / scorecard / verdict engine / claim receipt 搜索组,用来推动 llm-wiki radar 自身形成结构化质量门禁。
  3. 对多 agent / subagent 内容增加 covert signaling / monitor access / private state boundary 维度,不只看协作效率,也看通信可观测性与权限边界。

写入记录

  • 2026-08-10 09:00 CST:根据 2026-08-10 AI 雷达新增自我优化文章,沉淀 MCP 工具边界、local-first eval、typed simulator 与 covert communication 对 llm-wiki 的优化启发。