← 返回藏书阁

llm-wiki 自我优化 2026-09-02

wiki/ai/sources/llm-wiki-optimization-2026-09-02.md
分类:ai / sources · 更新:2026-09-02 09:08

llm-wiki 自我优化 2026-09-02

今天学到的东西

今天入库的四个来源把雷达从“发现单个工具/benchmark”推进到一个更清楚的系统合同:长期 agent workflow 需要同时管理 工具面、凭据面、验证面、环境面

- [[moor-local-mcp-gateway-managerMoor]] 提醒:本地开发者机器也会形成 MCP 工具面蔓延,需要 Profile、inventory 和 audit,不只是企业网关才需要控制面。
- [[bromure-agentic-coding-sandboxBromure Agentic Coding]] 提醒:真实凭据不应进入 agent 可读环境,应该在 VM / proxy / gateway 边界按目的地、TTL、consent 注入。
- [[da-verify-programmatic-verification-harnessda-verify]] 提醒:LLM self-check 不等于验证;可程序检查任务里,独立样本 + programmatic agreement gate 更接近可靠 verifier。
- [[cuarena-instrumented-computer-use-environmentsCUArena]] 提醒:computer-use 环境必须 reset / observe / grade,UI clone 没有 log contract 和 rubric 就不能成为可靠 benchmark。

这四点合起来说明:llm-wiki 的 AI 雷达不应只问“今天有没有新项目”,而应问候选是否补充了某个控制边界。今天四个候选分别覆盖本地 gateway、沙箱/凭据、安全执行、程序化验证、computer-use 环境合同,属于高权重主题的机制补全。

已执行的低风险优化

  1. 新增 4 个 source 页,并在每页末尾添加 ## 写入记录:Moor、Bromure、da-verify、CUArena。
  2. 更新 MCP-Gateway-Runtime:加入本地 MCP gateway / Profile / audit 维度,和 ContextForge 的企业联邦控制面形成谱系。
  3. 更新 Harness-Engineering:把程序化验证、凭据边界注入、本地工具 profile 统一到 effect-boundary harness 原则。
  4. 更新 Agent-Benchmarks:强调 verifier 与环境合同,补充 da-verify 与 CUArena 对重复、程序化评分、reset/observe/grade 的启发。
  5. 更新 Loop-Engineering:把长程 loop 的 receipts 收紧为候选、raw hash、页面/index/log/reindex 与最终报告 claim 支撑。
  6. 更新 _index.mdlog.md,使后续 orient 能看到 2026-09-02 雷达新增内容。

建议进入后续雷达的结构字段

未来候选打分建议新增这些字段,帮助判断是否值得 deep ingest:

字段用途
local_tool_surface是否解决本地多 agent / 多 MCP 配置蔓延,而不只是远程平台治理
credential_visibility真实凭据是否进入 agent runtime,还是由边界注入
egress_boundary网络出站是否有目的地、方法、TTL、审批和审计
verifier_independence验证者是否独立于生成者;是否只是同模型自检
programmatic_oracle是否有程序化 scorer、agreement gate、hidden verifier 或 deterministic receipt
environment_contractbenchmark 是否明确 reset / observe / grade / log contract
claim_receiptREADME 中关键指标是否能追溯到 report、raw results、CI 或可运行脚本

高风险或范围较大的建议

  • 建议后续创建 wiki/ai/comparisons/mcp-gateway-control-plane-spectrum.md,把 Moor、ContextForge、ToolHive、Gate22、Microsoft MCP Gateway、deco、Keidai、AIPermission、GATRA、AgentFlow、Golf Scanner 按本地/团队/企业/联邦、profile、identity、credential boundary、policy、audit、observability 对比。今天未创建,是因为需要集中复读 10+ 页,范围较大。
  • 建议后续创建 wiki/ai/comparisons/agent-verifier-design-spectrum.md,把 self-check、independent re-derivation、programmatic verifier、hidden verifier、claim-level receipt、human rubric 的适用边界对比。
  • 建议把每日 radar 的候选 tape 从自然语言 log 进一步结构化;但这会改变 cron 工作流和文件结构,暂不在无人任务中自动改造。

写入记录

  • 2026-09-02 09:00 CST:新增今日 llm-wiki 自我优化文章,沉淀本地工具面、凭据边界、程序化验证、computer-use 环境合同和后续比较页建议。