llm-wiki 自我优化 2026-09-02
llm-wiki 自我优化 2026-09-02
今天学到的东西
今天入库的四个来源把雷达从“发现单个工具/benchmark”推进到一个更清楚的系统合同:长期 agent workflow 需要同时管理 工具面、凭据面、验证面、环境面。
| - [[moor-local-mcp-gateway-manager | Moor]] 提醒:本地开发者机器也会形成 MCP 工具面蔓延,需要 Profile、inventory 和 audit,不只是企业网关才需要控制面。 |
| - [[bromure-agentic-coding-sandbox | Bromure Agentic Coding]] 提醒:真实凭据不应进入 agent 可读环境,应该在 VM / proxy / gateway 边界按目的地、TTL、consent 注入。 |
| - [[da-verify-programmatic-verification-harness | da-verify]] 提醒:LLM self-check 不等于验证;可程序检查任务里,独立样本 + programmatic agreement gate 更接近可靠 verifier。 |
| - [[cuarena-instrumented-computer-use-environments | CUArena]] 提醒:computer-use 环境必须 reset / observe / grade,UI clone 没有 log contract 和 rubric 就不能成为可靠 benchmark。 |
这四点合起来说明:llm-wiki 的 AI 雷达不应只问“今天有没有新项目”,而应问候选是否补充了某个控制边界。今天四个候选分别覆盖本地 gateway、沙箱/凭据、安全执行、程序化验证、computer-use 环境合同,属于高权重主题的机制补全。
已执行的低风险优化
- 新增 4 个 source 页,并在每页末尾添加
## 写入记录:Moor、Bromure、da-verify、CUArena。 - 更新 MCP-Gateway-Runtime:加入本地 MCP gateway / Profile / audit 维度,和 ContextForge 的企业联邦控制面形成谱系。
- 更新 Harness-Engineering:把程序化验证、凭据边界注入、本地工具 profile 统一到 effect-boundary harness 原则。
- 更新 Agent-Benchmarks:强调 verifier 与环境合同,补充 da-verify 与 CUArena 对重复、程序化评分、reset/observe/grade 的启发。
- 更新 Loop-Engineering:把长程 loop 的 receipts 收紧为候选、raw hash、页面/index/log/reindex 与最终报告 claim 支撑。
- 更新
_index.md和log.md,使后续 orient 能看到 2026-09-02 雷达新增内容。
建议进入后续雷达的结构字段
未来候选打分建议新增这些字段,帮助判断是否值得 deep ingest:
| 字段 | 用途 |
local_tool_surface | 是否解决本地多 agent / 多 MCP 配置蔓延,而不只是远程平台治理 |
credential_visibility | 真实凭据是否进入 agent runtime,还是由边界注入 |
egress_boundary | 网络出站是否有目的地、方法、TTL、审批和审计 |
verifier_independence | 验证者是否独立于生成者;是否只是同模型自检 |
programmatic_oracle | 是否有程序化 scorer、agreement gate、hidden verifier 或 deterministic receipt |
environment_contract | benchmark 是否明确 reset / observe / grade / log contract |
claim_receipt | README 中关键指标是否能追溯到 report、raw results、CI 或可运行脚本 |
高风险或范围较大的建议
- 建议后续创建
wiki/ai/comparisons/mcp-gateway-control-plane-spectrum.md,把 Moor、ContextForge、ToolHive、Gate22、Microsoft MCP Gateway、deco、Keidai、AIPermission、GATRA、AgentFlow、Golf Scanner 按本地/团队/企业/联邦、profile、identity、credential boundary、policy、audit、observability 对比。今天未创建,是因为需要集中复读 10+ 页,范围较大。 - 建议后续创建
wiki/ai/comparisons/agent-verifier-design-spectrum.md,把 self-check、independent re-derivation、programmatic verifier、hidden verifier、claim-level receipt、human rubric 的适用边界对比。 - 建议把每日 radar 的候选 tape 从自然语言 log 进一步结构化;但这会改变 cron 工作流和文件结构,暂不在无人任务中自动改造。
写入记录
- 2026-09-02 09:00 CST:新增今日 llm-wiki 自我优化文章,沉淀本地工具面、凭据边界、程序化验证、computer-use 环境合同和后续比较页建议。