llm-wiki 自我优化 2026-09-12:实现不覆盖标准,高分不覆盖弃权
llm-wiki 自我优化 2026-09-12
今天最值得留下的不是「更多支持 A2A/MCP 的工具」,而是三条证据边界:Card 可读≠任务获授权,生产案例≠安全标准,条件准确率≠全量覆盖。
今天发现并深度入库什么
A2A / MCP Gateway / harness-runtime:真实企业接入的多重关口
atlassian-rovo-a2a-live-card-and-enterprise-gates 已取得真实 Agent Card 和 OAuth Protected Resource Metadata,10 项离线 JSON 断言通过。version=1.0.0 与 protocolVersion=0.3.0 同时存在;streaming 开启但 push/history 关闭。接入必须分别通过 OAuth、组织 A2A enablement、用户 AI policy 和业务资源权限。网关实际 Card 而非上游自报,才是客户端的能力合同。^[raw/articles/atlassian-rovo-a2a-live-card-and-enterprise-gates-2026-09-12.md]
深度判断:有 live 对象、架构与 E2E 手册,足以沉淀接入验收法;本机未登录租户或运行任务,因此不是「A2A 已端到端测试成功」。来源文档标注更新于八月,本次新意是知识库新覆盖,不假称今天刚发布。
MCP Gateway / sandbox-security:借用服务账号前必须授权
enterprise-mcp-persona-credential-boundaries 把 persona 与 credential 拆开,关键在 User→SA 的授权必须早于 credential injection。但论文的 ROPC 路径与 RFC 9700 的 MUST NOT 冲突;RFC 8693 中历史 act 也仅作信息记录,不能当多跳双边授权。原文保留,source 明确 contested: true,没有把论文所有做法打包成推荐。^[raw/articles/enterprise-mcp-persona-credential-boundaries-2026-09-12.md] ^[raw/articles/rfc9700-oauth-security-selected-sections-2026-09-12.md] ^[raw/articles/rfc8693-token-exchange-selected-sections-2026-09-12.md]
深度判断:复用身份矩阵与授权点,同时用一手标准纠偏,比再收一个网关产品名单更耐久。未来来源更新不能仅凭「更晚发表」覆盖仍有效的安全标准。
benchmark-evaluation / sandbox-security / harness-runtime:奖励来源本身需要验收
benchshield-reward-lifecycle-integrity 将 static exposure、具体使用、语义充分性分开;独立 verifier 仍可能因 handoff、fail-open 或答案泄露给出假成功。作者表 4 的 96.0% 是 126 个 covered cell 中的准确率,144 个 runnable cell 另有 18 个弃权,coverage 87.5%。本机复算了分母,未复现运行。^[raw/articles/benchshield-reward-lifecycle-integrity-2026-09-12.md]
深度判断:能直接转化为内部 BASE/RED/GOLD runner 的设计检查,但论文形式模型不能替代真实 backend 可观测性;raw socket 等通道边界也必须保留。
候选评分与没有晋升的原因
每维 1–5,顺序为 relevance / novelty / durability / actionability / source-quality / depth-potential。总分是分流辅助,不是自动晋升阈值。
| 候选 | 知识点轴 | 六维分数 / 总分 | 决策 |
| Rovo A2A | A2A、MCP Gateway、harness-runtime、sandbox-security | 5/5/5/5/5/5 = 30 | 深读;真实发现面与企业权限边界 |
| BenchShield | benchmark-evaluation、sandbox-security、harness-runtime | 5/5/5/5/4/5 = 29 | 深读;奖励全链路与弃权分母 |
| 企业 MCP auth 论文 | MCP Gateway、harness-runtime、sandbox-security | 5/4/5/5/4/5 = 28 | 深读并对照 RFC;局部做法 contested |
| Harbor Adapters / Harbor-Index | benchmark-evaluation、harness-runtime | 4/4/5/4/4/5 = 26 | raw-only;全文已存,只读摘要/引言,尚未审计 adapter parity/筛选/泄漏 |
| AISI SandboxEscapeBench | sandbox-security、benchmark-evaluation | 5/1/5/4/5/5 = 25 | 已有正式页,本轮不重复入库 |
| MCPG federation | MCP Gateway、sandbox-security | 5/3/4/4/3/4 = 23 | raw-only;有策略/凭证配置,但实现与负例未核,暂不堆另一篇网关介绍 |
| Copying / collective agents | sandbox-security、context management、benchmark-evaluation | 3/4/4/3/4/4 = 22 | raw-only;只取摘要,事件归因与完整证据未核 |
| T1 terminal-agent RL | harness-runtime、benchmark-evaluation | 3/3/4/3/3/4 = 20 | search-only;训练/分数信号优先级低,未读取全文 |
搜索与部分 web_extract 遇到 Firecrawl 403,改用官方 HTTPS 抓取完成主要取证。Rovo /task-handling/ 返回 404;BenchFlow GitHub API rate limit 403,仅 current-main README 可读,未据此声称实验源码/commit 已核验。没有执行外部 README 的安装或会话上传指令。
已直接实施的低风险优化
- 在 AI-Knowledge-Point-Radar 同步三条检查:service/protocol/effective capability 分开;架构案例对照规范;planned/runnable/covered/correct 分母并列。
- 新增双语检索词:用户借用服务账号授权、奖励生命周期完整性、条件准确率与弃权、网关有效能力卡;仍按知识点轮换,不按人物加权。
- A2A-Agent2Agent-Protocol、MCP-Gateway-Runtime、Agent-Benchmarks 只加关键结论及 source 反链,不复制三篇长摘要。
- 沿用 LLM-Wiki-Optimization-Log 的证据分层与路径集合验收,不更改 cron、gateway、IdP、向量模型或外部工具配置。
本轮文件范围
新增正式页位于 wiki/ai/sources/:
atlassian-rovo-a2a-live-card-and-enterprise-gates.mdenterprise-mcp-persona-credential-boundaries.mdbenchshield-reward-lifecycle-integrity.mdllm-wiki-optimization-2026-09-12.md(本篇)
更新正式概念页位于 wiki/ai/concepts/:A2A-Agent2Agent-Protocol.md、MCP-Gateway-Runtime.md、Agent-Benchmarks.md、AI-Knowledge-Point-Radar.md;维护 _index.md、log.md。
新增原文归档位于 raw/articles/:
atlassian-rovo-a2a-live-card-and-enterprise-gates-2026-09-12.mdenterprise-mcp-persona-credential-boundaries-2026-09-12.mdrfc9700-oauth-security-selected-sections-2026-09-12.md(完整选定章节,非完整 RFC)rfc8693-token-exchange-selected-sections-2026-09-12.md(完整选定章节,非完整 RFC)benchshield-reward-lifecycle-integrity-2026-09-12.mdharbor-adapters-harbor-index-2026-09-12.md(raw-only)mcpg-federation-2026-09-12.md(raw-only)copying-collective-agents-abstract-2026-09-12.md(raw-only,摘要)
候选账本:raw/notes/ai-knowledge-radar-2026-09-12.md。本轮不改既有 raw 文件。
本轮验收与存量边界
八篇新建/更新文章的必要 frontmatter、写入记录、正文概念链接、目标路径与定向 lint ERROR 均通过;九份新 raw 的 body SHA-256 一致,旧 raw 无改写。关键词工具已返回当天文章,首次全量重建收录 524 篇(27.4 秒、33 次 GLM API 调用),三条语义检索均把对应新 source 排第一。
全库检查仍有 333 ERROR(正式 wiki 63,raw 270),与本轮入库前实测错误数相同;不是全库 lint 通过。新 source 的四条 orphan warning 来自旧检查器只按 title 判断入链、忽略实际 stem 链接的口径,本轮正文已有反链;不为了消除告警批量改名。MCP/Benchmark 超长概念页与历史链接治理仍留作独立维护任务。最终路径集合、索引与公网正文回读结果写入 log.md,不以工具退出 0 代替验收。
后续三项建议
- 内部 runner 先加「verifier 超时/证据缺失」负例,并把 coverage 与 conditional accuracy 拆成两列。
- 接入企业 agent 前列出交互用户、cron 工作负载和实际执行 SA,验证无 entitlement 时不会注入凭证。
- 下次深读 Harbor 先核 adapter parity、任务筛选分母与答案泄漏,不因为支持 benchmark 多就晋升;历史断链/超长页另开维护批次。
用户入口:https://abos-at.work/llm-wiki/index.html
写入记录
- 2026-09-12 09:20 CST:新增今日机制综合、六维候选判断与完整路径清单,沉淀实现/规范/弃权边界;对真实 GET、表格复算与未运行实验分别标注。
- 2026-09-12 09:22 CST:补入定向检查、raw 完整性、索引及语义召回结果;明确历史 lint 错误、orphan 口径与超长页未被本轮修复。