LLM Wiki Optimization Log
LLM Wiki Optimization Log
定位与结论
本页是稳定机制总览,不是按日期追加的第二份日报。最近汇总窗口为 2026-09-06 至 2026-09-12:将每天新增的 receipt 名称合并到同一控制链,用证据等级、对象/时间/配置/分母、真实权限与状态三条检查横切各环节。当前收敛点是:发现面不等于有效授权,较新案例不覆盖适用标准,条件高分不覆盖弃权与评分链路缺口。此前的地址回读、来源信任、双边授权与日志对账继续有效。
这些规则已沉淀为 wiki 内容维护与候选判断准则;不等于 Hermes 已部署强制权限网关,也不等于外部项目已经本地测试通过。项目有效性仍受版本、部署和证据范围限制,故综合置信度为 medium。运行审计留在 log.md,不在本页反复复制“今日检查正常”。
当前机制基线
- 知识点优先:AI-Knowledge-Point-Radar 按 MCP Gateway / A2A / harness-runtime / context management / benchmark-evaluation / sandbox-security 六轴选择内容;Karpathy 等人物、组织、平台只作 seed。
- 少而深的晋升:依据 relevance、novelty、durability、actionability、source-quality、depth-potential 判断;高分但重复、对象不明、只有搜索摘要的候选仍可 raw-only 或不入库。不是每个候选都必须实现下面所有控制环节。
- 发现与证据分开:web search 优先发现,随后读取原文/代码;抓取失败可换直接 HTTPS、官方 API 或可靠镜像。未读到的部分必须明确,不以搜索摘要冒充全文。
- 原文完整性先于编译:文件存在、HTTP 成功与 body hash 只能证明拿到且固定了这些字节,不能证明全文齐全。检查上游截断标记、末节/附录和原始页面;未完整取得时标记实际读取范围,不能让缺失内容经摘要变成确定结论。参见 arc-addressable-recall-context-compaction。^[raw/articles/arc-addressable-recall-context-compaction-2026-09-11.md]
- 内容分层:raw 不改;每日 source 保存观察;稳定结论更新本页与真正归属的概念页。普通入库无需每日发明新机制名称或新概念页。
- 公共入口:统一使用 https://abos-at.work/llm-wiki/index.html;旧
/cc-wechat/files/llm-wiki/不作为用户主入口。
一条控制链,而不是每天一套分类
资产/能力发现 → 信任与协议绑定 → runtime 装配与任务规划 → 路线选择与动作授权 → 任务恢复与独立状态 → 长程评测与反馈
| 环节 | 最小可复核信息与失败判定 | 机制归属与证据入口 |
| 资产与能力发现 | asset_type、owner、schema/card hash、scope/discovery filtering、health、registry diff、last_seen、撤销/隔离、federation source trust;目录存在不证明能力可用 | MCP-Gateway-Runtime、A2A-Agent2Agent-Protocol;agentic-community-mcp-gateway-registry-ai-asset-control-plane |
| 信任与协议绑定 | human/agent/job identity、实际端点的 Card hash/抓取时间、service version 与 protocolVersion、supportedInterfaces、effective capabilities、transport/extension/auth/signature、compat mode、endpoint probe;发现、认证、组织准入、用户策略和资源权限分验 | A2A-Agent2Agent-Protocol;atlassian-rovo-a2a-live-card-and-enterprise-gates、a2a-v1-protocol-binding-governance |
| 装配与任务规划 | capability snapshot、mount/unmount、stale rejection;task envelope、context refs、data classification、tenant trust、mutation impact、预算/截止时间、幂等键、runtime placement、SandboxClaim、decision hash;计划回执不证明执行 | Harness-Engineering、MCP-Gateway-Runtime;dsh-nacos-bridge-registry-to-harness-runtime、agentmesh-runtime-gateway-task-envelope-sandboxclaim |
| 路线选择与动作授权 | inventory、distractor、selected route、GUI/tool fallback、TIR、成本;normalized action、matched rule、allow/review/block、approval/consent、scoped credential、fail-safe、旁路与审计;提示遵守不等于强制拦截 | osworld-mcp-tool-invocation-computer-use-benchmark、aegisflow-local-first-policy-gateway、agenttrust-runtime-safety-interception |
| 任务状态与恢复 | TaskHandle、pending input/auth/approval、poll/stream/push reconcile、artifact、wire/trace、事件时间、独立服务状态;叙述完成或最终拒绝都不能替代状态证据 | A2A-Agent2Agent-Protocol、Context-Engineering;a2a-query-task-handle-approval-broker、redagentbench-state-grounded-safety-measurement |
| 长程评测与反馈 | horizon、模型/harness/gateway 版本、attempt independence、reset/handoff/grade/reward/release、hidden verifier、trace/token/cost;task outcome 与 integrity verdict、coverage 与 conditional accuracy 分账 | Agent-Benchmarks、Harness-Engineering;swe-marathon-ultra-long-horizon-agent-benchmark、benchshield-reward-lifecycle-integrity |
旧称 action/trust/execution-planning/asset-control-plane/marathon-eval/tool-route/action-interception/protocol-binding receipt 都是上表不同环节的证据,不再各自膨胀成平行机制。对应项目的具体主张、原文和未验证范围留在各 source 页。
三条横切检查:声明、控制与观测不能混同
1. 证据等级与实际覆盖
分别标记:搜索发现 → 完整原文 → 固定版本源码/具体 assertion → 真实运行回执。它们证明不同问题,不能用“有测试文件”代替运行,更不能用命令绿色代替覆盖率。对 A2A 接入保存规范条款、测试函数、断言、运行对象和结果,分开记录 declared / applicable / executed / passed;未实现、人工验证、前置失败、可选不适用应有不同原因。业务必需能力不能靠“不声明所以 skip”免验。参见 a2a-tck-conformance-coverage-and-security-boundaries。^[raw/articles/a2a-tck-conformance-coverage-and-security-boundaries-2026-09-10.md]
对 llm-wiki 的应用:候选记录保留 URL、fetch_status、判分/否决理由、raw_path、body sha256、page_paths 和验收位置。候选记录是审计,不自动提升证据等级;已有 raw note 可承载,不要求马上新建复杂 registry 或 radar-gates.yaml。
运行主体与核查动作分开:作者运行回执、阅读测试源码、本机重算归档 hash/字节长度、本机重放 verifier/实验是不同证据。a2a-output-attestation-and-delegation-ancestry 的归档一致性核查不能改写为本机通过签名验证;测试标题也不能代替隔离负例和具体失败原因。^[raw/articles/a2a-output-attestation-and-delegation-ancestry-2026-09-11.md]
案例与规范分轨:新论文或部署案例可提供架构机制,但发表更晚不自动取代仍适用的规范。记录标准状态、条款和适用对象,遇到冲突保留原文并在 source 标记 contested,只晋升不冲突的机制。enterprise-mcp-persona-credential-boundaries 的身份矩阵可借鉴,ROPC 却受 RFC 9700 §2.4 的 MUST NOT 约束,没有机器身份例外;本次依据归档的完整选定章节,不冒称重读完整 RFC 或实测部署。^[raw/articles/enterprise-mcp-persona-credential-boundaries-2026-09-12.md] ^[raw/articles/rfc9700-oauth-security-selected-sections-2026-09-12.md]
2. 对象、事件时间、配置与分母
记录 publication/fetch/version/commit/config 和结论适用的对象;读 issue 后续评论与 release,不能把旧版本缺陷、同名产品或协议规范当当前部署事实。A2A 旧 SDK ownership 报告与 1.0 修复说明必须区分;这不是对当前 SDK 的独立安全审计。^[raw/articles/a2a-tck-conformance-coverage-and-security-boundaries-2026-09-10.md]
评测数字必须保留 cohort、条件分母、轨迹与判分配置;选择性失败重放不代表全任务安全提升。按每条动作的事件时间关联当时权限与状态,不能拿 current/latest 替代历史;context 中识别了规则不等于执行时遵守。参见 Context-Engineering 与 redagentbench-state-grounded-safety-measurement。^[raw/articles/redagentbench-state-grounded-safety-measurement-2026-09-10.md]
指标语义也是验收项:可恢复、实际选中/消费、完成提交、最终正确分别记账;安全收益要同时报告合法效用与实际执行覆盖。arc-addressable-recall-context-compaction 的 correctness/completion 以及 spa-plan-first-label-preserving-persistent-agents 的运行总数/utility 表述尚有疑点,保留 source 的 contested,可以吸收机制,但不将争议数字推广成选型结论。^[raw/articles/arc-addressable-recall-context-compaction-2026-09-11.md] ^[raw/articles/spa-plan-first-label-preserving-persistent-agents-2026-09-11.md]
弃权分母不能消失:评测保存 planned → runnable → covered → correct,每一步给排除/失败/弃权原因;并列报告 covered/runnable 的覆盖率、correct/covered 的条件准确率,另报 correct/runnable 时明确这是不同统计量。benchshield-reward-lifecycle-integrity 表明静态暴露、实际使用禁止路径、语义充分性不是同一判定;「未看到违规」不等于安全,Inconclusive 不能并入通过。本任务吸收计量规则,不声称重放了论文实验。^[raw/articles/benchshield-reward-lifecycle-integrity-2026-09-12.md]
3. 实际权限闭包与独立结果
验证 caller × tool × destination × delegated service:session 不是身份;token 不外发不代表目的地受限;修复版本与可选认证配置必须分别验收。MCP 后端服务账号与网络位置本身也是可被借用的权限,参见 grafana-mcp-session-identity-and-egress-boundaries。^[raw/articles/grafana-mcp-session-identity-and-egress-boundaries-2026-09-10.md]
授权先于借权:分别记录 initiated-by、actor/workload 与 executed-as;User→SA 必须在附加服务账号凭证前核验 caller × SA × action × destination × tenant,并保存当时策略与拒绝点。交互用户、cron 工作负载和下游执行身份不能混同。Token exchange 的历史 act 不证明逐跳同意,输入 token 撤销也不自动传播;token 角色、audience 与撤销合同须按部署分别验证。参见 enterprise-mcp-persona-credential-boundaries 与 MCP-Gateway-Runtime。^[raw/articles/enterprise-mcp-persona-credential-boundaries-2026-09-12.md] ^[raw/articles/rfc8693-token-exchange-selected-sections-2026-09-12.md]
发现面与任务执行分验:客户端绑定实际接入端点的 Card/metadata,而非上游注册条目;service version 不能替代 protocolVersion,公开 JSON 断言不能代替 OAuth、组织开关、用户策略和资源授权的任务负例。SSE 断流或边缘超时不证明下游未执行,重试有副作用动作前须回查 task/独立状态与幂等键。atlassian-rovo-a2a-live-card-and-enterprise-gates 只有公开发现面核查,不是用户租户 E2E 已通过。^[raw/articles/atlassian-rovo-a2a-live-card-and-enterprise-gates-2026-09-12.md]
沙箱还须纳入本地 daemon、Unix socket、loopback、宿主共享和代理执行。直接进程被限制,并不证明边界外的服务不能代行;socket 存在也不等于可利用。参见 pillar-docker-socket-sandbox-trust-handoff 与 aisi-sandboxescape-bench-container-breakout。本轮未探测用户部署或执行漏洞 PoC。^[raw/articles/pillar-docker-socket-sandbox-trust-handoff-2026-09-10.md]
对发布/数据任务的应用:外部写入后回读确切目标,核对正文或状态而不只看 HTTP 200;回执需与目标、动作和时间关联。签名/hash 证明记录内容,不自动证明真实执行或无旁路;最终“拒绝/完成”不能抹去先前状态变化。^[raw/articles/redagentbench-state-grounded-safety-measurement-2026-09-10.md]
评分链路也要验收:独立 verifier 的隔离只是一个环节,仍需保护 reset、交接产物、依赖/规则、评分入口与 release;分别记录任务结果和完整性结论。超时、证据缺失、未知事件不能 fail-open 成功;形式模型通过不等于真实 backend 的网络、挂载和原始 socket 均可观测。对内部 runner 的最小后续试验是答案暴露但未使用、评分路径被改、verifier 超时三类负例,尚未在本任务执行。^[raw/articles/benchshield-reward-lifecycle-integrity-2026-09-12.md]
输出绑定与委托授权分验:输出签名验证交付字节;父引用或子方签名不能证明父方同意。若系统要求双边委托授权,应验父子对同一具体边的签署、信任目录、撤销/有效期及 nonce 状态;父方拒签应阻断。单个 verifier 的防重放断言不能外推为跨 verifier 保证。参见 A2A-Agent2Agent-Protocol 与 a2a-output-attestation-and-delegation-ancestry;这是接入审查准则,不是已部署双签服务。^[raw/articles/a2a-output-attestation-and-delegation-ancestry-2026-09-11.md]
贯穿上下文持久化:地址、标签、授权各负其责
- 语义发现 → 精确回读:Context-Engineering 中的概念摘要是有损视图,raw 是原始证据。已知路径后按原始对象回读,保留 URL/版本/hash 与定位信息;无效地址明确失败或给出未确认候选,不把近似命中当原对象。压缩率不能替代关键 ID/报错恢复率、回读成本和最终正确性。沿用现有云端向量检索,不直接替换 runtime。^[raw/articles/arc-addressable-recall-context-compaction-2026-09-11.md]
- 来源信任不因摘要提升:外部 payload 经过格式化、结构化、入库或再次召回,仍是外部资料,不变成用户指令。规划 metadata 也不能夹带未经约束的外部指令;身份、目的地、支付/发布参数等高影响字段需独立授权。spa-plan-first-label-preserving-persistent-agents 的信息流控制属于可借鉴架构,当前 wiki 只落实来源/证据标注,不声称有字段级 IFC。^[raw/articles/spa-plan-first-label-preserving-persistent-agents-2026-09-11.md]
- 正反例闭环:后续隔离试验分别覆盖原样/分页/失效地址回读、污染内容跨轮复用、父方拒签/输出替换/跨 verifier 重放;用 Harness-Engineering 约束实际动作,用 Agent-Benchmarks 分开判定拒绝、合法完成与独立状态。本次未运行这些试验,不把建议写成通过记录。
仍有效的相邻机制
- 长程 context / computer-use loop:优先 structured state、semantic action、verified state path、observation channel、action receipt 与 attention/context ledger。Context-Engineering、Loop-Engineering 和 Harness-Engineering 分别负责可见信息、闭环与执行约束。
- skill / workspace 污染防线:外部或 agent-authored skill 必须带来源 hash、run id、review 状态,保存 claim/status/broadcast/merge/verifier 协议;共享内容不是天然可信资产。归属 Agent-Skill-Discovery 与 Loop-Engineering。
- 控制面谱系而非工具堆积:重复 gateway 候选先比较 backend_protocols、registry_scope、identity_model、credential_boundary、policy_surface、observability 与 federation risk;只有新增机制或反例才晋升。大规模 comparison/迁移留专门任务。
链接、索引与发布验收合同
- 正文互链:最近七天新增/更新的 AI 文章至少连接一个六轴主题簇,并有两个其他既有概念页链接;不能只靠发布时会被剥离的 frontmatter
related。新增 source 应获主题概念反链;日报由本页的证据窗口承接,不能只在顶层索引中有入口。 - 局部与历史分账:核对真实路径/标题、frontmatter、正文写入时间、raw 来源与导航。先保留 broken-link 基线,再验收新增差集;历史断链不是“零异常”,但不要借它否定本次正确修改或无人批量猜链接。
- 路径集合,而非只看总数:文件系统正式文章集合、
wiki-query集合、向量 metadata 集合应逐路径一致;raw 和导航页单列。09-09 的增量索引丢缓存,以及 09-10 的关键词工具漏扫 comparison/strategy/template/framework,说明成功退出和看似合理的总数都不充分。细节见 llm-wiki-optimization-2026-09-09、llm-wiki-optimization-2026-09-10。 - 真实检索回归:内容更新后运行
~/llm-wiki/bin/wiki-vquery-run index --reindex,核对 FAISS ntotal、metadata、category/type 分布,再实查修改页;分类/类型工具变更另验 stats、recent、filter 与增量保留。保持 GLM Embedding-3 云端后端。 - 发布完成的定义:执行
~/llm-wiki/scripts/publish-wiki-to-cvm.py --since-hours 36后,回读公网 index 和本次修改文章,验证目标正文而非仅状态码;发布 manifest 与本地页面路径/内容对应。脚本的 36h 是最近更新展示窗口,不代表只上传窗口内文件,也不能证明窗口前页面此前已成功发布。 - 审计也须对账:从实际路径清单和原始回执核对日志中的文件名、样本分组、数量与指标,不把旧摘要当唯一事实。09-11 早报回查已发现并修正日志与不可变归档不一致;raw 保持不变,后续更正需留痕。lint 必须看检查器的实际问题统计,摘要脚本退出 0 不等于健康;全库、正式文章、本轮差集分开报告。审计证据见
log.md的「早报回查:修正入库日志与归档不一致」。 - 停手边界:操作、链接差集、索引与公网回读实测结果写
log.md;没有新机制不再加“今日正常”章节。批量拆页、权限加固、cron/gateway 改造不由本任务顺带执行。
当前雷达判断与维护边界(2026-09-12)
实际读取 active cron 83236dfdb31f 的配置与状态:启用、09:00 调度,09-12 最近运行与投递记录无错误;prompt 明确六轴与 web-first、人物低权重。最近七日日报覆盖 gateway 项目、A2A 官方协议/测试与企业实践、长程评测、服务状态测量、安全公告、RFC 与上下文研究,未见按单一人物/来源收敛。网络失败后的 GitHub/HN/原站 HTTPS 是补充取证路径,不应固化为唯一来源。具体运行时间与检查回执留在 log.md。
当前选择仍偏 MCP/A2A/安全交叉机制;09-11 的 arc-addressable-recall-context-compaction 与 spa-plan-first-label-preserving-persistent-agents 已补独立 context 研究及持久化信任边界。09-12 的 context 候选只有摘要、未晋升,不能据单日空缺判定该轴停摆。继续按未覆盖机制与证据缺口轮换;Harbor/MCPG 先留 raw,不为主题或来源配额晋升薄内容。早期「未取得全文」待办应先查后续日志:A2A 输出证明与 Pillar 原文已分别在 09-11、09-10 补回,不再滚动误报为当前阻塞。
大范围维护仍需单独安排:既有断链/别名、超长 Harness/Benchmark/Context/MCP 概念页、顶层 source 长列表与缺失 SCHEMA;本轮只整理此总览、补少量正文互链,不批量拆页或建立新的 taxonomy。
最近七天的证据入口
- llm-wiki-optimization-2026-09-06:task envelope、runtime placement 与计划/执行边界。
- llm-wiki-optimization-2026-09-07:registry-to-runtime、TaskHandle 与任务恢复。
- llm-wiki-optimization-2026-09-08:asset control plane、marathon verifier 与未读来源留痕。
- llm-wiki-optimization-2026-09-09:工具路线、动作拦截、协议绑定与增量索引修复。
- llm-wiki-optimization-2026-09-10:实际 assertion/权限/状态、版本分母与三方路径集合。
- llm-wiki-optimization-2026-09-11:全文完整性、地址回读/来源标签、双边授权与指标语义。
- llm-wiki-optimization-2026-09-12:有效 Card 与企业授权、身份/凭证和标准冲突、奖励生命周期与弃权分母。
历史证据导航(不作为当前日期窗口)
- llm-wiki-optimization-2026-09-05:身份、Agent Card 与 trust metadata。
- llm-wiki-optimization-2026-09-04:动作级授权、审批恢复与旁路。
- llm-wiki-optimization-2026-09-03 · llm-wiki-optimization-2026-09-02 · llm-wiki-optimization-2026-09-01 · llm-wiki-optimization-2026-08-31 · llm-wiki-optimization-2026-08-30 · llm-wiki-optimization-2026-08-29 · llm-wiki-optimization-2026-08-28
- llm-wiki-optimization-2026-08-27 · llm-wiki-optimization-2026-08-26 · llm-wiki-optimization-2026-08-25 · llm-wiki-optimization-2026-08-24 · llm-wiki-optimization-2026-08-23 · llm-wiki-optimization-2026-08-22 · llm-wiki-optimization-2026-08-21
- llm-wiki-optimization-2026-08-20 · llm-wiki-optimization-2026-08-18 · llm-wiki-optimization-2026-08-17 · llm-wiki-optimization-2026-08-16 · llm-wiki-optimization-2026-08-15 · llm-wiki-optimization-2026-08-14
写入记录
- 2026-09-03 21:00 CST:合并/升级自我优化日志为总览页,明确 CVM 入口、雷达轴、日志分层和 wikilink 串联规则。
- 2026-09-03 12:01 CST:汇总近 7 天
llm-wiki-optimization-*观察,新增权限/凭据边界、候选晋升 tape、benchmark/verifier 合同、MCP 控制面谱系、A2A 证据门槛、长程 context loop、skill 污染防线等机制级规则,并记录当日雷达轴与主题簇互链检查结论。 - 2026-09-04 12:00 CST:执行 llm-wiki 自我优化汇总;确认 AegisFlow 触发的动作级 policy-gateway 规则已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
- 2026-09-04 09:00 CST:根据 AegisFlow 入库,补充 policy-gateway 候选晋升标准与动作级证据链检查。
- 2026-09-05 09:00 CST:补充 MCP/A2A trust receipt 作为雷达 gate 与 wiki 自我优化规则。
- 2026-09-05 12:00 CST:执行 llm-wiki 自我优化汇总;确认 trust receipt gate 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
- 2026-09-06 09:00 CST:补充 execution planning receipt 作为雷达 gate 与 wiki 自我优化规则,要求后续 runtime/gateway 候选记录 task envelope 与 runtime placement。
- 2026-09-06 12:00 CST:执行 llm-wiki 自我优化汇总;确认 execution planning receipt 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
- 2026-09-07 09:00 CST:补充 registry-to-runtime bridge 与 A2A task-state harness 作为雷达 gate 与 wiki 自我优化规则。
- 2026-09-07 12:00 CST:执行 llm-wiki 自我优化汇总;确认 registry-to-runtime bridge 与 A2A task-state harness 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
- 2026-09-08 12:00 CST:执行 llm-wiki 自我优化汇总;确认 asset-control-plane receipt 与 marathon-eval receipt 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
- 2026-09-08 09:01 CST:补充 asset-control-plane 与 marathon-eval receipt 作为雷达 gate 与 wiki 自我优化规则。
- 2026-09-08 09:03 CST:记录本轮 reindex、语义检索和 targeted link check receipt,并标注 broad link check 的历史噪音边界。
- 2026-09-09 09:01 CST:补充 tool-route、action-interception、protocol-binding receipts 作为 llm-wiki 雷达 gate 与自我优化规则。
- 2026-09-09 09:01 CST:记录并已修复 wiki-vquery 增量索引缩成 1-doc、类型推断 entitie/strategie、缺少 comparisons/frameworks category subdir 的问题。
- 2026-09-10 12:03 CST:汇总 09-04 至 09-10 观察;将按日追加章节改为统一控制链与三条横切检查,增加正文互链/反链、三方路径集合和公网正文回读验收;保留历史证据导航与写入记录,明确机制规范不代表运行时已部署。
- 2026-09-11 12:02 CST:汇总 09-05 至 09-11 观察;将全文完整性、作者回执/本机核查分层、指标语义、地址与信任标签、双边委托授权纳入既有机制,增加日志对账与真实 lint 验收;更新 context 覆盖判断,未新建日报或部署运行时控制。
- 2026-09-12 12:03 CST:汇总 09-06 至 09-12 观察,将有效发现/分层授权、案例与规范分轨、借权前检查、奖励链路和弃权分母合入既有控制链;保留历史记录,关闭已补回原文的过期待办表述,不新建日报或改变运行时配置。