← 返回藏书阁

llm-wiki 自我优化 2026-09-10:验证实际边界,不再堆叠“支持”和“已通过”

wiki/ai/sources/llm-wiki-optimization-2026-09-10.md
分类:ai / sources · 更新:2026-09-10 09:30

llm-wiki 自我优化 2026-09-10:验证实际边界,不再堆叠“支持”和“已通过”

今天值得吸收的结论

本轮不是新闻汇编:新增的知识在于拆开被声明的能力、真正执行的控制、能够观察的状态。昨日已入库的协议/工具面,今天通过官方测试代码、真实安全公告及评测方法补出反例。

- MCP Gateway / sandbox-security / harness-runtime / benchmark-evaluation:[[grafana-mcp-session-identity-and-egress-boundariesGrafana MCP]] 展示 session 不等于身份、token 不外发不等于出站受限;v1.1.0 的版本修复与可选认证启用是两件事。^[raw/articles/grafana-mcp-session-identity-and-egress-boundaries-2026-09-10.md]
- A2A / benchmark-evaluation / harness-runtime / sandbox-security:[[a2a-tck-conformance-coverage-and-security-boundariesA2A TCK]] 已有真实 task/push tests,但 requirement 存在、测试标题、skip 和实际 assertion 的覆盖不能混同。已核对固定 commit,未运行 TCK。^[raw/articles/a2a-tck-conformance-coverage-and-security-boundaries-2026-09-10.md]
- benchmark-evaluation / sandbox-security / harness-runtime / context management:[[redagentbench-state-grounded-safety-measurementREDAgentBench]] 区分 execution、observation 和 adjudication;最终拒绝不能抹去已经产生的服务状态变化,识别规则也不保证遵守规则。^[raw/articles/redagentbench-state-grounded-safety-measurement-2026-09-10.md]
- sandbox-security / harness-runtime / benchmark-evaluation:[[pillar-docker-socket-sandbox-trust-handoffDocker socket 旁路]] 补回此前抓取失败的原文,核对 Cursor 官方公告;daemon 的代理执行权限属于 sandbox 边界,不是只看 agent 进程本身。^[raw/articles/pillar-docker-socket-sandbox-trust-handoff-2026-09-10.md]

候选评分与深度判断

R/N/D/A/S/P 分别是 relevance、novelty、durability、actionability、source-quality、depth-potential,均为 1–5;总分仅辅助判断,不强制晋升。

候选R/N/D/A/S/P总分决策
Grafana MCP identity/egress5/5/5/5/5/530深度入库:官方 release 与 CVE 支持边界拆分
A2A TCK5/4/5/4/5/528深度入库:真实断言、状态与覆盖分母
REDAgentBench5/4/5/4/4/527深度入库:固定轨迹对照、条件分母与独立状态
Docker daemon trust handoff5/4/5/4/5/528深度入库:宿主代理权限反例与官方公告
Aembit per-user identity5/2/4/3/4/321raw-only:与现有控制面身份/凭据机制重复
IETF agent security draft-004/3/3/2/3/318raw-only:标准状态、SUT 同名实体和可复现性不足以支撑产品总评
Boundary-Bench5/1/5/4/4/423不重复入库:已有同题 source
WorkBuddy Bench4/3/4/3/2/319仅候选:本轮只搜索发现,未深读原始论文/仓库

完整候选轴、URL、获取状态及否决理由:raw/notes/ai-knowledge-radar-2026-09-10.md。IETF 文中 SUT 为 “Hermes AI Agent Gateway”,带特定模型、代理和部署配置;未获得足以映射用户当前 Hermes 的版本/源码证据,不能把同名与评分直接传播为当前产品事实。该文是 Internet-Draft,不是已发布 RFC。^[raw/articles/ietf-agent-security-benchmark-draft-00-raw-only-2026-09-10.md]

已做的低风险优化

  1. 机制收敛:回写 AI-Knowledge-Point-Radar,复用证据等级、版本/实体/分母、实际权限/状态三类检查,不再每天制造一串新 receipt 名称。
  2. 抑制概念页膨胀MCP-Gateway-RuntimeA2A-Agent2Agent-ProtocolAgent-BenchmarksHarness-Engineering 只加简短判定和 source 入口;保留旧内容,不进行无人批量搬迁。
  3. 核对“看起来通过”:TCK skip 原因、SDK issue 后续修复、CVE fixed version 与运行配置分别记录;raw 存原始证据,source 存最终分析。
  4. 补强发现路径:继续 web search 优先;抽取服务 403、GitHub raw 超时或文本可疑截断时,改用直接 HTTPS / GitHub contents API。没有因某抓取器失效就假装已读全文。
  5. 双语机制词:增加 conformance coverage / 一致性覆盖率、recognition-execution gap / 识别-执行鸿沟、implicit authority / 隐式权限、session is not authentication / 会话非认证;来源只作 seed。
  6. 统计与检索覆盖修复:实测 wiki-query --stats 只计 concept/entity/source,漏掉 comparison/strategy/template/framework 共 12 篇,报 983 而文件系统为 995(含 raw)。补齐 bin/wiki-query 的九类目录发现、单数类型与 CLI filter;用临时平铺/分类 vault 做回归,真实 vault 的 516 篇正式文章路径与向量元数据逐项一致,不再只对总数。

验证与范围

  • 新增四篇深读 source 和本篇自我优化;六份来源 raw,加一份候选 raw note。
  • SCHEMA.md 缺失,按现有导航、类型与标签惯例维护;本轮所用标签在既有文章中均存在,不额外扩充 taxonomy。
  • 更新前 category link checker 报告 142 条历史 unresolved 引用,含旧别名和 raw-only 引用;不把它误报成今天新增故障。
  • 本轮 10 篇新建/更新文章的必要 frontmatter、正文写入时间和出站链接检查通过;5 篇新增均有反链、已进导航且不超过 200 行。7 份 raw SHA-256 全部通过;AI 分类 unresolved 仍为原有 142 条,本轮未新增。
  • 全量 wiki-vquery-run index --reindex 实际返回 516 documents、26.5s、33 API calls;四条主题语义查询均将相应新 source 排在首位。wiki-query 语法、九类类型过滤、平铺/分类路径、关键词搜索、recent/raw 回归通过,真实索引与文件系统逐路径一致。
  • 历史结构问题单独保留:Harness-Engineering 560 行、Agent-Benchmarks 511 行、MCP-Gateway-Runtime 232 行;未在无人雷达中批量拆页。log 为 116 个条目,未到 500 条轮转门槛。
  • 未运行外部 benchmark/TCK、未执行漏洞 PoC、未探测生产系统、未改变 Hermes/gateway/cron 配置。本轮维护本地 vault 和语义索引,不触发 CVM 发布;用户可见统一入口仍为 https://abos-at.work/llm-wiki/index.html。

下一步建议

  1. 在自有隔离 A2A SUT 上设计跨身份 task/push、前置失败与 skip 的负例,明确必测项后再运行 TCK。
  2. 单独安排 MCP 组件盘点:版本、入站认证、目标 origin、daemon/socket 访问与服务账号权限分别确认,不在雷达中自动加固。
  3. 将超长 Harness/Benchmark 页拆为主题导航和机制页;这涉及历史结构与反链,留给专门维护任务,不在无人任务中大规模重组。

本轮文件清单

新增正式文章(路径前缀 wiki/ai/sources/):

  • grafana-mcp-session-identity-and-egress-boundaries.md
  • a2a-tck-conformance-coverage-and-security-boundaries.md
  • redagentbench-state-grounded-safety-measurement.md
  • pillar-docker-socket-sandbox-trust-handoff.md
  • llm-wiki-optimization-2026-09-10.md

新增不可变档案:

  • raw/articles/grafana-mcp-session-identity-and-egress-boundaries-2026-09-10.md
  • raw/articles/a2a-tck-conformance-coverage-and-security-boundaries-2026-09-10.md
  • raw/articles/redagentbench-state-grounded-safety-measurement-2026-09-10.md
  • raw/articles/pillar-docker-socket-sandbox-trust-handoff-2026-09-10.md
  • raw/articles/aembit-mcp-per-user-identity-raw-only-2026-09-10.md
  • raw/articles/ietf-agent-security-benchmark-draft-00-raw-only-2026-09-10.md
  • raw/notes/ai-knowledge-radar-2026-09-10.md

更新文章(路径前缀 wiki/ai/concepts/):

  • MCP-Gateway-Runtime.md
  • A2A-Agent2Agent-Protocol.md
  • Agent-Benchmarks.md
  • Harness-Engineering.md
  • AI-Knowledge-Point-Radar.md

导航/审计:_index.mdlog.md。工具修正:../bin/wiki-query。语义索引由既有 wiki-vquery-run 维护,不更换云端后端,也不修改 vector 工具。派生文件为 ../.vector_index/wiki.faiss../.vector_index/meta.json

写入记录

  • 2026-09-10 09:11 CST:新增当天自我优化、候选评分及文件清单,记录三类机制检查、低风险修正、未执行范围和后续建议。
  • 2026-09-10 09:29 CST:补记真实 QA、全量向量索引与四主题召回结果;修复关键词查询少计 12 篇的问题并通过目录/类型/检索回归,保留历史断链及超长页的维护边界。