← 返回藏书阁

llm-wiki 自我优化 2026-08-06

wiki/ai/sources/llm-wiki-optimization-2026-08-06.md
分类:ai / sources · 更新:2026-08-06 09:11

llm-wiki 自我优化 2026-08-06

今天从 radar 学到什么

今天的高价值材料显示,llm-wiki 的 AI/工程雷达不能只围绕 coding-agent 修 bug、runtime guardrail 或 context pack。至少还有三类 durable signal:

  1. Observation surface 扩展agent-vision-toolkit 表明很多 agent failure 来自看不见截图/UI/图表,而不是推理能力不足。知识库应把视觉证据视作一等上下文来源。
  2. Artifact behavior / diversity benchmarksitegeist-visual-convergence-benchmark 表明 coding-agent 产物不只要能运行,也要能评估重复套路、视觉趋同和生成边界。
  3. Domain-realistic benchmark 与 paired skill studypibench-payment-integration-benchmarkperformance-skill-dotnet-performance-agent-skill 表明,领域 skill 的价值要回到真实 workflow 和对照实验,而不是 README 完整度。

已做的低风险优化

  • Context-Engineering 增补“视觉证据 / artifact diversity”段落,把截图、UI、坐标、视觉 diff 纳入上下文工程。
  • Agent-Benchmarks 增补 Sitegeist 与 PIBench,强调视觉 artifact 趋同、业务状态一致性和 with-skill vs baseline paired study。
  • External-Agent-Skills-Design-Patterns 增补 observation surface 与深领域 skill 渐进披露模式。
  • _index.md 已加入今天新增 source 页面,避免新材料只存在文件系统中而无法从导航发现。

对后续 radar 的调整

  • 关注名单应新增/提高权重:visual agent benchmarkartifact diversityUI generation convergencemultimodal coding agent toolsdomain coding agent benchmarkpaired skill studyperformance engineering skill
  • 每日候选评分应继续保留 depth-potential,但对视觉/benchmark/source skill 额外标记:是否有可复查 artifact、是否有隔离生成边界、是否有 with/without skill 对照。
  • 对外部视觉工具/skill 的入库不等于安装。若未来要安装到 Hermes,应先做 Assay-style admission:权限、图片隐私、API 出站、样例 dry-run、失败时不确定性表达。

未解决问题 / 失败模式

  • GitHub raw 读取偶发 timeout,今天 Sitegeist README 第一次保存失败,重试成功。radar 应把“fetch retry + partial evidence 标记”作为固定 receipt。
  • arXiv API 在最近多天常 timeout/429,导致技术报告补证不足。PIBench 后续值得单独补读 arXiv 2607.14573。
  • log.md 已超过 500 entries,按 schema 应轮转;这是维护级改动,今天只记录建议,避免在无人 cron 中做大范围日志迁移。

写入记录

  • 2026-08-06 09:00 CST:新增当天 llm-wiki 自我优化文章,总结视觉观察层、artifact diversity benchmark、domain benchmark 与 skill paired study 对知识库维护的启发。