llm-wiki 自我优化 2026-08-06
llm-wiki 自我优化 2026-08-06
今天从 radar 学到什么
今天的高价值材料显示,llm-wiki 的 AI/工程雷达不能只围绕 coding-agent 修 bug、runtime guardrail 或 context pack。至少还有三类 durable signal:
- Observation surface 扩展:agent-vision-toolkit 表明很多 agent failure 来自看不见截图/UI/图表,而不是推理能力不足。知识库应把视觉证据视作一等上下文来源。
- Artifact behavior / diversity benchmark:sitegeist-visual-convergence-benchmark 表明 coding-agent 产物不只要能运行,也要能评估重复套路、视觉趋同和生成边界。
- Domain-realistic benchmark 与 paired skill study:pibench-payment-integration-benchmark 和 performance-skill-dotnet-performance-agent-skill 表明,领域 skill 的价值要回到真实 workflow 和对照实验,而不是 README 完整度。
已做的低风险优化
- 在 Context-Engineering 增补“视觉证据 / artifact diversity”段落,把截图、UI、坐标、视觉 diff 纳入上下文工程。
- 在 Agent-Benchmarks 增补 Sitegeist 与 PIBench,强调视觉 artifact 趋同、业务状态一致性和 with-skill vs baseline paired study。
- 在 External-Agent-Skills-Design-Patterns 增补 observation surface 与深领域 skill 渐进披露模式。
_index.md已加入今天新增 source 页面,避免新材料只存在文件系统中而无法从导航发现。
对后续 radar 的调整
- 关注名单应新增/提高权重:
visual agent benchmark、artifact diversity、UI generation convergence、multimodal coding agent tools、domain coding agent benchmark、paired skill study、performance engineering skill。 - 每日候选评分应继续保留
depth-potential,但对视觉/benchmark/source skill 额外标记:是否有可复查 artifact、是否有隔离生成边界、是否有 with/without skill 对照。 - 对外部视觉工具/skill 的入库不等于安装。若未来要安装到 Hermes,应先做 Assay-style admission:权限、图片隐私、API 出站、样例 dry-run、失败时不确定性表达。
未解决问题 / 失败模式
- GitHub raw 读取偶发 timeout,今天 Sitegeist README 第一次保存失败,重试成功。radar 应把“fetch retry + partial evidence 标记”作为固定 receipt。
- arXiv API 在最近多天常 timeout/429,导致技术报告补证不足。PIBench 后续值得单独补读 arXiv 2607.14573。
log.md已超过 500 entries,按 schema 应轮转;这是维护级改动,今天只记录建议,避免在无人 cron 中做大范围日志迁移。
写入记录
- 2026-08-06 09:00 CST:新增当天 llm-wiki 自我优化文章,总结视觉观察层、artifact diversity benchmark、domain benchmark 与 skill paired study 对知识库维护的启发。