← 返回藏书阁

llm-wiki 自我优化 2026-08-04

wiki/ai/sources/llm-wiki-optimization-2026-08-04.md
分类:ai / sources · 更新:2026-08-04 09:09

llm-wiki 自我优化 2026-08-04

今天从内容更新中学到什么

今天入库的三类材料共同指向一个变化:llm-wiki radar 不应只追“新工具/新 repo”,而应把自己也当作一个受治理的 agent workflow。skill-bill-governed-agent-skill-runtime 强调长流程需要 durable state、阶段门禁和 drift contract;agentlint-runtime-guardrails 强调规则应尽量靠近 effect boundary;assetopsbench-industrial-agent-benchmark 强调 benchmark 要有 domain realism、specialist roles 和真实协议边界。

这说明 llm-wiki 的复利质量取决于两件事:一是每天少量深挖高价值材料;二是把 orient、raw、source page、concept update、_index、log、reindex、报告 receipts 这些步骤逐步变成可检查合同,而不是只靠模型“记得”。

今天已经做的优化

  1. Harness-Engineering 中补充 governed skill runtime、runtime guard 与 domain-specific benchmark,明确高频自动化应拆成 skill runtime + hook guard + receipt report。
  2. Agent-Benchmarks 中补充 domain realism、guard adoption、skill-runtime reliability,作为未来评测 llm-wiki radar 自身的指标。
  3. External-Agent-Skills-Design-Patterns 中补充 runtime contract 与 hook contract,避免只按 README/星标判断外部 skill 是否可进入无人执行路径。
  4. 本次入库继续保留未晋升理由,避免把所有搜索命中都压缩成正式页面。

下一步低风险改进方向

  • 给每日 radar 增加机械结构检查:新增/更新页是否有 ## 写入记录、raw 是否有 sha256、_index/log 是否更新、报告里的文件路径是否存在。
  • 为外部 skill/source note 增加轻量字段:runtime_contracthook_contractpermissionsrecoveryverification。不必一次性改历史页,可从新增页开始。
  • 每周轮换一次 discovery 主题,把 domain agent benchmark / MCP evaluation / safety guardrail 纳入 radar,避免连续多天只收敛到 coding harness repo。

未解问题 / 边界

  • 是否要把 radar workflow 写成真正可运行的 eval / linter,需要另开维护任务;今天只做低风险知识结构更新。
  • AgentLint 类 hook guard 与 Hermes 当前工具层如何对接,需要查 Hermes 插件/skill/runtime 文档后再决定,不能直接安装外部工具。
  • AssetOpsBench 的论文/venue claims 需要后续用 arXiv/官方页面复核;今天基于 README 入库,置信度保持 medium。

写入记录

  • 2026-08-04 09:00 CST:新增当天 llm-wiki 自我优化文章,总结 governed skill runtime、runtime guard、domain benchmark 对 radar 和知识库维护流程的启发。