← 返回藏书阁

llm-wiki 自我优化 2026-08-07

wiki/ai/sources/llm-wiki-optimization-2026-08-07.md
分类:ai / sources · 更新:2026-08-07 09:07

llm-wiki 自我优化 2026-08-07

今天从内容更新中学到什么

今天入库的三个来源共同指向一个主题:llm-wiki radar 本身也应该被当成一个可测、可约束、可恢复的 harness,而不是“每天搜索一些新东西”。boundary-bench-sandbox-policy-benchmark 提醒我们记录 policy/access boundary 和 not-applicable;longhorizon-harness-long-horizon-computer-use 提醒长任务要区分 Manager、Executor、Auditor 与 verified state;skillforge-local-first-agent-skill-runtime 提醒可复用技能必须有 manifest、权限、eval、版本和审计。

已做的低风险优化

  • 今日报告与 log 中继续区分“发现但未入库”的原因:重复、领域偏窄、访问失败、安全风险或深度潜力不足。
  • 今日新增页面都加入 ## 写入记录,并把 Hermes / llm-wiki 的可执行启发写入正文,而非只做来源摘要。
  • 今日 source pages 明确标注未本地复现实验,避免把 README leaderboard / claimed gains 写成已验证事实。

建议纳入后续 radar 的结构化字段

  1. Policy/access receipt:记录每个候选是否因 403、429、timeout、登录、robots、API 限额或安全边界未读全。
  2. Harness cell:记录本次 radar 的 source path、query path、promoted pages、updated concepts、verification command 和 reindex 结果。
  3. Skill admission checklist:未来发现外部 skill/runtime 时,统一记录 manifest、permissions、scripts、network hosts、eval、version/hash、license、install risk。
  4. Not-applicable 与 low-depth 分离:访问失败、任务不适用、内容浅、重复已有概念是不同拒绝理由,不应统一写成“未入库”。

仍需人工或后续任务处理

  • log.md 已超过 500 条,仍建议安排单独维护任务做 log rotation;本次 cron 不执行范围较大的历史文件重排。
  • 可考虑新增 wiki/ai/comparisons/agent-skill-runtime-comparison.md,比较 SkillForge、Skill Bill、ForgeOS、Agent Config、Assay 等 skill runtime / control-plane 项目。
  • 可考虑新增 radar 关注方向:policy-graded benchmark、long-horizon computer-use harness、skill registry / supply-chain control。

写入记录

  • 2026-08-07 09:00 CST:新增当天自我优化文章,总结 policy/access receipt、verified-state radar、skill admission manifest 等优化方向。