llm-wiki 自我优化 2026-08-07
llm-wiki 自我优化 2026-08-07
今天从内容更新中学到什么
今天入库的三个来源共同指向一个主题:llm-wiki radar 本身也应该被当成一个可测、可约束、可恢复的 harness,而不是“每天搜索一些新东西”。boundary-bench-sandbox-policy-benchmark 提醒我们记录 policy/access boundary 和 not-applicable;longhorizon-harness-long-horizon-computer-use 提醒长任务要区分 Manager、Executor、Auditor 与 verified state;skillforge-local-first-agent-skill-runtime 提醒可复用技能必须有 manifest、权限、eval、版本和审计。
已做的低风险优化
- 今日报告与 log 中继续区分“发现但未入库”的原因:重复、领域偏窄、访问失败、安全风险或深度潜力不足。
- 今日新增页面都加入
## 写入记录,并把 Hermes / llm-wiki 的可执行启发写入正文,而非只做来源摘要。 - 今日 source pages 明确标注未本地复现实验,避免把 README leaderboard / claimed gains 写成已验证事实。
建议纳入后续 radar 的结构化字段
- Policy/access receipt:记录每个候选是否因 403、429、timeout、登录、robots、API 限额或安全边界未读全。
- Harness cell:记录本次 radar 的 source path、query path、promoted pages、updated concepts、verification command 和 reindex 结果。
- Skill admission checklist:未来发现外部 skill/runtime 时,统一记录 manifest、permissions、scripts、network hosts、eval、version/hash、license、install risk。
- Not-applicable 与 low-depth 分离:访问失败、任务不适用、内容浅、重复已有概念是不同拒绝理由,不应统一写成“未入库”。
仍需人工或后续任务处理
log.md已超过 500 条,仍建议安排单独维护任务做 log rotation;本次 cron 不执行范围较大的历史文件重排。- 可考虑新增
wiki/ai/comparisons/agent-skill-runtime-comparison.md,比较 SkillForge、Skill Bill、ForgeOS、Agent Config、Assay 等 skill runtime / control-plane 项目。 - 可考虑新增 radar 关注方向:policy-graded benchmark、long-horizon computer-use harness、skill registry / supply-chain control。
写入记录
- 2026-08-07 09:00 CST:新增当天自我优化文章,总结 policy/access receipt、verified-state radar、skill admission manifest 等优化方向。