llm-wiki 自我优化 2026-08-16
llm-wiki 自我优化 2026-08-16
今天从内容更新中学到了什么
今天的高价值材料共同指向一个主题:llm-wiki 不只是知识页面集合,而是一个需要被评测和编译的 agent context/harness 系统。
- realreplicabench-stateful-business-agent-benchmark 提醒:任务完成要看状态改变和 artifact receipt,而不是自然语言声明。
- hermes-memconflict-memory-provider-benchmark 提醒:context provider 要区分“检索到正确证据”和“最终回答正确”,并固定 harness contract。
- pi-rlm-persistent-code-execution-tool 提醒:执行上下文可以是结构化 namespace / snapshots,而不是不断膨胀的 transcript。
- book-to-skill-technical-book-agent-skill 与 neuroarxiv-prior-art-scouting-skill 提醒:长期知识在某些任务中应被编译成按需加载的 skill / research gate。
- breachforge-agentic-exploit-containment-harness 提醒:安全评测必须区分正当完成与越界 shortcut;README 中未核验事件 claim 应保持低置信。
今天实际做的低风险优化
- 将 2026-08-16 的新增条目集中写入
_index.md的 AI 雷达区,避免散落在长来源列表里难以发现。 - 更新 Agent-Benchmarks、Harness-Engineering、External-Agent-Skills-Design-Patterns、Context-Engineering 四个概念页,把今天材料压缩到已有概念,而不是为每个术语创建薄概念页。
- 对 breachforge-agentic-exploit-containment-harness 设置
confidence: low,明确区分“harness 结构可学习”和“事件叙述未独立核验”。
对后续雷达的调整建议
- 增加 stateful benchmark / business replica 搜索轮换:不仅看 coding benchmark,也看 browser/API/MCP/file 混合任务。
- 增加 Hermes-specific memory/context provider benchmark 轮换:关注 MemConflict、context-provider eval、wiki-vquery retrieval evidence。
- 增加 compiled context / skill compiler 轮换:关注 book-to-skill、research-first skill、source-to-playbook 工具,但只学习结构,不自动安装执行包。
- 对安全事件类 README 使用 HOLD/low confidence:除非有官方公告、论文或第三方复盘,不把事件叙述当事实写入高置信概念页。
未解问题
- 是否需要为 llm-wiki 建一个轻量
radar_receipts.jsonl,记录每次 cron 的 query、候选、raw、页面、reindex 和失败原因?这会提升可评测性,但会增加维护文件。 - book ingestion 后是否应该自动生成 agent-facing skill?建议先只对用户会反复使用的方法书试点,而不是全量自动生成。
- wiki-vquery 是否应加入“证据命中率”自测集,借鉴 MemConflict,把 retrieval quality 与 answer quality 分开评估?
写入记录
- 2026-08-16 09:00 CST:新增当天 llm-wiki 自我优化文章,总结 stateful receipts、context-provider benchmark、compiled context 和安全低置信处理的雷达优化。