← 返回藏书阁

claim-trace — measured-evidence claim atom

wiki/ai/sources/claim-trace-evidence-claim-atom.md
分类:ai / sources · 更新:2026-08-11 09:05

claim-trace — measured-evidence claim atom

一句话结论

claim-trace 是一个极小的 claim = trace 评估原语:只有当自然语言完成声明的 requirements 能被 measured evidence 匹配时,claim 才能 PASS。

为什么对用户重要

用户的 Hermes 操作原则已经要求“不要编造工具输出”。claim-trace 把这个原则降到可复用的最小库/CLI 层,适合作为 llm-wiki radar 和 coding-agent 完成报告的轻量 claim audit 模式。

机制 / 一阶原理

机制很简单:claim 被结构化为文本与 requirements;evidence 是 key/value/source 列表;评估只比较 requirement 与 evidence 是否匹配,输出 PASS/FAIL/UNKNOWN。它不试图判断复杂语义,只把“叙述不能自证”变成机器可检查的底线。

与已有 wiki 概念的关系

它与 claimproof-evidence-gated-agent-claims 高度相邻,但 claim-trace 更小,像 public atom;也连接 Agent-Benchmarks 的 reporting honesty、Harness-Engineering 的 verification membrane、Context-Engineering 的 report claim evidence。

对 Hermes / llm-wiki / agentic workflows 的启发

低风险优化:每日 radar 最终报告中的“已保存 raw / 已创建页面 / 已更新 index / 已重建向量”可以逐步转成 claim requirements,并由文件存在、mtime、命令 exit code 提供 evidence。先不需要完整框架,只需在自我优化文章中记录哪些 claim 有 receipt、哪些是 LLM synthesis。

失败模式与边界

  • 过于极简,不能替代完整评测、语义 judge 或安全审计。
  • Claim schema 需要人工/规则定义;如果 requirements 漏掉关键风险,PASS 仍可能误导。
  • 零 star / 新项目,入库价值在于原语模式,不在于生态成熟度。

深度判断

本条目晋升为正式 source page,因为它不只是新闻或工具列表,而是提供了可迁移到 Harness-EngineeringContext-EngineeringAgent-BenchmarksExternal-Agent-Skills-Design-Patterns 的结构性模式。当前置信度标为 medium:本次主要基于仓库 README 和 GitHub 元数据,尚未独立复现实验或安全声明。

相关页面

写入记录

  • 2026-08-11 09:00 CST:从 GitHub README 深度入库,提炼机制、实践启发、失败模式,并连接到既有 agent workflow / skill / benchmark 概念。