← 返回藏书阁

da-verify:程序化验证优于同模型自检的 agent harness

wiki/ai/sources/da-verify-programmatic-verification-harness.md
分类:ai / sources · 更新:2026-09-02 09:06

da-verify:程序化验证优于同模型自检的 agent harness

核心判断

da-verify 是一个 data-analysis LLM agent + evaluation harness,核心问题不是“又做了一个 agent”,而是用受控实验比较验证策略:C1 同模型 self-check 无提升;C2 独立 LLM re-derivation 在 temp 0.7 / k=5 下有提升;C3 self-consistency + 程序化 agreement gate 达到 README 报告的 pass@1 84.5%,相对 C0 +20.0pt,且没有让 LLM judge 答案。它值得入库,因为它给 Agent-BenchmarksHarness-Engineering 一个清晰机制结论:验证主要修复采样方差,不是凭空增加模型能力;最可靠的 verifier 应尽量程序化、与求解路径分离。^[raw/articles/da-verify-programmatic-verification-harness-2026-09-02.md]

深度判断

  • relevance 5/5:命中 agent benchmark 的可复现评测设计、hidden/programmatic verifier、轨迹/成本/重复次数。
  • novelty 4/5:同模型自检无效、程序化 agreement gate 更强,是可迁移的 harness 设计结论。
  • durability 5/5:验证修复 variance 而非 capability 是长期方法论。
  • actionability 5/5:可直接迁移到 Hermes wiki ingest、代码修改、数据分析任务的完成门禁。
  • source-quality 3/5:README 很详细、含 CI/tests/report 入口,但仍需读完整 report 和复现实验后才能 high confidence。
  • depth-potential 5/5:适合沉淀为本地 workflow 的 verification membrane 设计原则。

为什么这对用户重要

Hermes 经常需要报告“我已验证、我已写入、我已跑测试”。da-verify 的启发是:验证如果仍由同一个模型在同一路径上自我检查,很容易只是增加语言说服力;真正有用的是 独立样本 + 程序化 reconciliation + 任务自身 tolerance。对 llm-wiki,类似原则可以用于:raw hash 是否匹配、页面是否有写入记录、index/log 是否包含新页、wikilink 是否可解析、vector index 是否可查询。

这也能改进用户的 agentic coding 实践:让 agent 多次生成候选并用测试/脚本/静态检查做 agreement gate,比让模型读一遍自己生成的 patch 再说“看起来没问题”更可靠。

机制 / 一阶原理

  1. C0 baseline:直接求解,给出原始 pass@1 / pass@k。
  2. C1 self-check:同模型检查自己答案;README 报告 Δ 0.0%,说明同路径自检很难发现系统性错误。
  3. C2 independent re-derivation:重新独立求解并比较;只有在 temp 0.7 / k=5 产生足够采样多样性时才显著。
  4. C3 programmatic agreement gate:两次独立求解,若所有 required fields 在 grader tolerance 下达成一致则接受;否则第三次 tie-break。关键是 “No LLM ever judges anything”。
  5. 误差归因:失败集中在不可复现 gold 与 confident-wrong systematic errors,这说明 verifier 不能修复任务定义错误或模型共同盲点。

与既有 wiki 概念的关系

  • Agent-Benchmarks:补充重复次数、paired bootstrap、McNemar、pass^5、format-ok 等统计/可靠性指标。
  • Harness-Engineering:验证门禁应靠近可执行标准,而不是靠模型自述。
  • Loop-Engineering:长期 loop 的状态推进应由 fresh receipts 控制;agreement gate 是一种轻量外部证据。
- [[agentops-coding-agent-verificationAgentOps coding-agent verification membrane]]:da-verify 为 verification membrane 提供了实证机制:独立与程序化比同模型 judge 更关键。

对 Hermes / llm-wiki 的可执行启发

  1. wiki radar 的最终报告声明应尽量绑定程序化 receipt:文件存在、hash、grep/index、reindex 状态。
  2. 对数据分析/评估类任务,优先设计 deterministic scorer 或 programmatic agreement gate;没有 scorer 时降低 confidence。
  3. 对 coding-agent 任务,重复采样应只在有外部 verifier 时使用;否则 k 次输出只是 k 次自信表达。
  4. “验证修复 variance” 应进入本地 benchmark 设计:temp 0 / deterministic 单样本任务上,昂贵 verifier 可能收益很低。

失败模式、边界条件与未解问题

  • 程序化 agreement gate 依赖任务可被程序检查;开放式设计、架构判断、产品策略难以直接套用。
  • 多样本会增加成本;报告提升时必须同时报告 token、latency、k、temperature 和失败重试策略。
  • 如果两个独立样本共享同一系统性错误,agreement 可能放大 confident-wrong;需要 error taxonomy 和 adversarial cases。
  • README 的数字需读完整 report / commit / raw results 后才能 high confidence,本页先标 medium。

写入记录

  • 2026-09-02 09:00 CST:根据 da-verify README 深度入库,提炼验证修复方差、同模型自检无效、程序化 agreement gate 与 Hermes claim-level receipt 启发。