Data Eng Bench — data-engineering benchmark for coding agents
Data Eng Bench — data-engineering benchmark for coding agents
Data Eng Bench 是 Snowflake Labs 发布的数据工程 coding-agent benchmark。它把 agent 放入真实感较强的 dbt retail warehouse 项目中,要求根据 ticket-style instruction 修改或创建 dbt models、运行 dbt,并由隐藏 pytest verifier 对 materialized tables 做逐行校验。任务既可在 DuckDB hermetic 环境运行,也可切换到真实 Snowflake backend,以区分通用 SQL/dbt 能力与 Snowflake-specific 差距。
为什么这对用户重要
过去 coding-agent benchmark 多集中在通用软件 bug 修复。Data Eng Bench 的价值在于把评测推进到 数据工程领域现实性:业务指标、dbt materialization、warehouse backend、SQL 方言、角色/warehouse 配置、隐藏 verifier。对用户关注的 Agent-Benchmarks 来说,它说明 agent 评测需要覆盖专业工作流,而不是只看通用 SWE pass rate。对 Harness-Engineering 来说,它提供了一个“领域任务 + hermetic backend + real backend 对照”的 benchmark 设计模式。
机制 / 一阶原理
Data Eng Bench 的一阶原理是:领域 agent 的真实能力必须在接近生产语义的任务世界中测量。
关键设计:
- 103 个 dbt 数据工程任务,覆盖 analytics、development/bug-fixes、dimensional modeling/snapshots、data engineering。
- 默认 DuckDB 变体完全 hermetic,不需要 Snowflake 账号,用于隔离 SQL/dbt 逻辑能力。
- Snowflake 变体运行同一任务集,用于暴露方言、warehouse、role 和实际平台差异。
- 隐藏 pytest verifier 逐行检查 materialized tables,而不是只看代码是否能运行。
- 基于 Harbor 运行,因此多个 agent/harness 可以在统一任务协议下比较。
与已有 wiki 概念的关系
- 与 Agent-Benchmarks:补充 domain-specific benchmark 和 hidden verifier 设计。
- 与 Harness-Engineering:环境、任务、agent、backend、verifier 明确分层。
- 与 Context-Engineering:数据工程任务需要理解业务语义、表关系、模型依赖和 backend constraints。
- 与 Agentic-Coding:说明 coding agent 的价值不只在通用 repo 修复,也在专业工程栈任务自动化。
对 Hermes / llm-wiki 的可执行启发
- benchmark 应有双环境设计:先用低成本 hermetic 环境评估逻辑,再用真实 backend 找平台差异。
- 领域页面不能只写工具摘要:正式入库应说明业务状态一致性、隐藏 verifier、平台边界和 failure modes。
- llm-wiki radar 需要领域轮换:AI/agent benchmark 不能只看 SWE;应定期覆盖 data、DevOps、安全、支付、工业运维、视觉/产品设计等领域。
- 隐藏 verifier 思路可迁移到 wiki:页面生成不是最终证据;还需结构检查、wikilink 检查、raw hash、写入记录、index/log 验证。
失败模式 / 边界条件
- 数据工程任务可能更依赖领域知识和 schema 探索,分数不能直接等同于通用 coding 能力。
- Snowflake 变体引入账号、费用、权限和环境差异,复现实验成本更高。
- Hidden verifier 虽能防止 hard-code,但若任务语义过窄,agent 可能学会 benchmark-specific patterns。
- 对个人 Hermes 工作流,完整运行这类 benchmark 成本较高;更适合作为设计参考和周期性抽样评测。
写入记录
- 2026-08-08 09:00 CST:新增 Data Eng Bench 的 source page,提炼其领域现实性、DuckDB/Snowflake 双环境和 hidden verifier 对 agent benchmark 设计的启发。