AAABench — long-horizon game-world coding-agent benchmark
AAABench — long-horizon game-world coding-agent benchmark
深度判断
结论:晋升为正式 source page。 AAABench 值得入库,因为它把 coding-agent benchmark 从短 patch 推向长程、开放世界、真实引擎、视觉自检和无人运行。它不是给出排行榜,而是提供一个“能否在专业条件下持续构建一个可信世界”的 harness,这能补充现有 SWE/工具调用 benchmark 对 creativity、systems thinking、self-verification 和 session continuity 的盲区。
机制 / 一阶原理
机制上,AAABench 给 agent 一个 Unreal Engine 5 项目骨架、MCP 控制、生产知识库、21 个 skill pack、viewport capture/sensor、setup/runner/supervisor/health 脚本和严格 HARNESS-RULES:操作员只能提供条件、资源和 demand,不能诊断或提示修复。被测能力包括因果世界建模、长程执行、写作、视觉自检、系统工程和真实编辑器故障处理。
与已有 wiki 概念的关系
它与 Agent-Benchmarks 的 long-horizon/domain realism、Harness-Engineering 的 supervisor/health/effect boundary、Context-Engineering 的 production handbook/skills 和 External-Agent-Skills-Design-Patterns 的 domain skill pack 直接相关。相比 Active-SWE/Data Eng Bench,它更开放、更主观,也更考验 artifact integrity。
相关页面:Agent-Benchmarks · Harness-Engineering · Context-Engineering · External-Agent-Skills-Design-Patterns
对 Hermes / llm-wiki / agentic workflows 的启发
对 Hermes/llm-wiki 的启发:开放式生成任务不能只看最终“有产物”,要设计陌生人可评估的 artifact standard、视觉/运行时自检、无人 supervisor health、明确禁止人类提示修复的规则,以及区分 harness artifact 与 run output。日报也可借鉴:只报告候选和证据,不把 operator hint 混进结果。
失败模式、边界条件与未解问题
边界条件:主观质量难自动评分,运行成本高、平台依赖重,README 明确“harness only, no results”;没有多个模型/重复运行数据前,不能把样例截图当作可泛化结论。它适合沉淀为 benchmark 设计样本,而非短期本地复现目标。
来源与证据
- GitHub: https://github.com/ukanwat/aaabench
- Stars at ingest: 149
- Last pushed at ingest: 2026-08-12T18:22:34Z
- Raw archive: aaabench-long-horizon-game-world-benchmark-readme-2026-08-13
写入记录
- 2026-08-13 09:00 CST:从 GitHub README 深度入库,新增 source page、raw archive,并关联 harness/context/benchmark/skill 设计模式。