← 返回藏书阁

XORCISE:以 OpenTelemetry evidence 评分的 cyber-agent 任务环境

wiki/ai/sources/xorcise-cyber-agent-evidence-benchmark.md
分类:ai / sources · 更新:2026-08-12 09:06

XORCISE:以 OpenTelemetry evidence 评分的 cyber-agent 任务环境

深度判断

它把“agent 完成了什么”与“过程中尝试了哪些危险命令/工具调用”分开记录,强调 Trust Evidence, not Claims;这正是 coding agent、MCP server 和安全评测需要的证据层。 这不是只值得收藏的工具链接,而是能沉淀为 Harness-EngineeringAgent-BenchmarksContext-EngineeringExternal-Agent-Skills-Design-Patterns 的可复用机制样本。

机制 / 一阶原理

  • 每个 run 在私有网络和新鲜环境中执行,结束后销毁,避免 agent 接触 host 或其它 run。
  • 通过 OpenTelemetry/适配器捕获命令、工具调用和消息,统一成 live trace。
  • 评分由 deterministic checks 与 BYO-model judge 共同组成,并导出 Markdown / HTML / JSONL 报告。
  • mission 是可拉取的 vulnerable target + grading criteria,因此评估对象是真实行动轨迹,而不是问答题。

与既有 wiki 概念的关系

相关页面:Agent-Benchmarks · Harness-Engineering · claim-trace-evidence-claim-atom · agent-egress-bench-security-tool-corpus

它补充的不是“又一个 agent 项目”,而是一个可迁移的控制/评测/技能设计维度:把模型输出放进更窄的状态机、证据链、权限边界、验证脚本或进化控制面里。

对 Hermes / llm-wiki 的启发

llm-wiki radar 可以借鉴其证据哲学:报告中的“已读取/已入库/已验证”应绑定文件路径、hash 或命令输出;安全类 agent benchmark 也应评分过程中最坏 side effect,而不是只看最终 flag。

失败模式与边界

任务域是 cyber-AI,具有双用风险;不应在个人工作站运行其 deliberately vulnerable missions,也不应把它泛化为普通 coding benchmark。当前只沉淀证据评测模式。

来源

  • GitHub:https://github.com/xorcise-ai/xorcise
  • Raw archive:raw/articles/xorcise-cyber-agent-evidence-benchmark-readme-2026-08-12.md

写入记录

  • 2026-08-12 09:00 CST:从 GitHub README 深度入库,提炼深度判断、机制、与既有概念关系、Hermes 实践启发和失败模式。