XORCISE:以 OpenTelemetry evidence 评分的 cyber-agent 任务环境
XORCISE:以 OpenTelemetry evidence 评分的 cyber-agent 任务环境
深度判断
它把“agent 完成了什么”与“过程中尝试了哪些危险命令/工具调用”分开记录,强调 Trust Evidence, not Claims;这正是 coding agent、MCP server 和安全评测需要的证据层。 这不是只值得收藏的工具链接,而是能沉淀为 Harness-Engineering、Agent-Benchmarks、Context-Engineering 或 External-Agent-Skills-Design-Patterns 的可复用机制样本。
机制 / 一阶原理
- 每个 run 在私有网络和新鲜环境中执行,结束后销毁,避免 agent 接触 host 或其它 run。
- 通过 OpenTelemetry/适配器捕获命令、工具调用和消息,统一成 live trace。
- 评分由 deterministic checks 与 BYO-model judge 共同组成,并导出 Markdown / HTML / JSONL 报告。
- mission 是可拉取的 vulnerable target + grading criteria,因此评估对象是真实行动轨迹,而不是问答题。
与既有 wiki 概念的关系
相关页面:Agent-Benchmarks · Harness-Engineering · claim-trace-evidence-claim-atom · agent-egress-bench-security-tool-corpus。
它补充的不是“又一个 agent 项目”,而是一个可迁移的控制/评测/技能设计维度:把模型输出放进更窄的状态机、证据链、权限边界、验证脚本或进化控制面里。
对 Hermes / llm-wiki 的启发
llm-wiki radar 可以借鉴其证据哲学:报告中的“已读取/已入库/已验证”应绑定文件路径、hash 或命令输出;安全类 agent benchmark 也应评分过程中最坏 side effect,而不是只看最终 flag。
失败模式与边界
任务域是 cyber-AI,具有双用风险;不应在个人工作站运行其 deliberately vulnerable missions,也不应把它泛化为普通 coding benchmark。当前只沉淀证据评测模式。
来源
- GitHub:https://github.com/xorcise-ai/xorcise
- Raw archive:
raw/articles/xorcise-cyber-agent-evidence-benchmark-readme-2026-08-12.md
写入记录
- 2026-08-12 09:00 CST:从 GitHub README 深度入库,提炼深度判断、机制、与既有概念关系、Hermes 实践启发和失败模式。