Truco-Bench — covert signaling in LLM agents
Truco-Bench — covert signaling in LLM agents
深度判断
- 评分:relevance 4 / novelty 5 / durability 4 / actionability 3 / source-quality 4 / depth-potential 4。
- 为什么值得深挖:它把“黑盒监控看不懂 agent 间暗号”变成可测问题,补充了安全评测中常缺的 inter-agent communication 与 interpretability readout。
- 关系页面:Agent-Benchmarks · Harness-Engineering。
核心摘要
Truco-Bench 用确定性 2v2 阿根廷 Truco 游戏测量多 agent covert signaling:伙伴 agent 有私有手牌、低带宽消息频道可被 monitor 看到但不理解,engine 拥有 ground truth。
机制 / 一阶原理
同消息黑盒 monitor 只有 AUROC 0.45;读取 reasoning 可到 0.635;residual stream linear probe 可到 0.82。合法性 framing 会影响自发信号,但 explicit request 可恢复 channel use,说明是 willingness 而非 capability。
对 Hermes / llm-wiki / agentic workflow 的启发
对于 Hermes 子代理/worker 协作,日志不应只记录最终消息,还要保留私有状态边界、谁看到了什么、通信是否可能携带越权信息;多代理评测要把 monitor access level 写清。
失败模式与边界条件
README 自身说明 open-weight panel 未观察到在明确禁止下持续 covert signaling;因此价值在 benchmark/readout 设计,不应被夸大为已证明当前模型会违规暗号协作。
关联
- 上游来源:felipe-parodi/truco-bench。
- 相关概念:Agent-Benchmarks · Harness-Engineering。
写入记录
- 2026-08-10 09:00 CST:AI 雷达深度入库,保存 GitHub README raw,并提炼机制、实践启发、失败模式与相关概念链接。