← 返回藏书阁

ARC:压缩可见上下文,而非销毁可回读证据

wiki/ai/sources/arc-addressable-recall-context-compaction.md
分类:ai / sources · 更新:2026-09-11 09:12 最近更新

ARC:压缩可见上下文,而非销毁可回读证据

结论与深度判断

Addressable Recall Compaction(ARC)把“保存什么”与“本轮给模型看什么”分开:工具观察原文进入 append-only store,上下文只保留有限预览和稳定引用,需要时按地址取回。可恢复不等于会想起,也不等于任务完成

知识点轴:context management / harness-runtime / benchmark-evaluation。这是一篇 2026-07 的补洞来源,不是今日新闻。值得深挖的是稳定地址、预算和精确回读合同,可直接迁移到 llm-wiki;实验数字存在指标口径问题,因此不把论文的效果与显著性当已确认事实。

为什么对用户重要

长雷达/代码排查中,最容易被摘要抹掉的恰好是报错原文、ID、版本、特定否决理由及工具返回的中间字段。重新搜索网页不保证取回当时版本;重新执行工具还可能有费用或副作用。

Context-Engineering 已有 offloading、引用和 replay tax;ARC 补的是“对那次观察有确定地址,不靠猜关键词重新找到”。它与 nvidia-nooa-object-oriented-agent-harness 的 pass-by-reference 和 memory-compaction-rate-distortion-agents 的保真度预算相连,但不要求把所有引用常驻上下文。

工作机制

  1. 先存再压缩:每次正常 action 的 observation 原文入外部 store;保留 action signature、return code、创建 step、长度、固定头尾预览及 recall 状态。
  2. 留下稳定引用:移除大段 observation 时留下 §id 和回读提示,后续压缩不随意更名。实现描述用 action signature 与 observation 的 SHA1 摘要形成短地址,碰撞时扩展;这是寻址方案,不应拿它充当安全认证。
  3. 明确回读动作_recall §id 由 framework 截获,不再执行原环境工具;_recall_meta 只取 metadata。无效地址给出错误/近似建议,不能把近似命中悄悄当成原对象。
  4. 视图预算分开管理:任务前缀、确定性摘要、recent suffix、外部 citation catalog 的一页、已回读内容各占预算。大对象分块精确返回,超预算时将旧回读内容退回引用。
  5. 发现与寻址互补:已知地址时精确取回;不知道地址时仍需要目录/检索选中它。外部 catalog 可增长,当前 prompt 只加载有限一页。

“无损”到底保证哪一层

论文保证有条件:原文先入库;标识在声明的任务容量内唯一;引用目录放在外部;每次模型调用前执行 active-view budget;超过单次预算的正文通过非重叠分块还原。在这些条件下,给定有效地址的原文可恢复性和有界输入可以同时成立。

但模型可能选错 ID、没意识到要 recall,或读回后推理错误。固定大小上下文也不意味着存储不增长。所有引用永远可同时见到与无限长任务的固定预算不兼容,必须承认目录分页和发现开销。

另一个重要界限:实现介绍了 reactive overflow recovery;理论要求每次调用前守预算,实际 real-LLM 评测描述使用 overflow 后恢复和固定 call indices。不能将该实验直接写成“任意生产运行从不发生 context overflow”。

评测:保留结果、拒绝偷换口径

本次读到 arXiv 2607.25066v1 完整 HTML 文本及表格/附录,没有运行模型或作者代码。来源研究使用 Qwen3-8B/32B,16k/32k 窗口,completion cap 4096;这只是作者配置,不建议安装本地推理栈。

  • Needle-in-a-Haystack:作者摘要报告跨两配置平均准确率 99.40%,最佳基线 88.12%。它主要检验明确目标 token 的精确恢复,不代表通用 coding/规划能力。
  • LongBench-v2 Hard:311 个任务、3 seeds、每方法 933 attempts;摘要报告平均 29.97%,最佳基线 28.25%。和 needle 的明显收益不同,复杂推理仍会失败。
  • 费用部分主要基于 H200 roofline/hardware model 估算;Table 3/4 还注明按 successful submitted trajectories 汇总。不能改写成全任务实测墙钟、用户 GLM/OpenAI API 账单节省或普适速度提升

未解决的内部一致性问题

原文 Table 1 中 Qwen3-8B ARC 正确数是 256/933;Table 5 的 ARC 对 LLM_summary 配对表却有 91 + 793 = 884 个 ARC 成功。这个数量接近用 No-Answer 推得的完成提交数,而不是 Table 1 正确数。文中虽说 correctness 与 completion 分开测试,但表 5/讨论又用成功/优势表述混在一起。本轮无法认定那些显著性结果针对准确率还是完成率

本机只核对表格算术和标签,没有用猜测改写作者数据;contested: true 专指这一未解释口径。正式采用前需原始 per-trial correctness/completion 标签和重算配对检验。Agent-Benchmarks 应拒绝用“能提交答案”替代“答案正确”。

对 Hermes / llm-wiki 的迁移,不是照搬整个框架

  • 保留现有 raw → source → concept → index 分层:概念页作为有损工作视图,raw 作为不可变来源;摘要不能成为唯一证据。
  • 已知 raw 路径后用精确路径/段落回读,而不是反复运行 web search 或 vector top-k。语义检索负责发现,地址回读负责确认,二者并存。
  • 原文抓取本身也要有 completeness 检查:今天 web_extract 返回的 SPA/ARC 文件在约 50k 字符处截断;本轮通过原始 HTML 恢复更完整的文本。保存了截断文件不等于已经保存全文
  • 做小规模真实任务对照时分别记录:能否定位地址、关键字段逐字恢复、回读工具成本、重复外部调用、最终任务正确性;不以压缩率一项验收。

安全上需结合 spa-plan-first-label-preserving-persistent-agents:原文回读不提升其信任,身份/机密性应随对象走。原文无损保存与遗忘权、保留期限、访问权限也存在张力;未来若实现 runtime store,必须为对象设置访问边界,而非让任意 task 枚举全部历史。

原始入口

论文 v1

写入记录

  • 2026-09-11 09:09 CST:新增地址可恢复性、有界工作视图与目录分页机制;读取完整原文并标记 correctness/completion 口径疑点,明确费用为特定模型估算和成功轨迹口径,不声称复现效果。