This study audits online memory and skill modules against a plain web agent allowed to spend more budget on execution.
Comparing agents at equal action limits can hide the extra token cost of inducing, verifying, retrieving, and injecting memory.
The analysis records executor and auxiliary costs, adds a stronger stateless baseline, and measures run-to-run variation.
AWM, ASI, and ReasoningBank build experience during ordered task execution, while Vanilla-IB uses additional action steps without cross-task state.
Token accounting includes auxiliary model calls and the executor's longer prompts caused by retrieved knowledge.
Ablations separate the extra step allowance from deterministic accessibility-tree text pruning.
Experiments cover four WebArena domains with three models and repeated runs, plus WorkArena-L1.
The 10-versus-15-step comparison approximates budget matching rather than enforcing identical per-task token caps, and the findings do not rule out benefits from amortized offline skill libraries.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 本轮阅读优先级 P0 · 记忆收益同预算审计
摘要译文,依据本轮缓存的 arXiv 摘要页;原文采用 CC BY 4.0 许可。以下保留作者摘要中的表述,预算匹配方式及具体反例见第4节。
在线网页代理经常通过记忆、工作流或技能模块增强基础执行器。这些模块可以改善性能,但也会消耗测试时 token,而这部分成本很少与执行器的推理成本一起报告。我们研究每个任务都会支付这类额外开销的在线增强,并在固定总推理预算下重新评估其收益。我们将 AWM、ASI 和 ReasoningBank 与 token 预算匹配的普通基线比较;普通基线将相同预算用于增加执行器步骤。
在 WebArena 的四个领域、Gemini 3 Flash、GPT-5.4-mini 和 Qwen 3.6-27B 三个模型上,普通基线的总体成功率达到或超过全部三种增强方法,同时往往使用更少的总 token。使用 Qwen 3.6-27B 在 WorkArena-L1 上也观察到类似趋势,表明该现象延伸到了企业知识工作任务。
我们的结果表明,技能和工作流记忆可能对特定领域有用,但与预算匹配的执行器相比,其表面收益往往消失。我们进一步表明,不同运行之间的方差会实质性影响结果,应将其作为在线网页代理的核心评测指标报告。
在线生成技能、整理记忆和验证经验都要调用模型,检索出的内容还会进入执行器后续提示。若只给普通代理相同动作步数、却忽略增强代理额外消耗的 token,比较就同时改变了结构和总计算预算,难判断辅助模块本身是否值得。
作者提出一个直接控制:把这些 token 留给普通执行器,让它多观察、多尝试几步。研究针对评测期间持续建库的在线方法,讨论的是有限任务序列内的资源分配;并不否定已有稳定技能经过大量复用后可能有更好摊销效果。
| 对比对象 | 预算如何分配 | 本文揭示的具体问题 |
|---|---|---|
| AWM | 执行器+工作流归纳和注入 | 额外经验未必优于增加主执行步数 |
| ASI | 执行器+代码生成、验证和复用 | 需计入技能创建与上下文成本 |
| ReasoningBank | 执行器+成功失败记忆整理 | 有时更省执行器输入,但模块仍有开销 |
| 相同步数普通代理 | 不补偿增强模块计算 | 容易把额外预算贡献算作结构贡献 |
| 离线技能方法 | 先建库再长期复用 | 不属于本研究主要比较,需另一套摊销核算 |
这个研究贡献的是成本审计和更强控制,不是证明所有技能无用。在线依赖确实使严格顺序协议不易并行,但工程上也可设计冻结或分批更新版本,不能把全部有记忆系统都视为必然串行。
四域按任务数加权的结果中,Gemini 的 Vanilla-IB 为 44.78% 成功率、每任务 73.6k token;ASI 为 41.02%、107.3k,AWM 为 39.34%、99.3k,ReasoningBank 为 39.33%、82.6k。Qwen 的 Vanilla-IB 为 42.14%、95.5k,ASI 为 40.15%、125.8k。论文表1
不能概括为普通基线在所有设置都更省:GPT-5.4-mini 的 Vanilla-IB 为 32.67%、90.2k,AWM 为 27.02%、88.5k,ReasoningBank 为 24.58%、81.0k。WorkArena-L1 中 Vanilla-IB 与 ReasoningBank 同为 55.56%,分别消耗 109.4k 与 120.3k;AWM 为 53.53%、102.8k,是不同成功率—成本位置。
预算边界: 15 步是近似匹配,并未给每个任务设统一硬 token 额度;增强方法本身消耗也不同。裁剪与额外步数分别有消融,但严格同预算结论仍应看成本曲线而非单一上限。三次运行的任一次成功只是波动诊断,不是提供免费重试后的部署成功率。
作者承认这些任务大多独立,未强制长期记忆,离线发现技能及更同质的长期任务可能改变结论。本文没有单任务端到端计时;无共享状态的 N 工作者最高 N 倍并行是理想化吞吐讨论,不是实测每任务加速。
原文给出官方项目页;本轮未确认该页面下具体代码发布内容,也未读实现。最小复现重点是统一账本:把每次模型调用标为执行、归纳、验证或检索,保留输入/输出及被注入执行器的知识长度。
先复现四域、三次运行、10 对 15 步及父子重复文本裁剪,再画多个预算点的成功率—总 token 曲线。复现建议增加真实墙钟时间、API 缓存计费和失败任务成本,并对在线库重置与任务顺序作固定记录;若评估离线技能,应另外画包含建库成本的复用次数曲线,不能直接套用本文结论。
核心思想:让辅助模块与更多行动比成本。
速记流程:记录所有调用 → 给普通代理更多步 → 重复运行比较 → 按总成本判断收益
辅助建库/整理/注入都计费,再给普通基线更多行动预算;是ACL效率主张必须应对的反例。
本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。
原文阅读定位:Online workflow, memory, and skill induction.;Alternative paradigms and evaluation robustness.;3 Experimental settings;3.1 Tasks and domains;3.2 Studied systems;3.3 Models and budget accounting;4 Main results;5 Audit beyond aggregate success rate;5.1 Run-to-run variance;5.2 Programmatic skill fragility;5.3 Effect of accessibility-tree pruning;6 Practical advantages of stateless evaluation;Appendix A Implementation details;Appendix B Accessibility-tree pruning;Appendix C Effect of pruning on the augmented baselines;Appendix D Results at a higher step budget;Appendix E Prompt templates;Appendix F Failure mode analysis of augmented agents;F.3 ReasoningBank: Contamination and memory over-application;Appendix G Per-run variance results。完整章节及图表索引见原论文:章节、图注与来源 / Original paper。
Open this note in the interactive notebook (comments, hooks) → · All notes