Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

See original paper
Research paper · arXiv:2606.15017

This study audits online memory and skill modules against a plain web agent allowed to spend more budget on execution.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Comparing agents at equal action limits can hide the extra token cost of inducing, verifying, retrieving, and injecting memory.

Contributions

The analysis records executor and auxiliary costs, adds a stronger stateless baseline, and measures run-to-run variation.

Method

AWM, ASI, and ReasoningBank build experience during ordered task execution, while Vanilla-IB uses additional action steps without cross-task state.

Token accounting includes auxiliary model calls and the executor's longer prompts caused by retrieved knowledge.

Ablations separate the extra step allowance from deterministic accessibility-tree text pruning.

Evaluation

Experiments cover four WebArena domains with three models and repeated runs, plus WorkArena-L1.

The 10-versus-15-step comparison approximates budget matching rather than enforcing identical per-task token caps, and the findings do not rule out benefits from amortized offline skill libraries.

详细阅读笔记 · Y26-136

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 本轮阅读优先级 P0 · 记忆收益同预算审计

0. 摘要

摘要译文,依据本轮缓存的 arXiv 摘要页;原文采用 CC BY 4.0 许可。以下保留作者摘要中的表述,预算匹配方式及具体反例见第4节。

在线网页代理经常通过记忆、工作流或技能模块增强基础执行器。这些模块可以改善性能,但也会消耗测试时 token,而这部分成本很少与执行器的推理成本一起报告。我们研究每个任务都会支付这类额外开销的在线增强,并在固定总推理预算下重新评估其收益。我们将 AWM、ASI 和 ReasoningBank 与 token 预算匹配的普通基线比较;普通基线将相同预算用于增加执行器步骤。

在 WebArena 的四个领域、Gemini 3 Flash、GPT-5.4-mini 和 Qwen 3.6-27B 三个模型上,普通基线的总体成功率达到或超过全部三种增强方法,同时往往使用更少的总 token。使用 Qwen 3.6-27B 在 WorkArena-L1 上也观察到类似趋势,表明该现象延伸到了企业知识工作任务。

我们的结果表明,技能和工作流记忆可能对特定领域有用,但与预算匹配的执行器相比,其表面收益往往消失。我们进一步表明,不同运行之间的方差会实质性影响结果,应将其作为在线网页代理的核心评测指标报告。

1. 方法动机

在线生成技能、整理记忆和验证经验都要调用模型,检索出的内容还会进入执行器后续提示。若只给普通代理相同动作步数、却忽略增强代理额外消耗的 token,比较就同时改变了结构和总计算预算,难判断辅助模块本身是否值得。

作者提出一个直接控制:把这些 token 留给普通执行器,让它多观察、多尝试几步。研究针对评测期间持续建库的在线方法,讨论的是有限任务序列内的资源分配;并不否定已有稳定技能经过大量复用后可能有更好摊销效果。

2. 方法设计

  1. 限定在线顺序任务协议。 在 WebArena 的 Shopping、Reddit、Admin、GitLab 四域依次处理任务,增强方法可使用之前轨迹形成的经验;因网站可靠性问题不测 Map。再用 WorkArena-L1 的 33 种企业任务检验结论是否迁移。
  2. 固定比较三种增强机制。 AWM 从轨迹归纳自然语言工作流,ASI 归纳并验证可执行 Python 技能,ReasoningBank 从成功和失败中建立推理记忆。增强代理的主执行器最多运行 10 步,辅助调用另行记录。
  3. 建立增加预算的普通基线。 Vanilla-IB 不维护跨任务状态,将主执行器上限改为 15 步,同时用规则去除可访问性树中父子节点重复文本。该裁剪不调用模型;论文明确这不是贡献,而是给普通代理更强且更经济的对照。
  4. 分解记录真实 token 消耗。 对主执行器和辅助模块分别记录输入与输出 token,再按任务平均汇总。辅助部分包含归纳、合成、检索及验证;被注入执行器的记忆造成的提示膨胀则归入执行器成本,避免只数显式模块调用。
  5. 多模型、多次运行。 WebArena 使用 Gemini 3 Flash、GPT-5.4-mini、Qwen 3.6-27B,各域三次独立运行;WorkArena-L1 使用 Qwen 及每任务类型三个种子。报告成功率均值、标准差,并比较三次任一次成功和三次全部成功,暴露任务级不稳定性。
  6. 用消融与步数扫描检查解释。 分离 10/15 步与裁剪开关,确认成功率主要来自更长交互机会、裁剪主要节省 token;在 Reddit 继续增加步数,并在更高预算重测增强方法。基础设施故障识别后即时重跑,避免错误轨迹破坏后续在线库。

3. 与其他方法对比

对比对象 预算如何分配 本文揭示的具体问题
AWM 执行器+工作流归纳和注入 额外经验未必优于增加主执行步数
ASI 执行器+代码生成、验证和复用 需计入技能创建与上下文成本
ReasoningBank 执行器+成功失败记忆整理 有时更省执行器输入,但模块仍有开销
相同步数普通代理 不补偿增强模块计算 容易把额外预算贡献算作结构贡献
离线技能方法 先建库再长期复用 不属于本研究主要比较,需另一套摊销核算

这个研究贡献的是成本审计和更强控制,不是证明所有技能无用。在线依赖确实使严格顺序协议不易并行,但工程上也可设计冻结或分批更新版本,不能把全部有记忆系统都视为必然串行。

4. 实验表现与优势

四域按任务数加权的结果中,Gemini 的 Vanilla-IB 为 44.78% 成功率、每任务 73.6k token;ASI 为 41.02%、107.3k,AWM 为 39.34%、99.3k,ReasoningBank 为 39.33%、82.6k。Qwen 的 Vanilla-IB 为 42.14%、95.5k,ASI 为 40.15%、125.8k。论文表1

不能概括为普通基线在所有设置都更省:GPT-5.4-mini 的 Vanilla-IB 为 32.67%、90.2k,AWM 为 27.02%、88.5k,ReasoningBank 为 24.58%、81.0k。WorkArena-L1 中 Vanilla-IB 与 ReasoningBank 同为 55.56%,分别消耗 109.4k 与 120.3k;AWM 为 53.53%、102.8k,是不同成功率—成本位置。

预算边界: 15 步是近似匹配,并未给每个任务设统一硬 token 额度;增强方法本身消耗也不同。裁剪与额外步数分别有消融,但严格同预算结论仍应看成本曲线而非单一上限。三次运行的任一次成功只是波动诊断,不是提供免费重试后的部署成功率。

作者承认这些任务大多独立,未强制长期记忆,离线发现技能及更同质的长期任务可能改变结论。本文没有单任务端到端计时;无共享状态的 N 工作者最高 N 倍并行是理想化吞吐讨论,不是实测每任务加速。

5. 学习与应用

原文给出官方项目页;本轮未确认该页面下具体代码发布内容,也未读实现。最小复现重点是统一账本:把每次模型调用标为执行、归纳、验证或检索,保留输入/输出及被注入执行器的知识长度。

先复现四域、三次运行、10 对 15 步及父子重复文本裁剪,再画多个预算点的成功率—总 token 曲线。复现建议增加真实墙钟时间、API 缓存计费和失败任务成本,并对在线库重置与任务顺序作固定记录;若评估离线技能,应另外画包含建库成本的复用次数曲线,不能直接套用本文结论。

6. 总结

核心思想:让辅助模块与更多行动比成本。

速记流程:记录所有调用 → 给普通代理更多步 → 重复运行比较 → 按总成本判断收益

来源与核查:原论文,已读§3–8;论文项目页

7. 与当前“历史摘要+按需视觉证据”方案的关系

辅助建库/整理/注入都计费,再给普通基线更多行动预算;是ACL效率主张必须应对的反例。

本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。

原文阅读定位:Online workflow, memory, and skill induction.;Alternative paradigms and evaluation robustness.;3 Experimental settings;3.1 Tasks and domains;3.2 Studied systems;3.3 Models and budget accounting;4 Main results;5 Audit beyond aggregate success rate;5.1 Run-to-run variance;5.2 Programmatic skill fragility;5.3 Effect of accessibility-tree pruning;6 Practical advantages of stateless evaluation;Appendix A Implementation details;Appendix B Accessibility-tree pruning;Appendix C Effect of pruning on the augmented baselines;Appendix D Results at a higher step budget;Appendix E Prompt templates;Appendix F Failure mode analysis of augmented agents;F.3 ReasoningBank: Contamination and memory over-application;Appendix G Per-run variance results。完整章节及图表索引见原论文:章节、图注与来源 / Original paper

Open this note in the interactive notebook (comments, hooks) → · All notes