Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

M²: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

See original paper
Research paper · arXiv:2603.00503

M2 combines a compact chain of current-task summaries with retrieved guidance from earlier successful web tasks.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Long interaction histories are expensive, while current-task summaries alone cannot provide reusable navigation experience.

Contributions

The training-free framework separates internal trajectory summaries from an external bank of transferable insights.

Method

The action model emits a short state summary each step, replacing detailed past observations in the active prompt.

Offline successful trajectories are distilled into general navigation guidance and indexed by task embeddings.

Retrieved insights and the summary chain inform the current decision, with suggestions checked against the actual interface.

作者方法图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

On OnlineMind2Web, the reported Qwen3-VL-32B setting improves task success from 31.96% to 51.55% while reducing tokens from 315.6K to 130.2K.

WebVoyager results show that fewer tokens can coexist with more action steps, so token savings do not directly establish wall-clock speedup.

详细阅读笔记 · Y26-062

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 优先级 P0 · 复核日期:2026-09-07

与当前研究的关系:内部摘要链是直接基线,外部检索内容不是被删历史截图。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。

0. 摘要

摘要完整译文(arXiv v1;CC BY 4.0原摘要)。以下保留作者摘要的主张;译文按同一许可提供。

基于多模态大语言模型的代理在自主网页导航方面展现出显著潜力。然而,处理长程任务仍是关键瓶颈。主流策略往往严重依赖大规模数据收集和模型训练,但在复杂长程场景下,仍面临高计算成本和推理能力不足的问题。为此,我们提出M²,一个无需训练的记忆增强框架,用于优化上下文效率和决策鲁棒性。我们的方法包含协同工作的双层记忆机制:动态轨迹摘要作为内部记忆,将冗长交互历史压缩为简洁状态更新;洞见检索增强作为外部记忆,从离线经验库检索可执行指南以引导代理。WebVoyager和OnlineMind2Web上的广泛评估表明,M²持续超过基线,使Qwen3-VL-32B的成功率最高提升19.6%、token数量最高减少58.7%;Claude等闭源模型也取得最高12.5%的准确率提升,同时显著降低计算开销。

1. 方法动机

历史截图里大量广告、侧栏和布局内容与下一步无关,长思考又会把重复信息不断累积。只截断历史可能忘掉已经尝试的查询,完整保留则增加输入成本与注意力干扰。

另一方面,任务内摘要无法提供未曾遇到的操作经验。作者因此把“本次已经做过什么”和“类似任务通常怎么做”分开:前者随交互更新,后者从离线成功轨迹提取,避免把整个外部轨迹塞回提示。

2. 方法设计

§2.2.1 Prompt-Driven State Abstraction

让行动模型同时生成简短状态。 调整系统提示,使每步除思考和动作外输出状态摘要,包含关键视觉信息与已执行动作。它与主决策整合,不默认额外调用独立摘要模型;摘要质量依赖当前代理的自我记录能力。

§2.2.2 Iterative Memory Update

用摘要链替换原始历史。 新摘要追加到内部记忆后,旧观察、长思考和动作原文从活动上下文移除,下一步只保留当前观察。原文更新式是逐步追加摘要,通常仍随步数增长,只是每步远短于截图和长思考;不宜把它严格称为固定容量或已证明次线性。

§2.3.1 Offline Insight Extraction

离线提炼跨任务经验。 用来自不同模型的成功轨迹,抽取搜索词及筛选策略、有效导航入口和等待/验证规则。提示要求去掉任务特定物品名称等字面细节,保留可迁移的界面操作经验,而非逐条复述点击日志。

§2.3.2–2.3.3 Insight Bank and Retrieval

按任务语义建立检索库。 以历史查询为键、经验为值,用Sentence Transformer编码查询。新任务计算余弦相似度,检索最相关经验,实验默认top-5;库建自55k成功轨迹,网站分布与WebVoyager相同但查询不同。

§2.4 Dual-Memory Integration

把经验作为需验证的建议。 外部经验注入系统提示,与需求、内部摘要及当前截图共同形成决策输入。代理必须对照现有界面确认建议是否适用,因此经验不是不经检查执行的宏;之后行动和摘要继续更新内部记忆。

自拟例子:把记忆在什么时候使用讲清楚

在商品页看到价格129元后离开,短摘要可能只写看过商品。如果结账前要比较价格,M²的外部通用购物建议不能还原129,原页面证据可以补充这个缺口。

模型输入、输出与记忆边界

项目 本文实际范围
记忆来源 同任务摘要+跨任务洞见检索
与本方案相同或不同 内部摘要链是直接基线,外部检索内容不是被删历史截图
应固定的对照条件 固定外部洞见关闭,比较摘要链与摘要+同任务视觉证据回查;保持同预算。

训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。

3. 与其他方法对比

对照 双记忆的变化 得失
保留最近五张图及全部思考 短状态链加当前图 输入变短,旧图细节不可直接恢复
只截断历史 保留已做操作的语义摘要 减少重复尝试,可能摘要遗漏
只加外部经验检索 同时压缩任务内历史 抵消经验提示的输入增加
直接复用完整轨迹 检索抽象导航建议 迁移灵活,仍逐步由模型执行

其效率来自历史表示变化,成功率收益还受到外部经验影响。两个部分应通过独立消融区分,不能归为单一缓存机制。

4. 实验表现与优势

评估包括12站点的WebVoyager和291个可访问的OnlineMind2Web任务,最多60步,基线历史窗口为5。任务成功由GPT-4o读取回答及最后五张截图判断。

表3中Qwen3-VL-32B在OnlineMind2Web从31.96%成功率、315.6K token、34.25步变为51.55%、130.2K、30.12步;token下降58.7%,准确率增加19.59个百分点。原文表3

并非所有配置都减少步数。表2中Claude 3.7在WebVoyager从14.6步增至16.9步,token从121.2K降至84.5K,成功率72.0%升至84.5%。作者解释较长执行可能来自不再过早放弃;这正说明token节省不能等同任务时间缩短。§3.2.2报告单次检索约6毫秒,对照平均任务122秒用于说明检索开销,但没有成对完整任务加速表。

分析上,成功轨迹库的建造与更新有离线成本,同网站不同查询不能代表完全陌生应用;错误摘要和过时经验也可能影响后续决策。

5. 学习与应用

本轮未确认原文专属代码及55k轨迹库的完整开放入口。论文给出提示设计与记忆形式,可以先做小规模机制复现,但不应假定能复现原库覆盖。

复现建议:保存原始轨迹用于事后核对摘要,在线仅按方法使用短记录;比较内部记忆、外部记忆和联合配置,分别报告输入/输出token、步骤、成功率和任务耗时。检索数量以原文top-5为参考,再在独立验证任务上调节;迁移到滑动搜索时要特别检查摘要是否遗漏目标限制和已看内容。

6. 总结

核心思想:短记本次进度并检索已有经验

速记流程:概括当前进度→检索相似经验→核对当前界面→执行动作→更新记录

来源与核查:原论文,已读§2–3与表2–4,核实摘要为追加链及token、步骤可能不同向变化。

对“历史摘要+局部视觉证据回查”的具体启发

固定外部洞见关闭,比较摘要链与摘要+同任务视觉证据回查;保持同预算。

不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。

原文方法图

原文图示与图题。下面直接引用作者图像;解释以上文为准。

作者方法图

原表核查附录

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。

原表 1(点击展开)

原表位置

Model SFT RL Acc.
UI-TARS-1.5 84.8 ⋆
OpenAI CUA 87.0 ⋆
M 2 (Ours) 86.0
原表 2(点击展开)

原表位置

Model Config AR AM AP AX BN CD CO ES GH GM HF WA Avg.step Avg.token Avg.acc.
Claude-3.7-Sonnet Normal 71.1 65.9 69.8 74.4 78.6 83.7 83.3 77.3 75.6 63.4 44.2 76.1 14.6 121.2k 72.0
Claude-3.7-Sonnet In Mem 73.3 70.7 69.8 62.8 78.6 88.4 83.3 68.2 78.1 63.4 58.1 80.4 20.3 82.9k 72.9
Claude-3.7-Sonnet Ex Mem 82.2 78.1 76.7 76.7 83.3 86.1 85.7 68.2 90.2 80.5 67.4 82.6 15.7 164.9k 79.8
Claude-3.7-Sonnet In & Ex Mem 84.4 80.5 76.7 86.1 85.7 93.0 95.2 84.1 92.7 82.9 74.4 78.3 16.9 84.5k 84.5 ( + 12.5%)
Claude-Sonnet-4 Normal 82.2 70.7 69.8 79.1 83.3 93.0 85.7 84.1 87.8 78.1 69.8 82.6 15.4 128.2k 80.5
Claude-Sonnet-4 In Mem 84.4 75.6 79.1 81.4 78.6 88.4 85.7 79.6 82.9 70.7 67.4 82.6 16.8 64.5k 79.7
Claude-Sonnet-4 Ex Mem 84.4 85.4 83.7 83.7 92.9 86.1 70.5 85.4 85.4 73.2 72.1 89.1 12.4 120.7k 82.7
Claude-Sonnet-4 In & Ex Mem 82.2 78.1 81.4 81.4 85.7 95.4 92.9 95.5 92.7 87.8 74.4 84.8 16.1 78.1k 86.0 ( + 5.5%)
Qwen3-VL-32B Normal 55.6 51.2 60.5 46.5 73.8 83.7 71.4 47.7 56.1 56.1 30.2 60.9 24.1 215.2k 57.8
Qwen3-VL-32B In Mem 62.2 75.6 60.5 44.2 73.8 76.7 76.2 70.5 80.5 58.5 37.2 63.0 22.5 73.2k 64.9
Qwen3-VL-32B Ex Mem 71.1 63.4 67.4 65.1 83.3 88.4 81.0 63.6 70.7 73.2 46.5 67.4 19.2 189.1k 70.1
Qwen3-VL-32B In & Ex Mem 75.6 70.7 72.1 72.1 90.5 88.4 81.0 77.3 80.5 68.3 48.8 63.0 21.8 92.3k 74.0 ( + 16.2%)
原表 3(点击展开)

原表位置

Model Config Easy Easy Easy Medium Medium Medium Hard Hard Hard Average Average Average
Model Config Step Token Acc. (%) Step Token Acc. (%) Step Token Acc (%) Step Token Acc. (%)
Claude-3.7-Sonnet Normal 21.72 219.6k 74.07 29.50 310.9k 58.27 34.51 371.6k 53.52 28.56 300.3k 61.95
Claude-3.7-Sonnet In & Ex 19.89 98.0k ( - 55.4%) 79.01 (+4.9%) 27.40 144.0k ( - 53.7%) 65.47 (+7.2%) 31.03 163.9k ( - 55.9%) 61.97 (+8.5%) 26.05 135.2k ( - 55.0%) 68.82 (+6.9%)
Claude-Sonnet-4 Normal 16.23 154.7k 74.07 21.24 205.9k 66.91 21.24 292.1k 61.97 21.54 212.7k 67.70
Claude-Sonnet-4 In & Ex 18.77 95.7k ( - 38.1%) 82.72 (+8.7%) 27.00 141.2k ( - 31.4%) 73.38 (+6.5%) 37.24 207.2k ( - 29.1%) 64.79 (+2.8%) 27.21 144.6k ( - 32.0%) 73.88 (+6.2%)
Qwen3-VL-32B Normal 25.41 220.9k 44.44 35.38 325.8k 30.22 42.11 403.7k 21.13 34.25 315.6k 31.96
Qwen3-VL-32B In & Ex 24.67 104.0k ( - 52.9%) 65.43 (+21.0%) 29.67 127.1k ( - 61.0%) 52.52 (+22.3%) 37.21 166.0k ( - 58.9%) 33.80 (+12.7%) 30.12 130.2k ( - 58.7%) 51.55 (+19.6%)
原表 4(点击展开)

原表位置

Ablation Category Settings Acc. (%)
Historical Window k 1 51.6
Historical Window k 3 56.0
Historical Window k 5 (Default) 57.8
Historical Window k 7 52.2
Similarity Function TF-IDF ( Salton and Buckley, 1988 ) 61.1
Similarity Function Word2Vec ( Mikolov et al., 2013 ) 64.4
Similarity Function BM25 ( Robertson et al., 1995 ) 58.0
Similarity Function S.T. ( Reimers and Gurevych, 2019 ) 70.1
Insight Count i 3 64.8
Insight Count i 5 (Default) 70.1
Insight Count i 7 66.2
In-Mem Components w/o Visual 62.3
In-Mem Components w/o Action 54.7
In-Mem Components Full 64.9

Open this note in the interactive notebook (comments, hooks) → · All notes