Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments

See original paper
Research paper · arXiv:2605.29324

STAMP creates controlled delayed-information tasks to train explicit memory writing before useful screen content disappears.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Ordinary action demonstrations rarely specify exactly when a GUI agent should preserve a fact for later use.

Contributions

The pipeline generates memory-event supervision and combines balanced SFT with online reinforcement learning.

Method

Synthetic environments control which variables appear, when they disappear, and where they are subsequently required.

Successful trajectories are aligned with those variables, and action and memory judges mask unreliable supervision.

The policy emits reasoning, action, and memory; online rewards combine terminal success with trajectory-level memory completeness.

Y26-124 作者原图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

On Memory-World, Stamp-GUI reports 75.3% pass@1 task accuracy versus 44.9% for its GUI-Owl base.

AndroidWorld-M assistance levels and multi-attempt results are reported separately, and gains differ across real and synthetic benchmarks.

详细阅读笔记 · Y26-124

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 本轮阅读优先级 P0 · 显式记忆训练

0. 摘要

中文转述,非逐句译文。依据 arXiv:2605.29324 当前全文,许可为 arXiv 非独占传播许可。STAMP 在生成的可控手机环境中安排“先看到、随后消失、最后必须使用”的信息,自动得到显式记忆监督。Stamp-GUI 同时输出思考、动作与需要记住的内容,通过监督训练和在线强化学习改善跨页面信息保存。

1. 方法动机

为了控制上下文,GUI 代理常移除旧截图;如果尚未把票价、地址或配方写入文本,离开页面后信息就无法恢复。仅要求模型“记住重要内容”可能不够,因为常规动作数据很少标注应该在哪一步保存什么。

论文把记忆需求植入环境生成过程,让信息出现时机、内容和未来用途可控。这样不仅有成功动作,也能对“是否该记”和“记得是否完整”提供明确训练目标。

2. 方法设计

Y26-124 作者原图

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。

  1. 生成带延迟信息依赖的环境。 随机种子控制风格、布局密度及语义内容,并指定需要保存的变量、出现步骤和稍后使用位置。环境先静态检查,再动态交互,过滤无法完成或逻辑有误的任务。
  2. 从成功轨迹恢复记忆标签。 将交互步骤与环境内受控变量对齐,每步得到是否需记忆的二值标签及目标内容;无须记忆时目标为空。再根据画面、动作和目标记忆补充相应思维链。
  3. 用动作/记忆裁判过滤监督。 裁判分别检查动作和记忆标签,不可靠的目标在训练损失中遮蔽,而非默认整条自动轨迹都正确。数据管线合成4,194条监督轨迹。
  4. 平衡稀疏记忆步骤。 模型输出三个字段:推理、动作、记忆。对少见的需记忆步骤提高训练权重,表5比较原始分布、提高至1:1及3:1的方案,避免模型学成几乎总输出空记忆。
  5. 在可执行环境中强化。 356个虚拟环境提供任务成功奖励;格式错扣0.3;记忆裁判按整段轨迹完整、部分或不足给1、0.5、0,再乘0.3。不是只取表现最好的一个记忆步骤,以免漏记其他事件仍得满分。
  6. 推理时把记忆留在历史中。 从 GUI-Owl-1.5-8B-Think 初始化后,模型在离开关键页面前主动输出记忆,后续动作读取这些文字。附录采用步骤分组相对优势估计与PPO裁剪损失;它改善信息保存,不直接消除新截图推理。

3. 与其他方法对比

方法 记忆来源 主要差别
保留全部对话 模型自然输出中可恢复信息 不确保关键视觉事实已被写出
主动记忆提示 指令要求记重要内容 无需训练,但GUI专模可能不遵从
常规动作训练 主要监督点击和输入 记忆事件缺少明确目标
STAMP 可控环境生成记忆标签并训练 标签更具体,承担环境与多模型生成成本

不同模型族使用不同尽力保留协议,表中比较不能视作完全相同提示条件下的纯架构差异。

4. 实验表现与优势

表3 Memory-World pass@1:Stamp-GUI任务准确率75.3%、记忆准确率77.9%,基础GUI-Owl为44.9%和55.9%。但Claude-Sonnet-4.6记忆准确率95.2%,所以正文“记忆指标领先”的强表述并不适用于全部基线。原文表3

表1 AndroidWorld-M跨L1–L3平均pass@1由10.3%升至30.8%;不提供额外知识的L3为15.4%,不能把30.8%写成完全无帮助设置。表2 MemGUI-Bench平均由19.7%升至23.4%,说明不同任务集增益不一致。

作者在全116任务AndroidWorld报告pass@1略退步、pass@3后超过基础模型,pass@15达79.3%;多尝试不是单次能力或速度。未见端到端任务耗时收益实测。作者承认合成到真实环境差距及生成管线成本,且不覆盖长期用户偏好或跨任务记忆。

5. 学习与应用

所读原文未确认专属资源URL,不能据此推断未开放。最小复现先做一个需要跨页面保存两项变量的环境,再检查完整记忆轨迹评分,逐步加入步骤平衡、裁判遮蔽和在线训练。

附录表8在线学习率2e-7、批量32、裁剪上下界0.05、KL系数0.05。复现建议:分开评估有知识提示的L1/L2和自主L3,报告不必要记忆的输出开销;还应记录记忆长度及每任务时间,防止以更多文本换成功率后误称加速。

6. 总结

核心思想:用可控信息消失训练主动记忆

速记流程:生成延迟用信息的任务 → 标注何时记什么 → 平衡监督训练 → 按全程记忆给奖励 → 跨页面使用

来源与核查:阅读原文第3–4节、表1–6及附录A.5训练设置;未读取源码。

7. 与当前“历史摘要+按需视觉证据”方案的关系

训练模型使用历史记忆,是仅靠提示摘要/RAG之外必须比较的同任务记忆能力路径。

本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。

原文阅读定位:2.2 Memory in GUI Agent;3 Method;3.1 Overview;3.2 Problem Setup;3.3 Virtual Environment Data Construction;3.4 Supervised Training;3.5 Online Reinforcement Learning;4 Experiments;4.1 Benchmarks and Metrics;4.2 Baselines and Implementation Details;4.3 Main Results;4.4 Ablation Study;4.5 Detailed Empirical Analysis;5 Conclusion;Appendix A Appendix;A.2 Memory Content Storage;A.2.1 Two-Tier History Retention;A.2.2 History Construction from Old Steps;A.2.3 Storage Behavior for Empty Memory;A.4.3 Prompt Assembly with Visual History。完整章节及图表索引见原论文:章节、图注与来源 / Original paper

Open this note in the interactive notebook (comments, hooks) → · All notes