STAMP creates controlled delayed-information tasks to train explicit memory writing before useful screen content disappears.
Ordinary action demonstrations rarely specify exactly when a GUI agent should preserve a fact for later use.
The pipeline generates memory-event supervision and combines balanced SFT with online reinforcement learning.
Synthetic environments control which variables appear, when they disappear, and where they are subsequently required.
Successful trajectories are aligned with those variables, and action and memory judges mask unreliable supervision.
The policy emits reasoning, action, and memory; online rewards combine terminal success with trajectory-level memory completeness.

On Memory-World, Stamp-GUI reports 75.3% pass@1 task accuracy versus 44.9% for its GUI-Owl base.
AndroidWorld-M assistance levels and multi-attempt results are reported separately, and gains differ across real and synthetic benchmarks.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 本轮阅读优先级 P0 · 显式记忆训练
中文转述,非逐句译文。依据 arXiv:2605.29324 当前全文,许可为 arXiv 非独占传播许可。STAMP 在生成的可控手机环境中安排“先看到、随后消失、最后必须使用”的信息,自动得到显式记忆监督。Stamp-GUI 同时输出思考、动作与需要记住的内容,通过监督训练和在线强化学习改善跨页面信息保存。
为了控制上下文,GUI 代理常移除旧截图;如果尚未把票价、地址或配方写入文本,离开页面后信息就无法恢复。仅要求模型“记住重要内容”可能不够,因为常规动作数据很少标注应该在哪一步保存什么。
论文把记忆需求植入环境生成过程,让信息出现时机、内容和未来用途可控。这样不仅有成功动作,也能对“是否该记”和“记得是否完整”提供明确训练目标。

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。
| 方法 | 记忆来源 | 主要差别 |
|---|---|---|
| 保留全部对话 | 模型自然输出中可恢复信息 | 不确保关键视觉事实已被写出 |
| 主动记忆提示 | 指令要求记重要内容 | 无需训练,但GUI专模可能不遵从 |
| 常规动作训练 | 主要监督点击和输入 | 记忆事件缺少明确目标 |
| STAMP | 可控环境生成记忆标签并训练 | 标签更具体,承担环境与多模型生成成本 |
不同模型族使用不同尽力保留协议,表中比较不能视作完全相同提示条件下的纯架构差异。
表3 Memory-World pass@1:Stamp-GUI任务准确率75.3%、记忆准确率77.9%,基础GUI-Owl为44.9%和55.9%。但Claude-Sonnet-4.6记忆准确率95.2%,所以正文“记忆指标领先”的强表述并不适用于全部基线。原文表3
表1 AndroidWorld-M跨L1–L3平均pass@1由10.3%升至30.8%;不提供额外知识的L3为15.4%,不能把30.8%写成完全无帮助设置。表2 MemGUI-Bench平均由19.7%升至23.4%,说明不同任务集增益不一致。
作者在全116任务AndroidWorld报告pass@1略退步、pass@3后超过基础模型,pass@15达79.3%;多尝试不是单次能力或速度。未见端到端任务耗时收益实测。作者承认合成到真实环境差距及生成管线成本,且不覆盖长期用户偏好或跨任务记忆。
所读原文未确认专属资源URL,不能据此推断未开放。最小复现先做一个需要跨页面保存两项变量的环境,再检查完整记忆轨迹评分,逐步加入步骤平衡、裁判遮蔽和在线训练。
附录表8在线学习率2e-7、批量32、裁剪上下界0.05、KL系数0.05。复现建议:分开评估有知识提示的L1/L2和自主L3,报告不必要记忆的输出开销;还应记录记忆长度及每任务时间,防止以更多文本换成功率后误称加速。
核心思想:用可控信息消失训练主动记忆
速记流程:生成延迟用信息的任务 → 标注何时记什么 → 平衡监督训练 → 按全程记忆给奖励 → 跨页面使用
来源与核查:阅读原文第3–4节、表1–6及附录A.5训练设置;未读取源码。
训练模型使用历史记忆,是仅靠提示摘要/RAG之外必须比较的同任务记忆能力路径。
本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。
原文阅读定位:2.2 Memory in GUI Agent;3 Method;3.1 Overview;3.2 Problem Setup;3.3 Virtual Environment Data Construction;3.4 Supervised Training;3.5 Online Reinforcement Learning;4 Experiments;4.1 Benchmarks and Metrics;4.2 Baselines and Implementation Details;4.3 Main Results;4.4 Ablation Study;4.5 Detailed Empirical Analysis;5 Conclusion;Appendix A Appendix;A.2 Memory Content Storage;A.2.1 Two-Tier History Retention;A.2.2 History Construction from Old Steps;A.2.3 Storage Behavior for Empty Memory;A.4.3 Prompt Assembly with Visual History。完整章节及图表索引见原论文:章节、图注与来源 / Original paper。
Open this note in the interactive notebook (comments, hooks) → · All notes