MemGUI-Bench tests information retention and experience reuse through memory-intensive mobile tasks and staged trajectory judging.
Ordinary GUI benchmarks can underrepresent delayed facts, cross-app information transfer, and learning across attempts.
The benchmark provides 128 tasks across 26 apps and a progressive evaluator with memory-specific metrics.
Snapshot-based resets support repeated attempts while explicitly controlling whether agent memory survives.
The evaluator first examines limited terminal evidence, then builds a semantic trajectory and requests specific historical screenshots when needed.
Task success, information retention, recovery across attempts, and execution efficiency are measured separately.

In the reviewed paper snapshot, Agent-S2 reaches 27.3% pass@1 and 49.2% pass@3, while expert trajectories average 36.2 steps.
Evaluator quality is assessed separately from agent performance, and any judging-cost reduction is not an action-agent speedup.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 本轮阅读优先级 P0 · GUI记忆专门评测
摘要完整译文(arXiv v3;CC BY 4.0;原摘要)。以下保留作者摘要的主张;译文按同一许可提供。
可靠的手机GUI代理必须跨动作、应用和重复交互保留并复用信息。然而,现有基准系统性地低估了这些记忆需求:只有5.2%–11.8%的任务与记忆有关,且没有基准评价跨会话学习。我们提出MemGUI-Bench,一个全面的记忆中心基准,通过pass@k协议和分阶段的大语言模型裁判评价,同时考察短期信息保留与长期经验积累。我们的贡献包括:(1)基于五种架构中的11个代理,对短期和长期记忆进行系统分类;(2)构建基于快照的任务集,涵盖26个应用的128个任务,组织为64组镜像任务对,其中89.8%要求跨时间和跨空间保留信息;(3)提出MemGUI-Eval,一个自动化的三阶段渐进审查流程,包含覆盖记忆保真度、学习效果和执行效率的七项分层指标;(4)围绕六个研究问题评价11个先进代理。实验揭示所有被评估系统都存在显著记忆缺陷,包括记忆密集任务上4–10倍的能力差距。实验还表明,短期记忆不可或缺,显式长期记忆可使跨会话学习提升21.9个百分点,而跨应用迁移和计算成本仍是主要瓶颈。我们还识别了五种不同失败模式,并总结出五条可执行的设计启示,供未来记忆增强代理参考。包括代码、基准和评价结果在内的全部资源将完全开源,并在项目页持续维护。
普通GUI任务可能只要沿界面继续操作,很少要求准确记住早先见到的多条事实。代理在这些任务上成功,不意味着它能把多个应用中的价格、路线、地址和中间结果正确带到最终输出。
记忆评估还面临可重复运行与判断证据过长的问题:重试前需恢复相同环境,判断任务是否完成又可能必须查看几十步历史。本文同时设计记忆密集任务和逐级加深的判定流程,让“记住多少、几次恢复、付出多少开销”分别可观测。

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。
| 比较方式 | 覆盖能力 | 主要边界 |
|---|---|---|
| 常规单次GUI基准 | 页面交互与最终完成 | 可能低估跨页面事实保留难度 |
| 多次独立重试 | 更多成功机会 | 不自动等价于利用了长期记忆 |
| 全轨迹视觉判定 | 一次提供所有画面 | 上下文与费用高,关键信息可能淹没 |
| MemGUI-Bench+Eval | 快照重试、信息指标、按需补证据 | 自动判定仍有模型误差,环境含真实网站变化 |
任务专家路径为3–160步,平均 36.2步;78.1%需要跨应用信息传递。该结构比单纯延长点击序列更直接测量记忆,因为最终要求通常依赖早先观察的具体事实。§3.1
2026年2月论文快照中,M3A单次成功率 32.8%;Agent-S2单次 27.3%、三次以内 49.2%;Mobile-Agent-E对应 5.5%和10.2%。另外M3A多轮长上下文配置达到51.6%,说明输入历史组织会显著改变结果,但不是所有记忆策略的公平速度比较。表2、§5.2
评价器对78条SPA-Bench轨迹的M1配置F1为 99.0%,对256条MemGUI轨迹为 93.1%;这两个数字来自不同数据集。正文费用和部分基线叙述与表格不完全一致,此处仅使用表1明确数值。判定器省证据的设计属于评估效率,不能直接当作动作代理提速。§4.3、表1
论文提供项目页,本轮未读取实现或独立核验下载资源。后续主要实验选择Gemini2.5Flash做步骤描述、Gemini2.5Pro做判断;复现必须固定评价器版本,否则成功率变化可能来自裁判。
复现建议先选镜像任务对,在相同快照、相同尝试次数下比较清空与保留记忆,并把首次探索成本计入总预算。信息单元应在任务定义中明确,特别区分“曾看见”“正确记住”“最终正确使用”。对速度研究,可使用其失败恢复和步骤比,另报告全部任务墙钟耗时及错误停止率。
核心思想:用跨应用事实检验代理记忆 速记流程:设置记忆任务→恢复统一环境→重复执行→逐级补证据评估
来源与核查:原论文,已读 §3–4、§5.1–5.2、附录A.5.4、A.6.2–A.6.3与相关表;使用论文快照数据。
动态环境的记忆任务直接测离屏信息是否保存和使用,是方案主评测候选。
本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。
原文阅读定位:2 Memory in Mobile GUI Agents;3 Memory-Centric Benchmarking Environment;3.1 Memory-Intensive Task Suite Design;3.2 A Snapshot-Based Plug-and-Play Framework;4 An Automated Evaluation Pipeline with Memory-Specific Metrics;4.1 Memory-Specialized Metrics with Hierarchical Assessment;4.2 MemGUI-Eval : A Progressive Scrutiny Evaluator;4.3 Validation of the Evaluation Pipeline;5 Benchmarking GUI Agent Baselines;5.1 Experimental Setup;5.2 Main Results;Appendix A Appendix;A.1.1 Evaluation Environment Limitations;A.1.2 Evaluation Pipeline Limitations;A.3 Detailed Memory Implementations;A.3.1 Short-Term Memory Implementations;A.3.2 Long-Term Memory Implementations;A.4.3 Memory-Intensive Task Design;A.5.1 Parallel Experiment Implementation;A.5.2 Long-Term Memory Support Through Multi-Attempt Mechanism;A.6 Details of Memory-Specialized Metrics;A.6.1 Short-Term Memory Assessment Metrics。完整章节及图表索引见原论文:章节、图注与来源 / Original paper。
Open this note in the interactive notebook (comments, hooks) → · All notes