Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

See original paper
Research paper · arXiv:2602.06075

MemGUI-Bench tests information retention and experience reuse through memory-intensive mobile tasks and staged trajectory judging.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Ordinary GUI benchmarks can underrepresent delayed facts, cross-app information transfer, and learning across attempts.

Contributions

The benchmark provides 128 tasks across 26 apps and a progressive evaluator with memory-specific metrics.

Method

Snapshot-based resets support repeated attempts while explicitly controlling whether agent memory survives.

The evaluator first examines limited terminal evidence, then builds a semantic trajectory and requests specific historical screenshots when needed.

Task success, information retention, recovery across attempts, and execution efficiency are measured separately.

Y26-046 作者原图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

In the reviewed paper snapshot, Agent-S2 reaches 27.3% pass@1 and 49.2% pass@3, while expert trajectories average 36.2 steps.

Evaluator quality is assessed separately from agent performance, and any judging-cost reduction is not an action-agent speedup.

详细阅读笔记 · Y26-046

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 本轮阅读优先级 P0 · GUI记忆专门评测

0. 摘要

摘要完整译文(arXiv v3;CC BY 4.0原摘要)。以下保留作者摘要的主张;译文按同一许可提供。

可靠的手机GUI代理必须跨动作、应用和重复交互保留并复用信息。然而,现有基准系统性地低估了这些记忆需求:只有5.2%–11.8%的任务与记忆有关,且没有基准评价跨会话学习。我们提出MemGUI-Bench,一个全面的记忆中心基准,通过pass@k协议和分阶段的大语言模型裁判评价,同时考察短期信息保留与长期经验积累。我们的贡献包括:(1)基于五种架构中的11个代理,对短期和长期记忆进行系统分类;(2)构建基于快照的任务集,涵盖26个应用的128个任务,组织为64组镜像任务对,其中89.8%要求跨时间和跨空间保留信息;(3)提出MemGUI-Eval,一个自动化的三阶段渐进审查流程,包含覆盖记忆保真度、学习效果和执行效率的七项分层指标;(4)围绕六个研究问题评价11个先进代理。实验揭示所有被评估系统都存在显著记忆缺陷,包括记忆密集任务上4–10倍的能力差距。实验还表明,短期记忆不可或缺,显式长期记忆可使跨会话学习提升21.9个百分点,而跨应用迁移和计算成本仍是主要瓶颈。我们还识别了五种不同失败模式,并总结出五条可执行的设计启示,供未来记忆增强代理参考。包括代码、基准和评价结果在内的全部资源将完全开源,并在项目页持续维护。

1. 方法动机

普通GUI任务可能只要沿界面继续操作,很少要求准确记住早先见到的多条事实。代理在这些任务上成功,不意味着它能把多个应用中的价格、路线、地址和中间结果正确带到最终输出。

记忆评估还面临可重复运行与判断证据过长的问题:重试前需恢复相同环境,判断任务是否完成又可能必须查看几十步历史。本文同时设计记忆密集任务和逐级加深的判定流程,让“记住多少、几次恢复、付出多少开销”分别可观测。

2. 方法设计

Y26-046 作者原图

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。

  1. 构造信息传递任务。 128个任务覆盖26个真实应用,其中115个明确要求提取、保存并使用信息,13个普通任务作为对照。任务包含单应用至四应用流程,形成64组要求不同但应用组合和认知负担相近的镜像任务。
  2. 用快照统一执行起点。 调度器分发任务,代理通过统一接口读取截图或UI树并执行点击、滑动和输入。模拟器按端口隔离支持并行,失败后恢复快照,默认最多尝试3次,同时保留允许跨尝试使用的代理记忆。
  3. 把结果与记忆能力分开量化。 成功率评价整个任务;信息保留率计算要求的信息单元中正确回忆并使用的比例;记忆任务熟练度比较记忆与普通任务表现。多次成功率之外,失败恢复指标给较早恢复更高权重,第二次恢复权重1、第三次为1/2。
  4. 首先用少量证据筛查明确成功。 初筛只读任务、原始动作日志和最后三张截图,仅在所有要求已明确满足时判成功。含糊情况升级,而不是根据未见信息猜测成功;这是评价器的分流。
  5. 不确定时补全语义轨迹。 步骤描述器分析动作前后画面,生成动作与页面说明。语义判定器结合完整文字和最后三帧检查任务,失败记忆任务另算信息保留率;若仍缺关键证据,输出明确所需历史步骤列表。
  6. 只补请求的历史画面。 视觉判定器接收上述步骤拼图和已有文字,作最终二元判断。任务关键证据若仍不可见则判失败,不依靠猜测补齐。效率同时记录成功路径相对专家的步数比、每步时间及费用,不把这些指标合并为一个分数。

3. 与其他方法对比

比较方式 覆盖能力 主要边界
常规单次GUI基准 页面交互与最终完成 可能低估跨页面事实保留难度
多次独立重试 更多成功机会 不自动等价于利用了长期记忆
全轨迹视觉判定 一次提供所有画面 上下文与费用高,关键信息可能淹没
MemGUI-Bench+Eval 快照重试、信息指标、按需补证据 自动判定仍有模型误差,环境含真实网站变化

4. 实验表现与优势

任务专家路径为3–160步,平均 36.2步;78.1%需要跨应用信息传递。该结构比单纯延长点击序列更直接测量记忆,因为最终要求通常依赖早先观察的具体事实。§3.1

2026年2月论文快照中,M3A单次成功率 32.8%;Agent-S2单次 27.3%、三次以内 49.2%;Mobile-Agent-E对应 5.5%和10.2%。另外M3A多轮长上下文配置达到51.6%,说明输入历史组织会显著改变结果,但不是所有记忆策略的公平速度比较。表2、§5.2

评价器对78条SPA-Bench轨迹的M1配置F1为 99.0%,对256条MemGUI轨迹为 93.1%;这两个数字来自不同数据集。正文费用和部分基线叙述与表格不完全一致,此处仅使用表1明确数值。判定器省证据的设计属于评估效率,不能直接当作动作代理提速。§4.3、表1

5. 学习与应用

论文提供项目页,本轮未读取实现或独立核验下载资源。后续主要实验选择Gemini2.5Flash做步骤描述、Gemini2.5Pro做判断;复现必须固定评价器版本,否则成功率变化可能来自裁判。

复现建议先选镜像任务对,在相同快照、相同尝试次数下比较清空与保留记忆,并把首次探索成本计入总预算。信息单元应在任务定义中明确,特别区分“曾看见”“正确记住”“最终正确使用”。对速度研究,可使用其失败恢复和步骤比,另报告全部任务墙钟耗时及错误停止率。

6. 总结

核心思想:用跨应用事实检验代理记忆 速记流程:设置记忆任务→恢复统一环境→重复执行→逐级补证据评估

来源与核查:原论文,已读 §3–4、§5.1–5.2、附录A.5.4、A.6.2–A.6.3与相关表;使用论文快照数据。

7. 与当前“历史摘要+按需视觉证据”方案的关系

动态环境的记忆任务直接测离屏信息是否保存和使用,是方案主评测候选。

本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。

原文阅读定位:2 Memory in Mobile GUI Agents;3 Memory-Centric Benchmarking Environment;3.1 Memory-Intensive Task Suite Design;3.2 A Snapshot-Based Plug-and-Play Framework;4 An Automated Evaluation Pipeline with Memory-Specific Metrics;4.1 Memory-Specialized Metrics with Hierarchical Assessment;4.2 MemGUI-Eval : A Progressive Scrutiny Evaluator;4.3 Validation of the Evaluation Pipeline;5 Benchmarking GUI Agent Baselines;5.1 Experimental Setup;5.2 Main Results;Appendix A Appendix;A.1.1 Evaluation Environment Limitations;A.1.2 Evaluation Pipeline Limitations;A.3 Detailed Memory Implementations;A.3.1 Short-Term Memory Implementations;A.3.2 Long-Term Memory Implementations;A.4.3 Memory-Intensive Task Design;A.5.1 Parallel Experiment Implementation;A.5.2 Long-Term Memory Support Through Multi-Attempt Mechanism;A.6 Details of Memory-Specialized Metrics;A.6.1 Short-Term Memory Assessment Metrics。完整章节及图表索引见原论文:章节、图注与来源 / Original paper

Open this note in the interactive notebook (comments, hooks) → · All notes