Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management

See original paper
Research paper · arXiv:2606.19926

MemGUI-Agent trains the action policy to fold history and explicitly add, update, or delete persistent UI facts.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Passive reasoning logs expand over long mobile tasks and make exact cross-app facts difficult to preserve and reuse.

Contributions

Context-as-Action separates folded history, persistent UI facts, and recent steps, with MemGUI-3K supplying full-protocol demonstrations.

Method

Each policy output specifies reasoning, history folding, a tool action, an observation, and action intent.

The runtime applies folding ranges to history and executes either a GUI action or a memory add, update, or delete operation.

An 8B policy learns the protocol through LoRA SFT; explicit memory operations consume decision steps.

作者方法图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

MemGUI-8B-SFT reports 23.4% pass@1 and 35.9% pass@3 on MemGUI-Bench, compared with 9.4% and 20.3% for the base 8B-Instruct model.

MobileWorld GUI-only transfer is tested on 117 tasks; offline memory-trigger metrics are kept separate from online success.

详细阅读笔记 · Y26-146

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 优先级 P0 · 复核日期:2026-09-07

与当前研究的关系:主策略输出memory增删改,事实与历史分存。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。

0. 摘要

摘要译文(依据本轮核查原文,CC BY 4.0许可):基于多模态大语言模型的移动GUI代理在短程任务上已取得显著进展,但在需要跨多步操作和应用切换保留中间事实的长程任务上仍不可靠。我们将这一局限归因于ReAct式提示:它被动累积逐步记录,导致提示膨胀,并稀释关键的跨应用事实。为解决这一问题,我们首先提出MemGUI-Agent,一种具备主动上下文管理能力的端到端长程移动GUI代理。MemGUI-Agent建立在Context-as-Action(ConAct)之上,将上下文管理建模为与UI动作由同一策略输出的一等动作。ConAct不再被动追加历史,而是维护三个结构化上下文字段:折叠的动作历史、折叠的UI状态和最近步骤记录,在保持上下文紧凑的同时保留关键UI事实。其次,为使不同规模模型都能学习主动上下文管理,我们构建MemGUI-3K:一个包含2956条轨迹、带有完整ConAct标注的数据集,用于监督训练和离线分析。第三,在MemGUI-3K上训练8B模型得到MemGUI-8B-SFT,即一个8B规模的MemGUI-Agent;它在MemGUI-Bench上取得使用开放数据的8B模型中最佳表现,并能泛化到分布外的MobileWorld基准。代码、数据和训练模型将发布于https://memgui-agent.github.io/。

来源:原文摘要许可

1. 方法动机

手机长任务经常先在一个应用读取手机号、价格或地址,再去另一个应用使用。直接累积思考与动作会使提示持续变长,而机械裁剪又可能删除唯一出现过的数值。只用“之前已经看过价格”这样的摘要,也不能支持后续精确填写。

作者把上下文维护变成模型能够选择的行为:压缩已经完成的过程,另存不能丢失的事实,并为每步生成可供后续整理的观察和意图。关键并非增加一个外部摘要代理,而是让同一策略学会这些选择;原文的小模型零样本退化正说明接口复杂度有学习成本。

2. 方法设计

§2 ConAct:三份状态

建立三份上下文。输入任务目标、当前截图、折叠动作历史 H、持久界面事实 M 和最近步骤 L。H 保存压缩后的过程,M 保存带 ID、说明和完整内容的事实,L 保留最近观察、意图、动作及工具结果。

§2 Step Output Protocol

输出五段结构。一次策略调用生成思考、折叠指令、工具动作、界面观察和动作意图;观察要求保存可见文本和数值,意图解释本次动作目的。它们让后续压缩有明确依据,而非只从自由思考中猜测发生了什么。

§2 History Folding

按范围折叠历史。从第二步开始输出折叠块,指定历史区间与摘要。只折叠一条相当于精简最近记录,合并多条则抽象一个已完成子任务;运行器据此替换相应历史,不是固定每隔若干步调用摘要器。

§2 UI Memory Actions

显式增删改界面记忆。每步工具调用只能选择一个 UI 动作或 memory_add/update/delete。记忆动作修改 M、保持截图不变,UI 动作改变环境;因此记忆写入也占一个决策步骤。手机号等必须存完整值,不以模糊引用替代。

§3 MemGUI-3K Dataset

采集可学习的协议示范。128个种子任务经实体替换、记忆操作增强和任务简化扩展,235B-Thinking 教师在 Android 快照环境执行,以任务真值和步骤合理性双重过滤,留下2,956条成功轨迹、64,430个合理步骤。

§4 与附录D.1监督训练

监督训练并保持同一执行接口。8B-Instruct 通过 LoRA 学习五段输出,执行时由模型共同预测压缩、记忆和 UI 决策。原文报告57,951个训练样本、一轮训练、学习率1e-4、LoRA rank 8/alpha 32/dropout 0.05;没有另加在线强化学习目标。

方法依据:原文 §2–3

自拟例子:把记忆在什么时候使用讲清楚

把票号存为完整字符串,付款成功后把状态更新为已支付;若后来退款就必须修改,旧票号仍可能有效而支付状态已失效。图像证据也应分别管理持久身份与变化状态。

模型输入、输出与记忆边界

项目 本文实际范围
记忆来源 同任务可更新文本事实与历史折叠
与本方案相同或不同 主策略输出memory增删改,事实与历史分存
应固定的对照条件 用精确文本状态基线检验是否真的需要图像;记忆动作占步也应计成本。

训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。

3. 与其他方法对比

对比对象 原有做法与局限 本文改变及代价
ReAct 式历史追加 保留原始步骤,长任务中上下文增长且事实容易淹没 分离过程与精确事实;需模型正确决定折叠范围和保存内容
仅增加记忆动作 能存数值,但历史仍膨胀,旧步骤语义不清 加入折叠及观察/意图描述,三者共同支撑长期使用
仅给小模型换提示协议 新增字段增加遵循和决策负担 用完整协议轨迹监督;付出教师采集与微调成本

4. 实验表现与优势

表2 MemGUI-Bench:8B-SFT 的 Pass@1/Pass@3 为23.4%/35.9%,对应8B-Instruct基线9.4%/20.3%;235B零样本协议为37.5%/62.5%,对应原策略24.2%/46.9%。这些是各自底座上的比较,不能把235B提示收益当作8B训练收益。

表3 MobileWorld GUI-Only 共117任务,8B-SFT单次成功率17.9%,底座9.4%,支持跨环境迁移。表5在较小的 MemGUI-Bench-40 上,用235B-Thinking比较完整协议与ReAct,Pass@1为40.0%与5.0%;该子集不能与全基准成绩混报。

表1显示仅换协议会使部分小模型退步;表4离线记忆触发F1从19.9%提高至48.0%,但输入使用真实历史,不能替代在线闭环结果。作者局限是只测试Android。提示增长图支持上下文节约,但本文没有据这些表证明固定比例的墙钟加速。

数据来源:原文 §4.1–4.4,表1–5;附录D.1,表11

5. 学习与应用

开放状态:原文写明代码、数据和模型“将发布”于项目页,不能直接表述为已能完整下载。复现建议先使用小批完整轨迹实现三份状态及五段解析,特别检查折叠区间与记忆 ID 更新是否准确。

按附录D.1,可用LoRA rank 8、alpha 32、dropout 0.05,最大序列32,768、有效batch 128、一轮SFT作对照。作者训练在8张80GB GPU耗时535分钟;这是训练耗时,实际设备推理延迟需另测。

迁移时应单独记录 UI 步、记忆步、输入/输出token和任务耗时;若记忆操作过多,压缩收益可能被新增决策抵消。建议以价格复制、跨应用联系人转存等任务检查精确值保存,这属于复现实验设计,不是原文已给出的性能保证。

6. 总结

核心思想:让动作策略主动整理上下文

速记流程:读取当前屏幕→压缩已完成记录→保存关键数值→执行下一动作→更新任务状态

来源与核查:原始论文;已读 §2–3、§4.1–4.4,表1–5、附录D.1,表11;许可。作者资源:链接

对“历史摘要+局部视觉证据回查”的具体启发

用精确文本状态基线检验是否真的需要图像;记忆动作占步也应计成本。

不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。

原文方法图

原文图示与图题。下面直接引用作者图像;解释以上文为准。

作者方法图

原表核查附录

该来源本轮没有可靠的HTML表格单元格;已在实验节列出核过的关键数据。完整原表见PDF/正文。不猜测缺失表格行。

Open this note in the interactive notebook (comments, hooks) → · All notes