Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

Less is More: Empowering GUI Agent with Context-Aware Simplification (SimpAgent)

See original paper
Research paper · arXiv:2507.03730

SimpAgent learns to transfer historical visual information into retained representations before removing old image tokens.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Old screenshots contain useful context but impose substantial computation when kept through every language-model layer.

Contributions

The method combines masking-based training augmentation with consistency-guided history compression.

Method

Training uses masked current screenshots to reduce dependence on irrelevant regions, while inference keeps the current screenshot intact.

Historical images first interact with action text in shallow layers, after which their visual tokens are removed.

Full-history and compressed branches are trained to produce consistent action distributions; deployment runs the compressed branch.

Evaluation

On the reported Qwen2-VL-2B setting, AITW offline step success changes from 69.0% to 71.3% while computation falls from 11.90T to 8.71T FLOPs.

Masking-only and compression ablations separate accuracy gains from computational savings; these are not online task-time measurements.

详细阅读笔记 · P035

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原文,ICCV 2025;本卡依据 §3–5、图3–6、表3–7及附录。它与用户的历史研究高度相关,优先于单帧定位论文。

0. 摘要转述

SimpAgent 研究界面中无关元素与历史截图的冗余。训练时通过遮挡无关区域促进模型关注目标;推理时在语言模型浅层后去掉历史视觉 token,以一致性训练减少丢信息的影响。它不生成可读历史摘要,也不从外部库检索旧 crop,而是在模型内部把历史信息传入保留 token。

1. 方法动机

只有当前截图和历史动作,比完整历史截图便宜,但可能不知道前一页出现过什么;全部历史图持续进入深层又很贵。作者观察到浅层注意力能将历史视觉信息聚合到邻近文字动作 token,因而尝试在聚合以后删除历史视觉 token。重点是保留历史作用,而不是毫无条件地把历史删掉。

2. 原文步骤

§4.1 Masking-based Element Pruning:训练时减少干扰。 在当前截图中按给定分布随机选矩形,将其中像素改为固定值,再学习原动作标签。作者的依据是目标通常很小、无关区域很多,所以随机遮挡较有可能去掉干扰;这不是先准确识别所有无关元素再删除。原文§4.1并未保证遮挡总能避开标注目标。正式推理取消遮挡、使用完整当前截图;SimpAgent-M只用这一训练增强,不减少推理FLOPs。

论文与实现的区别: 本次补查作者仓库,random_mask_outside_area在传入area时会保护该区域,fetch_image_with_mask根据是否传入point决定是否保护点击点附近;data_augment.py也有将point设为None的分支。因此代码支持有条件的区域保护,但不能把它写成论文所有实验固定启用的步骤,更不能说测试时已知目标框。未逐一复现全部启动配置。图像处理代码训练数据代码

§4.2 Consistency-guided History Compression:历史先完整进入浅层。 输入顺序仍是任务、交替历史图和动作、当前图。到指定语言层k后,所有历史视觉token被移除,历史动作文字与当前图继续进入后续层;主要计算设置对应k=3。保留动作文字的token ID不会被改写成摘要,但它们的内部向量已通过浅层注意力吸收部分历史图信息。视觉编码器及删除前的浅层仍计算历史图,不能把它算成从源头完全省去历史编码。这是在每轮前向内部转移信息,不等于跨轮保存并复用这些隐藏向量。

一致性训练教它提前转移信息。 训练时保留完整历史与删减历史两条模型计算分支,两个分支都学习正确动作,同时约束它们的动作输出分布接近。正式推理只运行删减分支。这里不需要像CoM那样另请72B教师先生成文字记忆标注。不能把它归为纯推理零训练方案,也不能把动作token内的隐式信息叫作可检索文本摘要。原文图3展示方法,图4展示注意力观察。§4.2、图3–4

举一个自拟例子:上一页有目的地上海,当前页只显示日期选择。完整分支能回看上海;压缩分支需要在浅层时就把与上海有关的信息迁入留下的表征。它不能像外部 RAG 那样,在很久后显式按“那张目的地截图”找回原区域。

3. 与用户方案的对照

维度 SimpAgent 历史摘要+局部证据 RAG
存哪儿 模型内部保留 token 表征 外部文本与图像证据库
压缩何时 每轮前向浅层后 历史写入及读取时
遗忘后补证据 非独立检索设计 可检索原 crop/原帧
需要训练 需要一致性训练 可先固定模型做运行时方案

4. 实验与消融

底座为Qwen2-VL-2B,附录B说明只对语言模型做LoRA微调(rank=8、alpha=16)。AITW与GUI-Odyssey保留最近4张历史图,长边缩至512;AndroidControl与Mind2Web用2张历史图和较高分辨率设置,不能统一写成所有实验都用4张。下列是离线Step SR:一整步动作满足标注才计成功,不是自主执行完整任务成功率。表5给出部件增量,FLOPs是该评估计算设置,不能直接当真实秒数。

原表5配置 FLOPs(T) AITW Step SR GUI-Odyssey Step SR
完整历史基线 11.90 69.0 74.9
直接删历史视觉 token 8.71 67.3 71.8
加一致性训练 8.71 68.9 73.7
再加遮挡训练 8.71 71.3 76.0

表7同一组历史压缩比较:无压缩 69.0、Token Merger 68.9、Victor 67.6、FastV-50 66.0、FastV-0 63.8、作者一致性压缩 68.9。对应计算量分别 11.90、9.28、9.28、10.15、8.71、8.71T。训练条件与参数变化也要一起说明,不能只报最准或最快一列。

表6在不加一致性指导时改变删除层k=1/3/6/12,不能据此证明完整方法在k=3必然最优。图5改变遮挡比例与采样分布;附录有数据、实现、详细结果与案例。结果支持训练能补偿直接删历史带来的损失;尚不回答几十步以后某个很小视觉证据能否仍被准确恢复。

表3–4的完整Agent对照包括CogAgent、Qwen-VL、SeeClick、OdysseyAgent、Iris、ShowUI、Qwen2-VL,AndroidControl另列InternVL2、OS-Atlas;附录AITW表还列GPT-4V。它们的底座、参数量和GUI预训练数据不同,判断组件作用应优先读同底座消融。Qwen2VL*表示只有历史动作,Qwen2VL无星号包含历史图。

SimpAgent-M不压缩历史,性能可能比完整方案更高。 AITW/GUI-Odyssey上,仅遮挡版为71.5/77.4,完整SimpAgent为71.3/76.0;后者用性能上的部分让步换取更低计算量。因此整体结果同时包含遮挡增强的准确率收益和历史压缩的计算收益,不能全归因于压缩。正文未见正式命名的SimpAgent-H版本。

5. 复现与本研究关系

它应出现在“历史视觉压缩”对照/相关工作中,与 GUIPruner、ReVision、HiconAgent 并排。资源允许可实现模型内压缩基线;资源不足则用公开结果作机制对照,不能混在自跑同预算表里。

本研究应对比:完整历史、最近 K 帧、历史文本摘要、摘要+随机 crop、摘要+检索 crop。重点测试 OCR 无法表达的视觉属性和压缩后才被询问的信息。若只在一般 GUI 单步测试上报一点提升,很难区别于本文及其他压缩器的贡献。

6. 速记

完整历史进浅层→历史信息迁入动作表征→删历史视觉 token→一致性训练减损。最相关的旧目录历史压缩先例之一。

Open this note in the interactive notebook (comments, hooks) → · All notes