Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents

See original paper
Research paper · arXiv:2602.23235

GUIPruner lowers older screenshots' resolution and prunes current-image tokens while retaining spatial coverage.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Uniform visual compression can erase recent context or spatial detail needed to ground the current action.

Contributions

The method applies different compression stages to historical and current observations.

Method

Historical pixel budgets decay with age, and screenshots are resized before visual encoding.

The current screenshot is encoded first, then shallow-layer attention selects foreground and relevant background tokens while a grid preserves layout references.

The pruning rules add no learned parameters, although the evaluated action models receive GUI SFT.

GUIPruner原文图3:旧截图按远近缩放,当前截图按结构筛选
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

Experiments use offline action benchmarks; GUI-Odyssey uses a sampled test subset and Mind2Web uses target-containing viewports.

In the reported 2B AITW timing setup, visual encoding falls from 87.9 ms to 26.6 ms on an RTX 4090, with some action-accuracy loss and no full-task timing claim.

详细阅读笔记 · Y26-058

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

0. 摘要

中文转述,非逐句译文。 GUIPruner针对历史截图与当前截图采用不同压缩策略:历史越远,分配的输入分辨率越低;当前截图则在模型浅层保留重要前景、语义背景及分散的布局位置。目标是在减少视觉计算的同时保护GUI定位依赖的空间结构。

1. 方法动机

同一操作轨迹的多张高分辨率截图含有大量重复界面,但最近画面与当前目标的小文字、小按钮仍需要精确保留。把所有帧同等缩小,或只按注意力删token,容易破坏目标坐标所依赖的相对布局。

论文将“记住之前做过什么”和“准确点击现在的哪里”分开。历史采用输入前缩放以真正降低视觉编码成本,当前画面先形成特征,再通过结构约束删减,避免在最早阶段破坏必要信息。

2. 方法设计

GUIPruner原文图3:旧截图按远近缩放,当前截图按结构筛选

原文图3,来源:GUIPruner §4。左边处理历史截图,右边筛选当前截图。图中购物过程从输入搜索词到浏览裙子;下面的图块数量为便于理解而自拟。

原文4.1:Overview——旧画面和当前画面用不同方式压缩

作者认为,旧画面主要用于记住过程,当前画面则必须保留可点击细节。 例如现在要在搜索结果页选择裙子,旧截图只需帮助模型知道“刚才搜了什么、到了哪一页”,没必要保留每个广告字样;当前结果页却要看清商品和筛选按钮。因此旧截图在进入视觉编码器前缩小,当前截图先完整编码,再在语言模型浅层之后删掉部分图块。任务指令和历史动作文字随截图一起输入,最后仍由原来的GUI模型生成下一动作。

原文4.2:Temporal-Adaptive Resolution——给越近的旧截图分配越多像素

程序先算全部历史还能保留多少图块,再把更多配额给较新的截图。 假设有两张历史图,每张原本100块,历史预算只保留30%,合计能留下60块。若最新图权重1、较旧图权重0.2,分到的配额就是50块和10块。这里按时间远近套固定规则,没有让模型另外生成“这张图重要”的判断。

拿到配额后,程序把图像宽高同时缩放:面积减半,宽高应乘约0.707,而不是都减半。这样整张旧页面仍在,只是更模糊,然后才送入视觉编码器。因为从源头减少了图块,旧图的视觉编码和后续语言计算都能省。总预算按“历史张数×每张原始图块数×保留比例”计算,历史越长,总量仍会增加,并不是固定大小的无限记忆。

原文4.3:Stratified Structure-aware Pruning——当前画面既留目标,也留布局参照

程序把当前画面的预算分给三种区域:有轮廓的前景、模型关注的背景、分散覆盖页面的网格。 首先用边缘检测找按钮、文字等区域的轮廓;包含有效边缘的图块归为前景,其余归为背景。这是图像处理规则,不能保证找出的都是可点击控件。当前图完整经过视觉编码器和语言模型前两层后,程序再读取注意力分数,估计哪些图块与当前指令相关。

例如当前100块里有20块前景、80块背景,总共要保留50块。先在前景中按注意力取一半,即10块;再从背景里取“50%×背景系数0.3”,即12块;剩余28个名额按均匀网格覆盖尚未选择的位置。这样搜索框、相关商品附近的图块可以因得分高被保留,页面不同位置也有一些参照,避免只剩一团局部碎片。三组图块合并后继续进入后续语言模型层,输出点击或输入动作。

这套筛选规则本身不训练新参数;但实验先对底座做了GUI动作格式的监督微调。使用时每步仍是一轮模型前向,只在内部插入缩图和筛选,没额外调用另一个规划模型,也没有复用上一轮视觉特征缓存。

3. 与其他方法对比

对照 改进位置 收益与代价
全历史同分辨率 近期多、远期少的图像预算 降低编码负担,远期小字可能丢失
FastV注意力剪枝 补入边缘前景与均匀布局支点 更保护空间关系,多一道结构计算
DivPrune/CDPruner前置选择 当前帧在浅层后再筛 减少过早分布扰动,前段计算保留
所有帧统一剪枝 历史与当前使用不同策略 更贴合用途,需要分别调节预算

方法的实质是区分压缩发生的位置及不同帧的信息需求。它没有跨步骤复用已算视觉特征,因此历史再次输入时仍会重新编码缩小后的图像。

4. 实验表现与优势

原文5.1–5.2:实验设置和指标含义

作者先对Qwen2-VL-2B、Qwen2.5-VL-7B分别做GUI监督微调,再在推理时接入不同压缩方法。每个测试步骤给任务、历史截图及动作、当前截图,预测下一动作,与数据集标注比较。AITW按指令划分训练与测试;GUI-Odyssey只随机抽取三分之一测试集;AndroidControl沿用OS-Atlas处理方式;Mind2Web把长网页裁成包含目标的1920×1080视口。因此Mind2Web结果不是模型自己在整张超长网页里找目标的成绩。§5.1、附录A.2

指标 测什么、怎样计分
Step SR/表中的导航准确率 按各基准规则检查下一动作及必要参数是否正确,再统计通过的步骤比例;点击涉及位置、输入涉及文字、滚动涉及方向。原文沿用既有协议,未逐一列出所有容差与文本阈值
Rel.,相对性能 压缩后的平均分除以不压缩平均分,例如66.5÷70.6≈94.2%;不等于94.2%的任务成功
历史/当前保留比例 两种输入各自留下的视觉量,分母不同;历史10%、当前75%不等于总输入只留10%
FLOPs 视觉编码、语言模型输入处理和生成阶段合计的浮点运算量,单位T;不能直接当作秒数
Encoder Time/Prefill Time 前者是图片变成视觉特征的时间;后者是语言模型处理已有输入的时间。都不包含完整应用任务的所有执行与等待
GPU Memory 测试峰值显存,单位MB

AITW与GUI-Odyssey使用4张历史图,所有输入图最长边先统一为512像素;AndroidControl与Mind2Web使用2张较高分辨率历史图。所有推理和效率测试用一张RTX 4090。标题虽然强调高分辨率,下面AITW计时仍须按其512像素设置理解。

原文5.3:同预算下,与哪些剪枝方法比较

表1比较完整输入、FastV、DivPrune、CDPruner、MoB和GUIPruner。固定当前图保留75%,历史分别保留40%、20%、10%。以下为2B底座的代表结果,单位%。

方法与预算 AITW Mind2Web GUI-Odyssey AndroidControl
完整输入 69.5 34.5 71.8 66.9
GUIPruner,历史40% 67.5 33.6 68.1 66.4
GUIPruner,历史10% 65.3 31.8 63.8 65.6
FastV,历史10% 62.7 31.6 62.4 64.4
DivPrune,历史10% 63.0 21.0 61.2 63.6

GUIPruner在这些压缩设置下损失较小,但仍低于完整输入。7B模型、历史40%时,Mind2Web完整输入35.2%,GUIPruner34.7%,DivPrune7.7%,CDPruner6.8%,说明部分通用剪枝会造成严重退化。不过历史10%的7B Mind2Web上,FastV33.1%略高于GUIPruner32.8%,不宜写成所有配置都第一。表1

原文5.4:视觉编码确实变快了吗

表2固定2B、AITW、4张历史、RTX 4090和相同压缩后token预算比较:完整输入1,320个token、11.5T;GUIPruner310个、3.4T。视觉编码87.9→26.6毫秒,语言输入处理47.5→24.1毫秒,显存8,956→5,902MB。FastV同为310个token,视觉编码仍为87.9毫秒,因为它删图块时视觉编码已完成。

因此摘要“3.3倍”特指87.9÷26.6的视觉编码加速;“3.4倍”是11.5÷3.4的运算量比。没有完整任务秒数来证明每个网页流程也加速3.3倍。表2

原文5.5:两个模块各自是否有效

§5.5.1图4分别固定当前图不压缩、只改历史预算,以及固定历史不压缩、只改当前图预算,再观察AITW和Mind2Web的动作分数曲线。这样可以隔离缩旧图与删当前图各自的作用;不从曲线上估读未列出的精确数字。

§5.5.2表3把历史“按时间分配”换成“每张均分”,当前图都完整保留。历史10%时,AITW/GUI-Odyssey均分为66.2/64.6,本文为66.9/66.0;两项平均由65.4升到66.5,说明有限像素优先给近帧更有效。表4固定前景和显著背景的挑选,只把剩余预算的均匀网格换成随机采样:当前保留60%时,随机的两项平均65.5,网格66.5;保留45%时为60.8对61.6。收益来自布局覆盖,而非多给token。

原文5.6与附录D:参数和剪枝层数

图5用AITW比较历史衰减系数和背景预算系数,本文默认0.2与0.3附近效果最好。表5固定历史10%、当前75%,把剪枝位置放在第1、2、4、8、16层,Step SR分别为12.4%、65.3%、64.4%、61.1%、60.6%;运算量分别3.79、3.39、3.45、3.48、3.53T。第1层不仅准确率低,运算量反而更高,作者归因于错误定位与格式导致更冗长的生成。附录D图7通过搜索框热图展示不同层关注位置,属于对这一结果的定性解释。

附录E:7B模型效率,以及其他附录内容

附录E表6在同样的AITW、4帧、4090条件下重复效率实验:7B完整输入27.5T、视觉编码308.7毫秒、输入处理156.3毫秒、18,004MB;GUIPruner为8.9T、97.7毫秒、52.8毫秒、16,386MB。约3.2倍视觉编码速度和3.0倍输入处理速度,显存收益则明显小于2B。FastV对应视觉编码仍为308.7毫秒,DivPrune为308.7毫秒,进一步支持“先缩图才省编码”的解释。附录E表6

附录A补充训练、视口裁剪与边缘检测,B给算法,C和F展示留下了哪些区域,G讨论局限;这些部分没有另一组需要混入主表的任务成功率。正文§3图2还有历史注意力与前背景构成的诊断统计,用于提出方法动机。

最终可得:这套规则在已微调的Qwen底座上,以少量离线动作精度换取编码与输入处理加速。旧截图缩小会丢字,边缘检测可能漏掉低对比度控件,且没有完整在线任务耗时实验;这些限制不能由“保留94%相对性能”消除。

5. 学习与应用

本轮未从论文入口确认作者专属实现发布链接。复现可依据§4的预算与选择规则,不需训练额外剪枝网络。

复现建议:固定历史帧数及SFT底座,先分别启用历史缩放和当前剪枝,记录小文字/图标目标准确率。保留γ=0.2、ρ=0.3作为原文参考,但不要假定最优;将视觉编码、预填充、解码、操作等待单独计时。与跨帧视觉缓存组合时,还需衡量缩放比例随历史年龄改变是否破坏缓存复用。

6. 总结

核心思想:历史降清晰度当前保布局

速记流程:分配历史预算→按远近缩图→选重要区域→补齐布局位置→预测动作

来源与核查:原论文 2602.23235v1;本轮核读§3诊断、§4.1–4.3方法、§5.1–5.6实验,正文表1–5及附录A–G(含附录E表6的7B效率)。已检查本节所用作者方法图;自拟例子已在相应位置说明。未读取实现源码。

Open this note in the interactive notebook (comments, hooks) → · All notes