Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

See original paper
Research paper · arXiv:2605.11212

ReVision learns to omit repeated patches from later screenshots and trains the policy to use earlier visual evidence.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Adjacent GUI screenshots repeat substantial content, making longer visual history expensive without adding proportional information.

Contributions

The method combines a learned temporal redundancy selector with action-model training on partially retained screenshot sequences.

Method

The first screenshot in a window stays complete; later screenshots, including the current one, retain patches selected from comparisons with adjacent-frame features.

Offline region matching supplies selector supervision, and the action model is fine-tuned on the same filtered input format.

Temporal and spatial positions are preserved, but screenshots are still visually encoded before selection rather than reused as cached features.

ReVision原文图2:完整保留窗口首图,后续图片只留变化图块
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

In the reviewed v3 five-image, 100-step OSWorld setting, success improves from 32.3% to 34.0% while average input tokens per step fall from 15,071 to 6,963.

WebTailBench task results and AgentNetBench offline action metrics are separate protocols; selector latency is not total action latency.

详细阅读笔记 · Y26-107

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

0. 摘要

摘要译文;依据原始摘要CC BY 4.0许可。以下保留摘要的作者表述,具体实验口径见第4节。

计算机使用智能体依靠 GUI 的视觉观察,每张截图会被编码为大量视觉 token。交互轨迹增长时,token 成本迅速增加,限制了固定上下文与算力预算下可纳入的历史量。因此,与其他领域不同,使用历史往往没有带来提升,或提升很有限。作者提出 ReVision 解决这一低效问题:用学习到的图像块选择器比较相邻截图的图像块表示,在保留模型所需空间结构的同时删除冗余视觉块,再用这种轨迹训练多模态语言模型。在 OSWorld、WebTailBench、AgentNetBench 三个基准上,Qwen2.5-VL-7B 处理含五张历史截图的轨迹时,ReVision 平均减少 46% token,相较不删除的基线还提高 3% 成功率。这种效率改进使智能体能以更少 token 处理更长轨迹。利用这一优势重新考察历史作用,作者发现,移除冗余后,加入更多过去观察仍能继续提升表现。

1. 方法动机

连续操作常只改动页面的一小部分,而多图输入把每张截图完整编码为大量 token。历史越长,重复内容越多,模型可能花费更多计算却没有获得更多有效状态信息。

论文的直觉不是独立压缩每张图,而是利用前后图之间的重复。由于标准模型没有学过这种缺块输入,还需要同步改变训练分布,让模型主动从较早画面寻找被省略内容。

2. 方法设计

ReVision原文图2:完整保留窗口首图,后续图片只留变化图块

原文图2,来源:ReVision §4。图中先输入北京,再选择机场,最后点击搜索;后续截图中没变的区域被删除,模型可以回看较早图片。下面沿这个过程解释。

原文4.1:Problem Formulation——每张后续截图主要补充新变化

作者保留一个完整起点,再让后续画面只带来新增或改变的部分。 假设输入中有三张图:第一张是航班搜索页,第二张出现北京机场候选,第三张已选定PKX。导航栏、网页标志等内容如果没变,就不必在三张图里各放一整份;输入框新文字、展开的列表、选中的机场则需要留下。

具体做法是,窗口中的每张截图都先经过视觉编码器和投影层,得到图块特征;第一张全部保留。从第二张起,小型选择器逐个比较它与前一张同一位置的特征,输出“保留/删除”。程序按这个结果筛选视觉token,同时保留原来的时间与空间位置,再按各截图所属步骤与动作文字交错放入语言模型。当前截图也会删块,不只是删旧截图。

例如第三张删掉未变化的搜索按钮区域,模型需要通过输入中较早画面的该位置理解按钮仍在哪里,再结合当前新出现的PKX判断下一动作。这里没有真的重建一张完整截图,也没有把上一轮的KV缓存直接拿来复用;是让语言模型在同一次输入内利用历史画面。

原文4.2:Training——先教选择器识别重复,再教动作模型使用缺块画面

选择器的训练答案来自相邻画面的区域匹配。 作者先离线用OmniParserV2把AgentNet截图划分成按钮、面板等语义区域,再对前后图片的区域做匹配,用区域重合关系制作“这个位置是否重复”的图块标签。这样希望把轻微渲染变化和真正的内容更新区分开,而不只依赖两块像素是否完全相等。

RTS选择器本身是三层小型神经网络,输入前后两张图对应位置的特征,学习输出重复与否。训练好以后,正常运行只用RTS作判断,不需要每步再调用OmniParser。原文没有完整给出区域匹配阈值和所有标签生成细则,因此不能把“按钮文字改变但框不变”这一类情况写成已被规则完美解决。

动作模型随后用同样删过图块的轨迹做监督微调。 每个训练样本包含最近k张截图,以及此前全部动作和推理文字;窗口首图保留完整,后面按RTS删除。模型要根据这些输入生成标准示范中的下一段推理和动作,训练损失只计算输出文字,图像作为条件输入。这样它练习的是“当前图缺了重复区域时,从之前的图里找线索”,而不是一直只依赖最新完整截图。

每种窗口长度主要实验分别训练一个模型,训练和推理使用同一过滤方式。算法1中的k张图包含当前图,窗口向前移动后,新窗口最早的图重新作为完整起点。正式每步仍是一轮动作模型调用,但视觉编码器仍处理窗口内各图;文字历史也不随图像窗口一同截断。因此它主要缩短语言模型视觉输入,既不保证总上下文固定,也不直接省掉全部旧图编码。

3. 与其他方法对比

对照 删除依据 改进位置与代价
No Drop 不删图像块 信息完整,重复历史快速占满上下文
随机/螺旋删除 固定采样规则 无需训练,但可能丢掉关键状态
像素/嵌入余弦相似度 低层或特征相似 便宜直接,难区分噪声与语义变化
RTS+OmniParser 在线完整区域匹配 表现较好,解析额外时间较高
学习后的 RTS 相邻块特征分类 近似语义筛选成本低,仍可能误删细微变化

它与缓存旧特征不同:论文算法仍编码窗口中的截图,再删除语言模型输入 token;是否实现编码缓存需要另行设计。

4. 实验表现与优势

原文5.1及附录A、I:三类测试,不能混成一个“成功率”

作者沿用OpenCUA框架,用AgentNet训练;主要ReVision底座为Qwen2.5-VL-7B,每个图像窗口长度单独训练。对照模型都得到同样数量的完整截图及全部动作、推理文字;No Drop则使用ReVision训练设置,在测试时关闭删块,是隔离压缩影响的重要对照。解码温度0,结果为三次运行平均,训练使用8张H200。§5.1、附录I

测试/指标 测什么、怎样测试
OSWorld的SR@15/50/100 在桌面环境中从任务初始状态实际操作,最多允许15/50/100步,再按任务检查是否完成;成功任务比例。数字是步数预算,不是生成候选次数
WebTailBench的SR@50/100 在OSWorld式环境中执行网页任务,本文用GPT-4o评价步骤正确性并计算最终SR。原文未完整交代怎样由逐步裁判聚合成任务通过,不能当作与OSWorld完全相同的程序终态判分
AgentNetBench的Coord. SR 离线给固定轨迹状态,比较预测坐标动作与该步允许的标准动作;点击等要求点落在目标区域,滚动还要方向正确
Content SR 检查输入文字与键盘动作:文字比较编辑距离,按键/组合键要求匹配;不是判断网页内容理解得对不对
Func. SR 检查terminate等功能动作,尤其是否在该结束的步骤结束;不是所有动作类别的总体准确率
AgentNetBench的Avg. SR 汇总离线动作正确率;原文未展开权重,不能把三个类别百分比直接等权平均,更不能当在线任务完成率
Avg Tokens/Step、Vis Tok% 前者是每步输入token平均数量,后者是输入中视觉token的占比;Vis Tok%不是“相对原图保留了多少”
Avg Steps 在指定预算下的平均交互步数;原文未清楚说明是否只统计成功任务,因此不自行补成“成功任务平均长度”
Latency 选择模块的额外毫秒数。No Drop写0表示没有筛选开销,不表示模型零延迟
Standard deviation 三次运行分数的标准差,单位为百分点,衡量结果波动;不是置信区间

AgentNetBench动作判分补充依据是OpenCUA附录B:同一步可有多个有效动作,匹配其中之一即可。ReVision表6将AgentNetBench记为1,091项,而OpenCUA原文按100个任务介绍该基准;两者计数口径未对齐,所以不把1,091直接写成本文完整在线任务数。OSWorld和WebTailBench在ReVision中分别列369与609个任务。

原文5.2:同一模型、同一窗口,输入少了多少

主图3、4的数据在附录B表7–9展开。以下固定5图窗口,对比ReVision No Drop与启用RTS;OSWorld与WebTailBench取100步预算,AgentNetBench为离线Avg. SR。

测试 分数:不删→RTS 平均每步token:不删→RTS
OSWorld 32.3%→34.0% 15,071→6,963
AgentNetBench 72.5%→73.8% 15,076→8,975
WebTailBench 36.0%→40.2% 15,362→9,651

分别减少约53.8%、40.5%、37.2%的每步输入,分数提高1.7、1.3、4.2个百分点。摘要中的“平均减少46% token、提高3%”不能直接拿来替代这三组具体比较:按这些表中数值等权计算,约为43.8%减少和2.4个百分点提高,摘要的平均口径未说明。附录B表7–9

步数也有减少:OSWorld在50步预算下由22.7降到19.8、SR34.5%→35.9%;WebTailBench同预算由27.9降到23.6、SR29.3%→32.8%。这是操作次数的改善,仍没有模型推理加环境等待的完整秒数统计。

原文5.3:是不是随便少放些图块也有效

表2固定主要底座与窗口,替换选择规则。OSWorld/AgentNetBench分数,No Drop为32.3/72.5;随机删50%为27.8/67.9,随机删90%为4.6/18.9;按像素相似删为28.6/68.4;Qwen特征余弦相似度筛选为32.1/72.3;RTS为34.0/73.8。说明只减少输入可能把关键变化一起删掉,筛选依据重要。

在线再加OmniParser的版本达到35.2/74.6,比RTS更高,但选择模块平均565毫秒,RTS仅22.5毫秒。这里的“22.5对565”衡量的是筛选器开销,不能写成一整个动作快25倍。表2

原文5.4:历史越长越好吗,应该删新图还是旧图

图5增加窗口长度,观察分数和token:No Drop大约在7图附近较早饱和,ReVision可延后到约11图附近;作者还观察到约23K总上下文附近的饱和趋势。这是其测试范围内的现象,不是模型上下文硬上限。

表3把“保留最早完整图、删后续重复块”的前向方案,换成“最新图完整、删较早重复块”的反向方案。9图时,OSWorld的No Drop/前向/反向为29.4/38.4/27.8%,AgentNetBench为72.5/77.1/68.9%,WebTailBench为35.1/48.9/31.6%。支持在长窗口下训练模型使用较早证据。但3图时前向也会降分:OSWorld32.2→30.5,AgentNetBench72.0→70.7,WebTailBench36.3→35.2。收益不能写成任何历史长度都成立。

原文5.5:换底座和只给一张图

表4及附录D表11比较两类底座、多个窗口。Qwen3-VL-8B的5图ReVision,在OSWorld/AgentNetBench为36.7/76.0%;9图时为41.6/80.2%,每步token为10,723/13,921。该表证明方法可用于另一底座,但缺少每行一一对应的No Drop,不能把换大底座的全部分差当作剪枝收益。

表5只给一张截图,此时没有相邻图片可删,检验压缩训练是否破坏单图定位。Qwen2.5-VL-7B原模型与ReVision在OSWorld-G为31.3/31.1,Pro为27.8/27.6,变化较小。这里是单题定位分数;表内另一底座名称出现“Qwen3-VL-7B”与方法行“8B”不一致,且正文说四个基准、实际只列三个,不自行补第四个或改模型名。

附录B–J:进一步的定量结果与案例

附录B除上面的100步结果,还列OSWorld的15/50步测试。5图时No Drop→RTS:SR@15为30.7→32.1%,SR@50为34.5→35.9%。AgentNetBench表8分项为坐标76.2→77.0%、内容59.8→61.0%、结束类42.9→44.2%,总体72.5→73.8%;各类不是同一分母。WebTailBench表9的SR@50为29.3→32.8%,已经与100步结果分开报告。

附录C表10报告稳定性:5图ReVision在OSWorld/AgentNetBench/WebTailBench的三次标准差为0.8/0.6/0.9个百分点;9图为1.0/0.8/1.1个百分点。三次波动较小,但不等于已做统计显著性检验。

附录E表12检验训练和使用时窗口不一致:3图训练、3图测试的OSWorld/AgentNetBench为30.5/70.7%,改成5图测试降到29.1/69.7%;5图训练、5图测试34.0/73.8%,改成3图测试29.4/69.9%。说明可以运行,但直接换窗口可能损失数个百分点,不能默认一个权重覆盖所有最佳设置。

附录H表13进一步分离“学分类器”与“在线区域解析”。Qwen余弦阈值筛选的OSWorld32.1%、8毫秒;换分类器32.6%、13毫秒;RTS34.0%、22毫秒;RTS加OmniParser35.2%、572毫秒。AgentNetBench对应72.3/72.9/73.8/74.6%。它更直接显示训练出的判断与解析成本之间的取舍;该表Vis Tok%是输入构成占比,不能当压缩保留率。

附录F图6对比各选择规则留下哪些区域,G图7–8是附录B已有数据的其他图形,I给训练细节,J表14展示浏览器隐私设置的连续操作案例;这些没有另一套可以叠加的成功率。正文§3、表1还统计多基准相邻图块重复约36%–56%,平均45.4%,是方法动机的重复量测量,不是部署时必然能删掉的比例。

这些结果说明,经过配套训练后,较长窗口中的重复视觉输入可以删除,并有助于决策。微小复选框变化可能被误删、全部截图仍需编码、文字历史继续增长;原文也未完整公布标签阈值及所有训练参数,所以实际端到端耗时和复现效果还需要单独确认。

5. 学习与应用

开放状态:本轮未确认 ReVision 自身代码或模型链接,正文引用的 ScaleCUA 等仓库是第三方资源,不能当作本方法开源地址。最小复现先做前后截图区域匹配标签,训练三层分类器,再在 5 图窗口中完整保留首图、删除后续重复块并保持位置索引。

复现建议:建立弹窗、复选框、小数字更新和滚动的专门错误集,统计误删关键块比例;同时做同训练配置 No Drop、简单相似度与 RTS 对照。迁移时优先测语言模型预填充节省是否覆盖筛选开销,再考虑独立的视觉特征缓存。

6. 总结

核心思想:删除重复画面块并学会利用历史

速记流程:比较前后图块→保留新增信息→保持原始位置→从压缩历史生成动作

来源与核查:原论文 2605.11212v3;本轮核读§3诊断、§4.1–4.2方法与算法1、§5.1–5.5实验,正文表1–5及附录A–J表6–14;AgentNetBench判分另核OpenCUA附录B。已检查本节所用作者方法图;自拟例子已在相应位置说明。未读取实现源码。

Open this note in the interactive notebook (comments, hooks) → · All notes