ReVision learns to omit repeated patches from later screenshots and trains the policy to use earlier visual evidence.
Adjacent GUI screenshots repeat substantial content, making longer visual history expensive without adding proportional information.
The method combines a learned temporal redundancy selector with action-model training on partially retained screenshot sequences.
The first screenshot in a window stays complete; later screenshots, including the current one, retain patches selected from comparisons with adjacent-frame features.
Offline region matching supplies selector supervision, and the action model is fine-tuned on the same filtered input format.
Temporal and spatial positions are preserved, but screenshots are still visually encoded before selection rather than reused as cached features.

In the reviewed v3 five-image, 100-step OSWorld setting, success improves from 32.3% to 34.0% while average input tokens per step fall from 15,071 to 6,963.
WebTailBench task results and AgentNetBench offline action metrics are separate protocols; selector latency is not total action latency.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
摘要译文;依据原始摘要,CC BY 4.0许可。以下保留摘要的作者表述,具体实验口径见第4节。
计算机使用智能体依靠 GUI 的视觉观察,每张截图会被编码为大量视觉 token。交互轨迹增长时,token 成本迅速增加,限制了固定上下文与算力预算下可纳入的历史量。因此,与其他领域不同,使用历史往往没有带来提升,或提升很有限。作者提出 ReVision 解决这一低效问题:用学习到的图像块选择器比较相邻截图的图像块表示,在保留模型所需空间结构的同时删除冗余视觉块,再用这种轨迹训练多模态语言模型。在 OSWorld、WebTailBench、AgentNetBench 三个基准上,Qwen2.5-VL-7B 处理含五张历史截图的轨迹时,ReVision 平均减少 46% token,相较不删除的基线还提高 3% 成功率。这种效率改进使智能体能以更少 token 处理更长轨迹。利用这一优势重新考察历史作用,作者发现,移除冗余后,加入更多过去观察仍能继续提升表现。
连续操作常只改动页面的一小部分,而多图输入把每张截图完整编码为大量 token。历史越长,重复内容越多,模型可能花费更多计算却没有获得更多有效状态信息。
论文的直觉不是独立压缩每张图,而是利用前后图之间的重复。由于标准模型没有学过这种缺块输入,还需要同步改变训练分布,让模型主动从较早画面寻找被省略内容。

原文图2,来源:ReVision §4。图中先输入北京,再选择机场,最后点击搜索;后续截图中没变的区域被删除,模型可以回看较早图片。下面沿这个过程解释。
作者保留一个完整起点,再让后续画面只带来新增或改变的部分。 假设输入中有三张图:第一张是航班搜索页,第二张出现北京机场候选,第三张已选定PKX。导航栏、网页标志等内容如果没变,就不必在三张图里各放一整份;输入框新文字、展开的列表、选中的机场则需要留下。
具体做法是,窗口中的每张截图都先经过视觉编码器和投影层,得到图块特征;第一张全部保留。从第二张起,小型选择器逐个比较它与前一张同一位置的特征,输出“保留/删除”。程序按这个结果筛选视觉token,同时保留原来的时间与空间位置,再按各截图所属步骤与动作文字交错放入语言模型。当前截图也会删块,不只是删旧截图。
例如第三张删掉未变化的搜索按钮区域,模型需要通过输入中较早画面的该位置理解按钮仍在哪里,再结合当前新出现的PKX判断下一动作。这里没有真的重建一张完整截图,也没有把上一轮的KV缓存直接拿来复用;是让语言模型在同一次输入内利用历史画面。
选择器的训练答案来自相邻画面的区域匹配。 作者先离线用OmniParserV2把AgentNet截图划分成按钮、面板等语义区域,再对前后图片的区域做匹配,用区域重合关系制作“这个位置是否重复”的图块标签。这样希望把轻微渲染变化和真正的内容更新区分开,而不只依赖两块像素是否完全相等。
RTS选择器本身是三层小型神经网络,输入前后两张图对应位置的特征,学习输出重复与否。训练好以后,正常运行只用RTS作判断,不需要每步再调用OmniParser。原文没有完整给出区域匹配阈值和所有标签生成细则,因此不能把“按钮文字改变但框不变”这一类情况写成已被规则完美解决。
动作模型随后用同样删过图块的轨迹做监督微调。 每个训练样本包含最近k张截图,以及此前全部动作和推理文字;窗口首图保留完整,后面按RTS删除。模型要根据这些输入生成标准示范中的下一段推理和动作,训练损失只计算输出文字,图像作为条件输入。这样它练习的是“当前图缺了重复区域时,从之前的图里找线索”,而不是一直只依赖最新完整截图。
每种窗口长度主要实验分别训练一个模型,训练和推理使用同一过滤方式。算法1中的k张图包含当前图,窗口向前移动后,新窗口最早的图重新作为完整起点。正式每步仍是一轮动作模型调用,但视觉编码器仍处理窗口内各图;文字历史也不随图像窗口一同截断。因此它主要缩短语言模型视觉输入,既不保证总上下文固定,也不直接省掉全部旧图编码。
| 对照 | 删除依据 | 改进位置与代价 |
|---|---|---|
| No Drop | 不删图像块 | 信息完整,重复历史快速占满上下文 |
| 随机/螺旋删除 | 固定采样规则 | 无需训练,但可能丢掉关键状态 |
| 像素/嵌入余弦相似度 | 低层或特征相似 | 便宜直接,难区分噪声与语义变化 |
| RTS+OmniParser | 在线完整区域匹配 | 表现较好,解析额外时间较高 |
| 学习后的 RTS | 相邻块特征分类 | 近似语义筛选成本低,仍可能误删细微变化 |
它与缓存旧特征不同:论文算法仍编码窗口中的截图,再删除语言模型输入 token;是否实现编码缓存需要另行设计。
作者沿用OpenCUA框架,用AgentNet训练;主要ReVision底座为Qwen2.5-VL-7B,每个图像窗口长度单独训练。对照模型都得到同样数量的完整截图及全部动作、推理文字;No Drop则使用ReVision训练设置,在测试时关闭删块,是隔离压缩影响的重要对照。解码温度0,结果为三次运行平均,训练使用8张H200。§5.1、附录I
| 测试/指标 | 测什么、怎样测试 |
|---|---|
| OSWorld的SR@15/50/100 | 在桌面环境中从任务初始状态实际操作,最多允许15/50/100步,再按任务检查是否完成;成功任务比例。数字是步数预算,不是生成候选次数 |
| WebTailBench的SR@50/100 | 在OSWorld式环境中执行网页任务,本文用GPT-4o评价步骤正确性并计算最终SR。原文未完整交代怎样由逐步裁判聚合成任务通过,不能当作与OSWorld完全相同的程序终态判分 |
| AgentNetBench的Coord. SR | 离线给固定轨迹状态,比较预测坐标动作与该步允许的标准动作;点击等要求点落在目标区域,滚动还要方向正确 |
| Content SR | 检查输入文字与键盘动作:文字比较编辑距离,按键/组合键要求匹配;不是判断网页内容理解得对不对 |
| Func. SR | 检查terminate等功能动作,尤其是否在该结束的步骤结束;不是所有动作类别的总体准确率 |
| AgentNetBench的Avg. SR | 汇总离线动作正确率;原文未展开权重,不能把三个类别百分比直接等权平均,更不能当在线任务完成率 |
| Avg Tokens/Step、Vis Tok% | 前者是每步输入token平均数量,后者是输入中视觉token的占比;Vis Tok%不是“相对原图保留了多少” |
| Avg Steps | 在指定预算下的平均交互步数;原文未清楚说明是否只统计成功任务,因此不自行补成“成功任务平均长度” |
| Latency | 选择模块的额外毫秒数。No Drop写0表示没有筛选开销,不表示模型零延迟 |
| Standard deviation | 三次运行分数的标准差,单位为百分点,衡量结果波动;不是置信区间 |
AgentNetBench动作判分补充依据是OpenCUA附录B:同一步可有多个有效动作,匹配其中之一即可。ReVision表6将AgentNetBench记为1,091项,而OpenCUA原文按100个任务介绍该基准;两者计数口径未对齐,所以不把1,091直接写成本文完整在线任务数。OSWorld和WebTailBench在ReVision中分别列369与609个任务。
主图3、4的数据在附录B表7–9展开。以下固定5图窗口,对比ReVision No Drop与启用RTS;OSWorld与WebTailBench取100步预算,AgentNetBench为离线Avg. SR。
| 测试 | 分数:不删→RTS | 平均每步token:不删→RTS |
|---|---|---|
| OSWorld | 32.3%→34.0% | 15,071→6,963 |
| AgentNetBench | 72.5%→73.8% | 15,076→8,975 |
| WebTailBench | 36.0%→40.2% | 15,362→9,651 |
分别减少约53.8%、40.5%、37.2%的每步输入,分数提高1.7、1.3、4.2个百分点。摘要中的“平均减少46% token、提高3%”不能直接拿来替代这三组具体比较:按这些表中数值等权计算,约为43.8%减少和2.4个百分点提高,摘要的平均口径未说明。附录B表7–9
步数也有减少:OSWorld在50步预算下由22.7降到19.8、SR34.5%→35.9%;WebTailBench同预算由27.9降到23.6、SR29.3%→32.8%。这是操作次数的改善,仍没有模型推理加环境等待的完整秒数统计。
表2固定主要底座与窗口,替换选择规则。OSWorld/AgentNetBench分数,No Drop为32.3/72.5;随机删50%为27.8/67.9,随机删90%为4.6/18.9;按像素相似删为28.6/68.4;Qwen特征余弦相似度筛选为32.1/72.3;RTS为34.0/73.8。说明只减少输入可能把关键变化一起删掉,筛选依据重要。
在线再加OmniParser的版本达到35.2/74.6,比RTS更高,但选择模块平均565毫秒,RTS仅22.5毫秒。这里的“22.5对565”衡量的是筛选器开销,不能写成一整个动作快25倍。表2
图5增加窗口长度,观察分数和token:No Drop大约在7图附近较早饱和,ReVision可延后到约11图附近;作者还观察到约23K总上下文附近的饱和趋势。这是其测试范围内的现象,不是模型上下文硬上限。
表3把“保留最早完整图、删后续重复块”的前向方案,换成“最新图完整、删较早重复块”的反向方案。9图时,OSWorld的No Drop/前向/反向为29.4/38.4/27.8%,AgentNetBench为72.5/77.1/68.9%,WebTailBench为35.1/48.9/31.6%。支持在长窗口下训练模型使用较早证据。但3图时前向也会降分:OSWorld32.2→30.5,AgentNetBench72.0→70.7,WebTailBench36.3→35.2。收益不能写成任何历史长度都成立。
表4及附录D表11比较两类底座、多个窗口。Qwen3-VL-8B的5图ReVision,在OSWorld/AgentNetBench为36.7/76.0%;9图时为41.6/80.2%,每步token为10,723/13,921。该表证明方法可用于另一底座,但缺少每行一一对应的No Drop,不能把换大底座的全部分差当作剪枝收益。
表5只给一张截图,此时没有相邻图片可删,检验压缩训练是否破坏单图定位。Qwen2.5-VL-7B原模型与ReVision在OSWorld-G为31.3/31.1,Pro为27.8/27.6,变化较小。这里是单题定位分数;表内另一底座名称出现“Qwen3-VL-7B”与方法行“8B”不一致,且正文说四个基准、实际只列三个,不自行补第四个或改模型名。
附录B除上面的100步结果,还列OSWorld的15/50步测试。5图时No Drop→RTS:SR@15为30.7→32.1%,SR@50为34.5→35.9%。AgentNetBench表8分项为坐标76.2→77.0%、内容59.8→61.0%、结束类42.9→44.2%,总体72.5→73.8%;各类不是同一分母。WebTailBench表9的SR@50为29.3→32.8%,已经与100步结果分开报告。
附录C表10报告稳定性:5图ReVision在OSWorld/AgentNetBench/WebTailBench的三次标准差为0.8/0.6/0.9个百分点;9图为1.0/0.8/1.1个百分点。三次波动较小,但不等于已做统计显著性检验。
附录E表12检验训练和使用时窗口不一致:3图训练、3图测试的OSWorld/AgentNetBench为30.5/70.7%,改成5图测试降到29.1/69.7%;5图训练、5图测试34.0/73.8%,改成3图测试29.4/69.9%。说明可以运行,但直接换窗口可能损失数个百分点,不能默认一个权重覆盖所有最佳设置。
附录H表13进一步分离“学分类器”与“在线区域解析”。Qwen余弦阈值筛选的OSWorld32.1%、8毫秒;换分类器32.6%、13毫秒;RTS34.0%、22毫秒;RTS加OmniParser35.2%、572毫秒。AgentNetBench对应72.3/72.9/73.8/74.6%。它更直接显示训练出的判断与解析成本之间的取舍;该表Vis Tok%是输入构成占比,不能当压缩保留率。
附录F图6对比各选择规则留下哪些区域,G图7–8是附录B已有数据的其他图形,I给训练细节,J表14展示浏览器隐私设置的连续操作案例;这些没有另一套可以叠加的成功率。正文§3、表1还统计多基准相邻图块重复约36%–56%,平均45.4%,是方法动机的重复量测量,不是部署时必然能删掉的比例。
这些结果说明,经过配套训练后,较长窗口中的重复视觉输入可以删除,并有助于决策。微小复选框变化可能被误删、全部截图仍需编码、文字历史继续增长;原文也未完整公布标签阈值及所有训练参数,所以实际端到端耗时和复现效果还需要单独确认。
开放状态:本轮未确认 ReVision 自身代码或模型链接,正文引用的 ScaleCUA 等仓库是第三方资源,不能当作本方法开源地址。最小复现先做前后截图区域匹配标签,训练三层分类器,再在 5 图窗口中完整保留首图、删除后续重复块并保持位置索引。
复现建议:建立弹窗、复选框、小数字更新和滚动的专门错误集,统计误删关键块比例;同时做同训练配置 No Drop、简单相似度与 RTS 对照。迁移时优先测语言模型预填充节省是否覆盖筛选开销,再考虑独立的视觉特征缓存。
核心思想:删除重复画面块并学会利用历史
速记流程:比较前后图块→保留新增信息→保持原始位置→从压缩历史生成动作
来源与核查:原论文 2605.11212v3;本轮核读§3诊断、§4.1–4.2方法与算法1、§5.1–5.5实验,正文表1–5及附录A–J表6–14;AgentNetBench判分另核OpenCUA附录B。已检查本节所用作者方法图;自拟例子已在相应位置说明。未读取实现源码。
Open this note in the interactive notebook (comments, hooks) → · All notes