Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents

See original paper
Research paper · arXiv:2510.00413

PAL-UI teaches a GUI policy to retrieve an earlier screenshot by step number when textual history is insufficient.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Compact summaries may omit details that become necessary several actions later.

Contributions

The method combines observation and action-result summaries with a learned active look-back tool.

Method

A captioner describes each screen, and an action validator interprets changes between consecutive screenshots.

The policy chooses between a GUI action and Retrieve(j), which reopens a stored screenshot without changing the live environment.

Balanced retrieval and non-retrieval demonstrations supervise 3B and 7B policies.

作者方法图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

In arXiv v2, PAL-UI-7B reaches 57.8% offline step success on AndroidControl-High, versus 56.3% for the summary-plus-SFT ablation.

The v2 analysis measures context length and cross-dataset action prediction; online results in a separate expanded manuscript are not mixed into those tables.

详细阅读笔记 · P052

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 优先级 P0 · 复核日期:2026-09-07

PAL-UI是同任务文字摘要+按步读取历史整图。当前方案为3B概括+逐帧元素文字文档+按帧读取/全文搜索。本质区别见最新5篇对照:它保留像素供重读,我们允许从文字明细反查帧号;摘要没写不等于原图证据丢失。

方案版本说明:下文比较段中的“对象身份、状态版本、按属性查表”等属于前阶段设计,当前首版不要求这些机制。本文的论文方法与实验记录仍按下述版本范围使用。

版本与核查范围: 下文主体及原表1–5依据arXiv v2。另检索到OpenReview扩展稿,其公开PDF索引新增在线评测和训练时间。该稿PDF/forum直接访问进入验证页,本次只核对可见的原PDF索引内容,不声称已通读其全文,也未核实具体发布日期或录用状态。两版表号不同,下文分开标注。

0. 摘要

中文转述,非逐句翻译。PAL-UI用观察摘要与动作结果摘要压缩GUI历史,同时把Retrieve工具加入动作空间。策略需要旧细节时返回某个历史步的原始截图,再根据当前图与旧证据继续决策。3B/7B策略通过带工具调用示范的SFT学会何时回看。

1. 方法动机

原始历史完整但贵,纯文字摘要可能漏掉后来才需要的界面细节。作者没有假设摘要可以完美保真,而是让执行器主动恢复某个旧观察。用户的元素表方案把历史细节在写入时拆成对象、属性和状态版本,读取时查记录;这与PAL-UI先选历史画面、再重读像素的流程不同。YOLO、OCR或摘要器的型号属于实现选择,研究差异应落在元素身份关联、字段保留、状态版本管理与查询方式上。

2. 按原文小节解释方法

原文§4.1 Observation-level Captioner

Qwen2.5-VL-7B根据任务和每张截图写简短观察,强调屏幕文本、控件标签和状态。它负责把旧画面转文字,但原图仍保存于可检索历史,不是摘要后永久删除。

原文§4.1 Action-level Validator

同一摘要模型读取动作及前后截图,解释动作含义并判断结果。比如输入足球后确实出现相关结果页,摘要才记录查询已提交;模型判断仍可能误把等待或局部变化当成功。

原文§4.1 Memory Retrieval Tool

Retrieve(j)以历史步号为参数,取j<i的原截图放回当前上下文。它是确定位置的历史读取接口,原文不是对图标数据库做语义RAG,也没有给出局部实体粒度的检索器。

原文§4.2 Active Look-back Planning Process

主策略读取任务、压缩记忆和当前图,选择直接GUI动作或检索。选检索时,取回旧图后继续生成动作。Retrieve(j)只读取存档,不把手机真正操作回第j步;当前环境状态仍然保持在当前步。是否回看由策略生成工具调用决定,原文未给固定的数值置信度阈值。回看增加工具返回及后续推理,不能认为省掉视觉token后没有调用代价。

自拟单步输入输出: 第2步曾出现登录错误,第10步需要处理问题。摘要记“第2步登录失败”,策略据此输出Retrieve(2);程序返回第2步整张截图,策略从图中重新读取错误码,再决定当前页面上的下一动作。摘要帮助选步号,整图提供被摘要省略的细节。工具本身不负责按“错误码”在所有页面中做语义搜索。

原文§4.3 Training Data Construction

AndroidControl人类轨迹先生成双摘要,再由教师按历史回顾、候选动作、置信评估、工具后决策四阶段产生示范。仅保留最终动作符合标注的样本;4.3K成功检索样本+4.3K不检索样本,并提高远历史样本权重。Qwen3-32B把分段思考整理为一致输出。

自拟例子:找回被摘要漏掉的错误码

第2步登录失败,摘要只写登录失败,第10步排障需要具体错误码。PAL-UI调用Retrieve(2)重读整张旧图。用户方案则在第2步把错误提示作为元素记录写表,之后按账号、页面、属性及时间条件直接查询错误码。其差异包含写入时的结构化提取和对象关联,不只是把整图返回改成裁图返回。若当时未识别或未保存该错误码,查表无法凭空恢复;主方案不通过回看整帧兜底。

3. 模型输入输出与训练/推理分工

摘要器:任务+当前图→观察文字;动作+前后图→结果文字。策略3B/7B:任务+摘要+当前图→GUI动作或Retrieve(j);工具:j→原截图;策略收到回图后再输出动作。

仅SFT本方法,未用RL。8.6K平衡步级样本;8张A100-80G,batch8、学习率1e-5。训练时已知正确动作筛选,测试时不得用正确动作或未来截图挑历史。

4. 实验、指标和原表解释

§5表1为离线下一动作评估:AndroidControl-High基线Qwen2.5-VL-3B/7B SR38.9/47.1,PAL-UI-3B/7B为49.3/57.8;GUI-Odyssey对应26.7/34.4→34.6/41.7。训练样本来自AndroidControl,GUI-Odyssey是跨数据集测试;§6另有Multimodal-Mind2Web跨平台测试。

指标 具体含义 解释边界
Type / Type Match 动作类型是否匹配,如Click、Type、Scroll 不是单独的文字输入动作得分;点错位置也可能类型对
GR / Grounding,新稿也写GA 目标元素定位或坐标预测是否正确 PAL-UI正文未写明点击容差、GR分母及输入文本归一化细则,不能臆造
SR / Step Success 当前这一步的动作类型及相应参数整体是否正确 手机离线单步指标,不是自由执行完整任务成功率,也不能由Type×GR求得
Overall 表1两数据集各Type/GR/SR六列的汇总 原文未显式给公式;按各行数值核算为六数算术平均。7B为(71.3+70.5+57.8+65.1+46.8+41.7)/6≈58.9
Op.F1 / Operation 网页动作及其附带内容的token F1 不只是动作类别;依据Mind2Web官方协议,需要考虑Type/Select等的参数文本
Ele.Acc / Element 网页操作目标元素是否选对 不等于OCR准确率或元素检测召回率;PAL自己的坐标到元素适配细节未核
网页SR 正确元素且操作完全匹配的单步比例 Mind2Web官方实现要求element正确且operation F1=1,不是在线网页整任务成功率
Len. 主策略输入上下文token长度 用AndroidControl测试集50条轨迹统计;不是所有摘要/检索调用的总token账单或实测时间
Step Distance 当前步i与被取回步j的距离i-j 从100条已经调用Retrieve的响应中统计,大多在5步内,最远8步;8不是工具允许回看的上限
Frequency Count 上述100条中各回看距离出现的次数 不是总体工具调用率、检索Recall@K或召回正确率

Mind2Web官方指标实现把操作与参数按空白分词成集合,计算precision/recall的调和平均;PAL-UI仅说明遵循官方协议,本次未核到PAL自己的完整评测脚本。

上下文成本: 无历史4307.6、仅动作4371.7、最近5图12630.0、全部历史图16383.8、双摘要4965.4、完整PAL7330.2 token。PAL占全部图方案约44.74%(约45%);这是输入长度比较,不是已经验证总推理耗时减少55%。无历史仍包括当前图、任务等,因此不为0。

公开扩展稿新增指标(仅核PDF索引): AWSR为AndroidWorld在线整任务成功率,ALSR为AndroidLab在线整任务成功率;评测最多25步。Avg. Step为平均动作步数,尚未核实分母是成功任务还是全部任务,以及是否计检索。附录表7的Time是训练耗时,不能当作推理延迟。

扩展稿表2:模型 Avg. Step AWSR ALSR
OS-Atlas-7B 15.8 20.6 11.9
UI-R1-7B 15.3 23.4 15.7
GUI-R1-7B 13.2 26.8 18.3
Qwen2.5-VL-7B 16.4 19.8 12.3
PAL-UI-7B 11.6 30.9 22.1

扩展稿附录C在相同8.6K种子、1 epoch条件下比较SFT、RL和PAL-UI,训练Time分别1.3h、9.4h、2.4h。PAL本身仍用SFT,RL是新增对照。上述新增数据来自公开稿原PDF索引,不与arXiv表号混用。

5. 消融、附录与证据限制

更正旧笔记遗漏:arXiv v2的§6已提供“+SFT & SA、只有摘要不回看”的消融,不能说没有这一控制。 原表2比较Zero-shot、+SA、+SFT、+SFT&SA、+SFT&PAL、Full。最贴近回看作用的比较是SFT+SA→Full:AC-High SR为56.3→57.8(+1.5个百分点),GUI-Odyssey为38.4→41.7(+3.3个百分点);不能把相比零样本的+10.7/+7.3个百分点全部归因于Retrieve。

原表3比较不同历史输入方式与Len;原表4在网页Cross-Task、Cross-Website、Cross-Domain三划分比较Op.F1/Ele.Acc/SR;原表5换用Qwen2.5-VL-3B/7B、InternVL3-2B/8B作摘要器。这里网页划分名称来自基准本身,不能说只用手机训练的PAL已经见过其训练网站。作者还统计了检索距离。摘要器实验报告的是最终动作效果,未单列摘要忠实度、动作结果验证准确率、元素写入召回率或检索正确率。

本次完整阅读的arXiv v2在§9之后进入参考文献,未见附录;§9仅声明补充材料提供评测代码。OpenReview扩展稿索引可见附录A/B/C,但没有通读其全文。旧稿缺少在线实验,扩展稿已补充在线任务成功率;两者均不能仅凭输入长度、平均动作步数或训练时间推出端到端推理时延改善。

6. 对当前历史信息方案的比较与复现建议

用户主方案现在应称为元素级结构化历史记忆:每个检测到的元素写入对象ID、所属页面/父对象、OCR或属性、观察时间及状态版本,读取时按ID或属性条件查表,局部图可以单独配置;不默认向量相似度top-k,不存历史整帧。

维度 PAL-UI 用户明确的主方案
历史记录单元 某一步的整张截图+两类摘要 某个元素的属性与状态记录
查询参数 历史步号j 对象/元素、字段、时间或版本条件
返回内容 旧截图,交给VLM重读 匹配的字段或记录,必要时附已存元素局部图
细节主要何时提取 摘要时部分提取,回看时再次解释像素 观察写表时提取,后续直接读取
信息遗漏后 原图仍在可重新观察 未写入的细节不能靠查表恢复

首要对照使用同一执行器、同一摘要和同一观测轨迹,分别实现只摘要、PAL-UI步号整图读取、元素表只保留最新值、元素表保留历史版本。整图存档只属于PAL-UI等对照组;用户主线不通过整图回退。分别测元素写入覆盖率、对象关联错误、字段正确率、版本查询正确率、最终动作/任务成功率和实际总耗时,避免只比较新系统与裸模型。

历史证据表明过去发生过什么,不能直接证明当前页面还保持同一状态;本方案应分别验证检索内容、来源归属和状态时效。

核查原文;已读:§3–6、表1–5、检索行为分析及§9可复现性声明。另核对Mind2Web官方指标实现和OpenReview扩展稿的可见原PDF索引;没有取得PAL完整评测源码或扩展稿全文。资源链接存在不等于确认可完整复现。

原文方法图

原文图示与图题。下面直接引用作者图像;解释以上文为准。

作者方法图

原表核查附录

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。

原表 1(点击展开)

原表位置

Model Method AndroidControl-High AndroidControl-High AndroidControl-High GUI-Odyssey GUI-Odyssey GUI-Odyssey Overall
Model Method Type GR SR Type GR SR Overall
GPT-4o ( ) ZS 63.1 30.9 21.2 37.5 14.2 5.4 28.7
Qwen2.5-VL-3B ( ) ZS 47.8 46.5 38.9 37.4 26.5 26.7 37.3
Qwen2.5-VL-7B ( ) ZS 68.7 59.7 47.1 55.6 37.8 34.4 50.6
OS-Atlas-4B ( ) SFT 49.0 49.5 22.8 49.6 34.6 20.3 37.6
OS-Atlas-7B ( ) SFT 57.4 54.9 29.8 60.4 39.7 27.0 44.8
NaviMaster-7B ( ) SFT 72.9 - 54.0 64.4 - 36.9 -
UI-R1-3B ( ) RFT 57.8 55.7 45.4 52.2 34.5 32.5 46.4
GUI-R1-3B ( ) RFT 58.0 56.2 46.5 54.8 41.5 41.3 49.8
GUI-R1-7B ( ) RFT 71.6 65.6 51.7 65.5 43.6 38.8 56.1
PAL-UI-3B SFT 60.4 58.7 49.3 56.7 36.9 34.6 49.4
PAL-UI-7B SFT 71.3 70.5 57.8 65.1 46.8 41.7 58.9
原表 2(点击展开)

原表位置

Setting AC-High AC-High GUI-Odessey GUI-Odessey
Setting Type SR Type SR
Zero-Shot 68.7 47.1 55.6 34.4
+ SA 70.9 54.6 62.8 38.9
+ SFT 73.4 53.2 56.3 36.4
+ SFT & SA 72.9 56.3 59.4 38.4
+ SFT & PAL 67.4 52.3 56.6 37.1
+ Full 71.3 57.8 65.1 41.7
原表 3(点击展开)

原表位置

Setting Len. AC-High AC-High GUI-Odessey GUI-Odessey
Setting Len. Type SR Type SR
None 4307.6 65.4 45.8 52.6 34.6
+ A 4371.7 68.7 47.1 55.6 34.4
+ 5O 12630.0 69.1 48.3 56.8 36.4
+ AO 16383.8 67.8 45.5 54.6 34.9
+ SA 4965.4 70.9 54.6 62.8 38.9
+ PAL 7330.2 71.3 57.8 65.1 41.7
原表 4(点击展开)

原表位置

Model Cross-Task Cross-Task Cross-Task Cross-Website Cross-Website Cross-Website Cross-Domain Cross-Domain Cross-Domain
Model Op.F1 Ele.Acc SR Op.F1 Ele.Acc SR Op.F1 Ele.Acc SR
Qwen2.5-VL-3B 53.8 26.5 25.9 50.3 25.3 23.4 53.5 30.4 28.3
Qwen2.5-VL-7B 61.3 33.1 32.3 57.1 31.7 29.8 61.0 36.8 34.4
PAL-UI-3B 54.5 27.9 27.6 54.6 25.9 25.1 57.1 33.3 31.9
PAL-UI-7B 68.7 36.0 35.0 69.2 36.4 35.2 69.6 39.6 37.9
原表 5(点击展开)

原表位置

Summarization Model AC-High AC-High GUI-Odessey GUI-Odessey
Summarization Model Type SR Type SR
Qwen2.5-VL-3B 70.9 57.4 63.8 41.0
Qwen2.5-VL-7B 71.3 57.8 65.1 41.7
InternVL3-2B 69.4 56.2 64.2 39.8
InternVL3-8B 72.5 58.4 64.0 41.3

Open this note in the interactive notebook (comments, hooks) → · All notes