Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation

See original paper
Research paper · arXiv:2510.27210

GUI-Rise rewards a generated history summary according to its usefulness for predicting the following action.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

A fluent history summary may still omit information required for a subsequent GUI decision.

Contributions

The paper combines structured reasoning, recursive textual memory, and a next-step utility reward for summaries.

Method

The policy reads the current screenshot, task, and previous summary, then emits progress reasoning, an action, and an updated summary.

Teacher-generated demonstrations support SFT before GRPO optimizes action and format rewards.

When the current action is correct, sampled actions from the next recorded state score the new summary; future screenshots are used only for training feedback.

作者方法图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

The 2B AITW ablation improves from 70.7% to 71.1% after adding the summary reward, isolating its contribution from other training changes.

Offline mobile and web action prediction is reported separately from online AndroidWorld and the Chrome subset of OSWorld.

详细阅读笔记 · P071

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 优先级 P0 · 复核日期:2026-09-07

同任务递归文字摘要+用下一步表现训练记忆。与研究方案的关系:已经用未来一步动作质量评估摘要效用;没有可检索的原图证据库。

0. 摘要

中文转述,非逐句翻译。GUI-Rise让小型GUI模型在输出动作时同时分析进度并更新历史摘要。先用教师示范做SFT,再用GRPO训练行动和摘要。一个关键设计是:拿新生成的摘要去预测下一状态的动作,用预测是否正确奖励当前摘要。

1. 方法动机

平铺历史成本高,简单摘要可能遗漏后续决策需要的内容;生成更长推理也可能只是在描述当前截图。作者希望摘要保留对后续行为有用的信息,而不是仅在语言上看起来完整。这个训练目标比固定模板摘要更接近历史记忆的实际用途。

2. 按原文小节解释方法

原文§3.2 Structured Reasoning with History Summary

主模型接收任务、当前截图和上一摘要,生成进度估计、决策推理、动作及新摘要。旧摘要递归更新,通常无需把全部历史截图重新输入。摘要存的是文字信息,模型没有Retrieve工具回看原屏幕。

原文§4.1 Supervised Fine-tuning

GPT-4o-mini读取标注动作和轨迹,生成结构化推理与摘要示范,随后训练Qwen2-VL-2B或Qwen2.5-VL-3B。教师看到正确动作是离线数据构造条件,不能在测试时继续给予这类答案提示。

原文§4.2 GRPO与动作奖励

在同一输入采样多个候选,根据格式和动作正确性比较候选并更新,不另训练独立价值网络。格式约束要求字段完整;动作奖励检查类型、定位和相关参数。只奖励格式无法证明历史真的被使用。

原文§4.2 History Summary Reward

若本步动作错误,摘要奖励为零;若正确,则把它生成的摘要连同下一张真实截图送入模型,多次采样下一步动作,以平均正确性评价摘要。下一步采样不回传梯度,奖励再用于当前候选的策略更新。这里用了训练轨迹的后续状态,不是测试时提前看到未来页面。

自拟例子:跨页填写订单号

本页出现订单号A123,下一页需要填写它。若摘要保留A123,下一步更可能填写正确,因而得到较高记忆奖励。若任务到十步之后才需要订单号,只用下一步效用仍可能看不到价值;这正是延迟需求和原证据回查实验的意义。

3. 模型输入输出与训练/推理分工

一个执行模型输入当前截图、任务、上一摘要,输出结构化思考、动作、新摘要;教师只生成训练示范,GRPO阶段还会多次调用学生估计未来一步奖励。部署时无需额外教师或记忆裁判。

先SFT后RL,不能写成单纯在现有提示后加reflect+CoT。方法层面仍延续结构化推理和历史摘要,较具体的新环节是摘要的下一步行动效用奖励。训练时多次rollout成本应与推理成本区分。

4. 实验、指标和原表解释

表2 AITW域内2B基线总体67.2,GUI-Rise71.1;3B72.5→73.7。GUIAct训练后零样本到AITW,3B38.9→56.0。表1Mind2Web域内3B的Cross-Task Step SR48.3→46.2,存在退化;跨域44.1→47.6。Ele.Acc看目标元素,OP.F1看操作类型/参数,Step SR看完整一步,均非任务最终成功率。表3在线2B AndroidWorld10.4,OSWorld仅Chrome子集8.7。

5. 消融、附录与证据限制

表4最有价值:2B基线67.2,只有两阶段训练66.0,只有结构化推理42.6,两者69.8;加历史摘要70.7,再加摘要奖励71.1。记忆奖励的独立增益为0.4点,不能把整套3.9点全归于它。附录提供提示和奖励,仍未证明长延迟事实或摘要矛盾自动修复。

6. 对当前历史信息方案的比较与复现建议

必须保留为训练型历史摘要基线。你可用相同小模型比较纯SFT摘要、GUI-Rise式下一步奖励,以及针对延迟需求的检索/证据奖励;不要把“训练摘要对未来有用”当全新概念。

历史证据表明过去发生过什么,不能直接证明当前页面还保持同一状态;本方案应分别验证检索内容、来源归属和状态时效。

核查原文;已读:§3.1–3.2、§4.1–4.2、§5、表1–4、附录训练与奖励。未阅读实现源码,资源链接存在不等于确认可完整复现。

原文方法图

原文图示与图题。下面直接引用作者图像;解释以上文为准。

作者方法图

原表核查附录

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。

原表 1(点击展开)

原表位置

Method Base Model Cross-Task Cross-Task Cross-Task Cross-Website Cross-Website Cross-Website Cross-Domain Cross-Domain Cross-Domain
Method Base Model Ele.Acc OP.F1 Step SR Ele.Acc OP.F1 Step SR Ele.Acc OP.F1 Step SR
Standard Setting
MindAct [ 9 ] - 55.1 75.7 52.0 42.0 65.2 38.9 42.1 66.5 39.6
GPT-4 [ 26 ] - 41.6 60.6 36.2 35.8 51.1 30.1 37.1 46.5 26.4
OmniParser [ 23 ] - 42.4 87.6 39.4 41.0 84.8 36.5 45.5 85.7 42.0
CogAgent [ 13 ] Qwen- VL-7B [ 2 ] 22.4 53.0 17.6 18.4 42.4 13.4 20.6 42.0 15.5
Qwen-VL [ 2 ] Qwen- VL-7B [ 2 ] 15.9 86.7 13.3 13.2 83.5 9.2 14.1 84.3 12.0
SeeCilck [ 8 ] Qwen- VL-7B [ 2 ] 28.3 87.0 25.5 21.4 80.6 16.4 23.2 84.8 20.8
Qwen2-VL-2B [ 36 ] Qwen2- VL-2B 37.7 86.4 33.2 36.0 79.2 27.6 36.3 81.8 30.7
ShowUI-2B [ 19 ] Qwen2- VL-2B 39.9 88.6 37.2 41.6 83.5 35.1 39.4 86.8 35.2
GUI-Rise Qwen2- VL-2B 45.5 84.8 38.8 43.0 82.5 35.4 46.5 84.1 39.7
Qwen2.5-VL-3B [ 3 ] Qwen2.5- VL-3B 52.1 90.2 48.3 49.8 85.2 43.5 48.7 87.3 44.1
GUI-Rise Qwen2.5- VL-3B 51.9 88.4 46.2 51.7 85.6 44.7 53.0 87.0 47.6
Zero-Shot Setting
Qwen2-VL-2B [ 36 ] Qwen2- VL-2B 18.8 85.0 15.5 20.0 80.4 14.3 22.7 83.5 18.1
ShowUI-2B [ 19 ] Qwen2- VL-2B 21.4 85.2 18.6 21.9 81.9 16.8 24.4 83.9 21.4
GUI-Rise Qwen2- VL-2B 27.0 85.2 24.2 25.5 82.0 21.1 33.4 84.0 29.7
Qwen2.5-VL-3B [ 3 ] Qwen2.5- VL-3B 22.2 87.1 20.1 22.5 84.3 17.0 24.8 84.3 22.8
GUI-Rise Qwen2.5- VL-3B 29.4 87.4 24.8 26.1 85.7 22.4 35.1 84.8 30.1
原表 2(点击展开)

原表位置

Method Base Model General Install G.Apps Single WebShop Overall
In-Domain Setting
ChatGPT-CoT [ 48 ] 5.9 4.4 10.5 9.4 8.4 7.7
PaLM2-CoT [ 28 ] 39.6
OmniParser [ 23 ] 48.3 57.8 51.6 77.4 52.9 57.7
SeeClick [ 8 ] Qwen- VL-7B [ 2 ] 54.0 66.4 54.9 63.5 57.6 59.3
Qwen2-VL-2B [ 36 ] Qwen2- VL-2B 61.4 71.8 62.6 73.7 66.7 67.2
ShowUI-2B [ 19 ] Qwen2- VL-2B 63.9 72.5 69.7 77.5 66.6 70.0
GUI-Rise Qwen2- VL-2B 64.4 73.9 69.7 78.2 68.2 71.1
Qwen2.5-VL-3B [ 3 ] Qwen2.5- VL-3B 67.3 75.2 72.3 79.1 69.0 72.5
GUI-Rise Qwen2.5- VL-3B 68.4 76.8 73.1 80.0 69.9 73.7
Zero-Shot Setting
Qwen2-VL-2B [ 36 ] Qwen2- VL-2B 31.0 46.9 40.2 19.4 36.5 34.7
ShowUI-2B [ 19 ] Qwen2- VL-2B 32.1 47.7 42.0 20.1 37.4 35.9
GUI-Rise Qwen2- VL-2B 54.3 57.5 50.3 55.2 52.9 54.1
Qwen2.5-VL-3B [ 3 ] Qwen2.5- VL-3B 35.5 43.1 41.7 35.0 39.3 38.9
GUI-Rise Qwen2.5- VL-3B 56.4 59.0 52.3 59.7 52.7 56.0
原表 3(点击展开)

原表位置

Method MiniWob(ZS) MiniWob(FT) Android World OSWorld ∗
SeeClick [ 8 ] 19.5
Qwen2-VL-2B [ 36 ] 20.8 66.8 0.0
ShowUI-2B [ 19 ] 27.1 71.5 7.0
Infigui-2B [ liu2025infiguiagent ] 9.0
UI-Tars-2B [ 24 ] 6.5
GUI-Rise-2B 30.6 72.8 10.4 8.7
原表 4(点击展开)

原表位置

# TST SCoT HS HSR General Install G.Apps Single WebShop. Overall
1 \times \times \times \times 61.4 71.8 62.6 73.7 66.7 67.2
2 \surd \times \times \times 61.4 70.6 63.0 73.2 62.0 66.0
3 \times \surd \times \times 38.0 48.4 46.9 36.7 42.9 42.6
4 \surd \surd \times \times 63.2 73.4 69.5 76.7 66.0 69.8
5 \surd \surd \surd \times 64.1 73.2 69.3 78.0 67.9 70.7
6 \surd \surd \surd \surd 64.4 73.9 69.7 78.2 68.2 71.1
原表 5(点击展开)

原表位置

Method Base Model Cross-Task Cross-Task Cross-Task Cross-Website Cross-Website Cross-Website Cross-Domain Cross-Domain Cross-Domain
Method Base Model Ele.Acc OP.F1 Step SR Ele.Acc OP.F1 Step SR Ele.Acc OP.F1 Step SR
In-Domain Setting
Qwen2.5-VL-7B Qwen2.5- VL-7B 54.5 90.5 50.5 53.5 88.7 46.9 51.1 89.1 46.8
Gui-Rise-7B Qwen2.5- VL-7B 56.9 90.4 52.3 56.7 88.7 50.7 56.4 90.2 51.4
原表 6(点击展开)

原表位置

Method Base Model General Install G.Apps Single WebShop Overall
In-Domain Setting
Qwen2.5-VL-7B Qwen2.5- VL-7B 68.6 77.4 76.2 80.0 68.5 73.7
Gui-Rise-7B Qwen2.5- VL-7B 70.1 80.2 78.6 81.4 69.9 75.7

Open this note in the interactive notebook (comments, hooks) → · All notes