Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

SecAgent: Efficient Mobile GUI Agent with Semantic Context

See original paper
Research paper · arXiv:2603.08533

SecAgent carries older interaction information in textual semantic context while retaining one recent visual step.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Action coordinates alone omit interaction meaning, but carrying several old screenshots increases model input cost.

Contributions

The method unifies grounding and navigation action formats and trains a small model to update semantic context while acting.

Method

Qwen2.5-VL-3B reads the current screenshot, previous screenshot and action, task, and existing semantic context.

One generation emits updated context, reasoning, and a grounded action.

LoRA SFT is followed by GRPO with format and action-correctness rewards.

作者方法图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

In the history ablation, one visual step plus semantic context achieves 72.8% offline trajectory accuracy versus 73.0% for five visual steps without semantic context.

The corresponding first-token times are 0.11 s and 0.22 s, excluding application execution, transport, and recovery costs.

详细阅读笔记 · Y26-067

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 优先级 P0 · 复核日期:2026-09-07

与当前研究的关系:Qwen2.5-VL-3B直接输出摘要、思考、动作,是3B摘要的直接先行工作。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。

0. 摘要

中文转述,非逐句译文。SecAgent用不断更新的语义上下文记录过去点击的标签、输入内容和搜索结果,使小型手机代理主要依赖当前截图和一步视觉历史。训练阶段统一定位与导航动作格式,再通过监督训练和强化微调学习“更新上下文—思考—动作”的输出。实验同时考察导航准确率、输入长度及首字延迟。

1. 方法动机

手机导航经常需要记住刚才输入的查询和已经访问的结果。单纯保留坐标动作不能表达这些含义;直接堆叠多张历史截图虽能保留信息,却显著增加视觉编码和上下文计算。

论文的直觉是让模型把历史操作转换成短文本,同时保留最近一次真实画面,兼顾长期语义和局部状态变化。这不是完全删除历史,而是把旧视觉事实压缩为可解释的操作摘要。

2. 方法设计

§4.1 Formulation

统一两类训练动作。 定位数据原本要求输出目标框,导航数据要求输出点击点。方法将框中心转换成点击坐标,使定位样本与导航样本共享动作格式,减少训练目标不一致。

§4.2 Architecture:输入

构造包含语义上下文的状态。 每一步输入任务、当前截图、上一步截图及动作,以及上一步语义上下文。默认历史窗口为1;语义上下文负责承接更早的关键事件,而不是继续加入全部旧图。

§4.2 Architecture:输出

在同一次生成中更新记忆并行动。 模型自回归输出新的上下文、解释当前决策的思考和已定位动作。上下文记录有意义的点击标签、输入及搜索结果,避免只保存无法独立解释的坐标。

§4.3 Training:SFT

先学习结构化输出。 使用转换后的定位数据和导航数据进行监督微调,优化完整三元组的下一词预测。底座为Qwen2.5-VL-3B,监督阶段采用LoRA。

§4.3 Training:GRPO

再以规则反馈微调。 强化阶段使用GRPO和全参数更新;格式正确获得0.5奖励,动作正确获得1奖励。奖励检查结构和动作,并未单独给上下文压缩比例或完整任务速度设奖励。

§4.2 推理循环

逐步循环使用短历史。 执行动作后取得新截图,再以上一轮生成的摘要进入下一轮。每步仍有当前画面处理和动作生成,节省主要来自历史缩短,而不是跳过所有滑动后的观察。

自拟例子:把记忆在什么时候使用讲清楚

首轮搜索杭州酒店,后面截图只有结果。语义上下文保存查询与筛选条件,当前图用于点击。若摘要漏掉某家酒店的取消规则,需要额外原证据回查才能找回。

模型输入、输出与记忆边界

项目 本文实际范围
记忆来源 同任务语义历史摘要
与本方案相同或不同 Qwen2.5-VL-3B直接输出摘要、思考、动作,是3B摘要的直接先行工作
应固定的对照条件 固定相同3B与历史窗口,增加证据库才构成新变量;须计摘要生成成本。

训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。

3. 与其他方法对比

对比配置 SecAgent的关键变化 效果与代价
完全无历史 保留一步历史及语义摘要 提升跨步依赖处理,增加必要输入
五步截图历史、无语义上下文 用短文本承接旧事件 在相近准确率下缩短输入和首字延迟
一步历史、无语义上下文 添加有含义的历史操作记录 提升任务准确率,摘要仍可能遗漏信息
原始定位数据直接混训 将目标框转成导航点击点 统一输出空间,不需要推理时额外转换器

贡献主要来自历史表示和训练格式的配合。单纯扩大截图窗口也能继续提高准确率,但其增益与效率成本并不对称。

4. 实验表现与优势

表4提供了较干净的历史表示比较:一步历史加语义上下文的步骤准确率94.8%、任务准确率72.8%,输入2,239 tokens、TTFT 0.11秒;五步历史且无语义上下文分别为95.0%、73.0%、3,507 tokens和0.22秒。对应生成吞吐为140和124 tokens/秒。§5.3、表4

同一表中,移除一步历史配置的语义上下文,任务准确率从72.8%降至56.4%,而TTFT仍为0.11秒,说明短摘要的主要价值是保留有效信息。表2完整训练的CMGUI结果为96.4%步骤准确率和80.0%任务准确率;它与表4的消融配置不同,不宜混成同一个对照。表2、4、6

这些任务准确率按离线轨迹的全部动作是否正确计算。TTFT和生成吞吐是模型推理指标,并不包含手机动作等待、截图传输及失败恢复,因此论文没有在此表给出完整真实任务减半的证据。

5. 学习与应用

论文提供CMGUI数据入口,本轮未从原文确认专属代码入口。复现需保留数据版本差异:论文在GUIOdyssey更新评测集随机抽取100条轨迹,不能直接与其他版本的报告数值等同。

复现建议:先固定同一模型与动作数据,比较一步历史、五步历史及一步历史加摘要,再逐项测量视觉编码、TTFT、输出长度和任务正确率。摘要应记录查询值、已访问目标和用户约束,避免只重复动作坐标;遇到重复滑动仍须检查新画面,因为该方法没有单独训练停止条件监测器。

6. 总结

核心思想:用语义摘要替代多帧旧截图。

速记流程:读取当前与上一帧→更新关键操作摘要→生成思考和动作→带着短记忆继续

来源与核查:原论文,已读§4.1–4.3、§5.1–5.3及表2–6;开放资源状态依据论文核查。

对“历史摘要+局部视觉证据回查”的具体启发

固定相同3B与历史窗口,增加证据库才构成新变量;须计摘要生成成本。

不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。

原文方法图

原文图示与图题。下面直接引用作者图像;解释以上文为准。

作者方法图

原表核查附录

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。

原表 1(点击展开)

原表位置

Name Training Data Training Data Training Data Training Data Training Data Training Data Name Benchmark Data Benchmark Data Benchmark Data Benchmark Data
Name Traj. Steps Apps CoT Human-Verified Open-Source Name Traj. Steps Apps Multi-Choice
Mobile-Bench-v2 [ 47 ] 12,856 93,592 49 Magic-RICH [ 37 ] - 4,000 150
AgentCPM-GUI [ 57 ] 55k 470k 30 CAGUI [ 57 ] 600 4,516 30
CMGUI (Ours) 29,711 121,265 44 CMGUI-Bench (Ours) 390 2,574 44
原表 2(点击展开)

原表位置

Model Step Acc. Task Acc. Action Acc. Action Acc. Action Acc. Action Acc.
Model Step Acc. Task Acc. Click Acc. Type Acc. Swipe Acc. Terminate Acc.
Closed-source Models Closed-source Models Closed-source Models Closed-source Models
GPT-4o [ 15 ] 48.4 0.0 43.5 68.3 63.7 62.1
Claude-3-Sonnet [ 2 ] 81.4 25.8 91.1 30.0 81.3 53.4
Open-source Models (7B and 8B) Open-source Models (7B and 8B) Open-source Models (7B and 8B) Open-source Models (7B and 8B)
Qwen2.5-VL-7B [ 3 ] 83.8 35.6 89.0 75.9 4.4 79.0
UI-TARS-7B [ 29 ] 63.8 2.5 80.2 11.1 3.3 8.3
OS-Atlas-7B [ 45 ] 69.6 10.0 77.0 76.8 5.5 32.1
GUI-R1-7B [ 28 ] 70.5 7.9 84.2 45.5 5.5 8.7
UI-Venus-Navi-7B [ 29 ] 89.6 53.1 92.6 91.5 45.0 81.2
AgentCPM-GUI-8B [ 57 ] 84.9 39.0 85.8 93.8 54.9 81.2
Qwen3-VL-8B [ 30 ] 91.1 59.7 92.6 82.6 69.2 94.6
Open-source Models (3B and 4B) Open-source Models (3B and 4B) Open-source Models (3B and 4B) Open-source Models (3B and 4B)
Qwen2.5-VL-3B [ 3 ] 78.8 25.6 83.2 66.0 5.5 81.9
UI-R1-3B [ 27 ] 56.4 1.0 71.2 7.6 5.5 6.5
GUI-R1-3B [ 28 ] 45.2 0.5 57.1 8.0 2.2 4.3
Qwen3-VL-4B [ 30 ] 90.1 57.4 91.2 84.8 65.9 94.6
SecAgent-3B (Ours) 96.4 80.0 96.1 99.1 87.6 99.2
原表 3(点击展开)

原表位置

Models AndroidControl GUIOdyssey
Closed-source Models
GPT-4o [ 15 ] 20.8 ∗ 29.3
Claude-3-Sonnet [ 2 ] 12.5 ∗ 46.5
Open-source Models (7B and 8B)
Qwen2.5-VL-7B [ 3 ] 62.9 ∗ 59.6
UI-TARS-7B [ 29 ] 74.4 ∗ 37.5
OS-Atlas-7B [ 45 ] 71.2 † 65.2
GUI-R1-7B [ 28 ] 51.7 ‡ 41.9
UI-Venus-Navi-7B [ 29 ] 76.1 † 71.1
AgentCPM-GUI-8B [ 57 ] 69.2 ∗ 79.2
Qwen3-VL-8B [ 30 ] 46.4 53.8
Open-source Models (3B and 4B)
Qwen2.5-VL-3B [ 3 ] 60.1 49.3
UI-R1-3B [ 27 ] 45.4 ‡ 32.7
GUI-R1-3B [ 28 ] 46.6 ‡ 34.6
Qwen3-VL-4B [ 30 ] 47.5 53.4
SecAgent-3B (Ours) 69.5 74.3
原表 4(点击展开)

原表位置

Settings SA TA ITC TTFT \downarrow TPS \uparrow
N=0 85.3 36.2 1537 0.07 145
N=1 94.8 72.8 2239 0.11 140
N=2 95.1 73.8 2760 0.14 134
N=5 95.5 74.1 3642 0.22 122
N=5 w/o SC 95.0 73.0 3507 0.22 124
N=1 w/o SC 90.6 56.4 2171 0.11 142
N=1 w/o thought 94.0 68.9 2207 0.11 141
原表 5(点击展开)

原表位置

Training Data Training Method In-Domain Apps In-Domain Apps In-Domain Apps In-Domain Apps Out-of-Domain Apps Out-of-Domain Apps Out-of-Domain Apps Out-of-Domain Apps
Training Data Training Method Taobao SA / TA Kuaishou SA / TA Fliggy SA / TA JD SA / TA Rednote SA / TA Bilibili SA / TA Baidu Maps SA / TA Pinduoduo SA / TA
Partial SFT 91.2 / 56.9 89.1 / 44.8 91.9 / 58.3 91.9 / 61.1 91.7 / 54.5 88.4 / 45.8 86.6 / 41.7 94.4 / 66.7
Partial SFT + RFT 94.5 / 70.8 90.1 / 48.3 96.0 / 79.2 93.5 / 61.1 96.4 / 80.0 90.2 / 45.8 91.3 / 62.5 97.6 / 83.3
Full SFT 94.5 / 70.8 91.2 / 58.6 96.1 / 79.2 92.9 / 61.1 97.3 / 87.3 96.3 / 79.2 96.9 / 79.2 97.7 / 83.3
Full SFT + RFT 95.5 / 73.8 93.2 / 75.9 96.6 / 79.2 97.6 / 83.3 98.4 / 89.1 97.6 / 91.7 96.6 / 79.2 97.6 / 88.9
原表 6(点击展开)

原表位置

Training Data Training Method SA TA
Navigation SFT 93.7 65.8
Grounding + Navigation SFT 94.4 69.2
Gr2Nav + Navigation SFT 94.8 72.8
Gr2Nav + Navigation RFT ∗ 95.2 75.9
Gr2Nav + Navigation SFT + RFT 96.4 80.0
原表 7(点击展开)

原表位置

Hyperparameter Value
Supervised Fine-tuning
Epoch 6
Batch Size 2
Learning Rate 2e-5
LoRA Rank 8
LoRA Alpha 16
Reinforcement Fine-tuning
Epoch 2
Batch Size 8
Learning Rate 1e-6
KL Penalty 0.04
Number of Rollouts 16
Clip Range \epsilon_{\text{low}},\epsilon_{\text{high}} 0.2, 0.28
原表 8(点击展开)

原表位置

Action Description Format
CLICK Click the point on the screen with coordinate (x, y). {"name": "mobile_use", "arguments": {"action": "click", "coordinate": [x, y]}}
SWIPE Swipe from the starting point with coordinate (x, y) to the end point with coordinates2 (x2, y2). {"name": "mobile_use", "arguments": {"action": "swipe", "coordinate": [x, y], "coordinate2": [x2, y2]}}
TYPE Input the specified text into the activated input box. {"name": "mobile_use", "arguments": {"action": "type", "text": "specified_text"}}
SYSTEM_BUTTON Press the specified system button ( e.g . , “Back”, “Home”, “Menu”, “Enter”). {"name": "mobile_use", "arguments": {"action": "system_button", "button": "specified_button"}}
WAIT Wait specified seconds for the change to happen. {"name": "mobile_use", "arguments": {"action": "wait", "time": "specified_seconds"}}
TERMINATE Terminate the current task and report its completion status (“success” or “failure”). {"name": "mobile_use", "arguments": {"action": "terminate", "status": "success"}}
原表 9(点击展开)

原表位置

#ID App Name #Traj. #ID App Name #Traj. #ID App Name #Traj. #ID App Name #Traj.
1 Taobao 4,722 2 Kuaishou 1,829 3 Rednote 1,341 4 Baidu Maps 1,213
5 Fliggy 1,184 6 Bilibili 1,157 7 WeChat 1145 8 JD 1,023
9 Pinduoduo 861 10 Weather 817 11 Meituan 777 12 Douyin 757
13 Calendar 741 14 Poizon 714 15 Aliyun Drive 693 16 Amap 686
17 Ele.me 640 18 Quark Browser 589 19 Toutiao 580 20 Tencent Maps 576
21 Calculator 541 22 Baidu 519 23 Tencent Meeting 499 24 Browser 496
25 Tomato Novel 492 26 Didi Chuxing 447 27 Notes 432 28 WeCom 429
29 Message 426 30 Contacts 401 31 DingTalk 393 32 Feishu 380
33 Baidu Netdisk 355 34 Cainiao 329 35 Ctrip 264 36 WPS Office 163
37 QQ 152 38 WeChat Reading 151 39 Weibo 149 40 Zhihu 130
41 Xianyu 129 42 Alipay 120 43 Zhuanzhuan 117 44 Luckin Coffee 48

Open this note in the interactive notebook (comments, hooks) → · All notes