MAGNET retrieves reusable procedures for planning and visual examples of stable functions for grounding.
App updates can change icon appearance and workflows even when user intent and interface functions remain stable.
The framework separates procedural memory from function-linked icon examples and updates both through successful use.
Successful trajectories are grouped and abstracted into parameterized procedures, while clicked UI crops are paired with functional descriptions.
The planner retrieves relevant procedures; the actor receives visual examples or template-based location hints for the current screen.
Memory ranking combines semantic relevance with access history and recency, without retraining the main policy.

Offline evaluation covers AITZ, GUI-Odyssey, and AMEX, including distribution-shift settings.
The reported 42.62% AndroidWorld success uses only 61 Easy tasks and memory initialized through three execution rounds, rather than the full cold-start benchmark.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 优先级 P0 · 复核日期:2026-09-07
与当前研究的关系:直接保存功能描述与图标patch并检索,是图标memory最直接同类。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。
摘要译文;依据本轮获取的原始摘要,许可:开放许可。
由大型基础模型驱动的手机 GUI 智能体可以自主执行任务,但应用频繁更新会改变界面外观、重组操作流程,使基于旧数据训练的智能体失效。尽管表面变化,功能语义和任务意图通常保持稳定。基于这一观察,作者提出记忆驱动的适应框架 MAGNET,包含两级记忆:将不同视觉特征关联到稳定功能语义的静态记忆,用于稳健动作定位;以及跨不同流程保存稳定任务意图的过程记忆。作者还提出动态记忆演化机制,优先使用经常访问的知识,持续更新两类记忆。AndroidWorld 在线评测显示方法优于基线,离线评测也验证了分布变化下的改进。结果支持利用界面变化背后的稳定结构,改善智能体在软件演进环境中的表现和泛化。
应用升级后,图标外观和入口位置可能变化,但“搜索”“添加联系人”等功能没有改变。只记某个旧截图或固定坐标容易过时;只记抽象流程又不能帮助实际找按钮。
作者假设:规划层需要可复用的任务步骤,定位层需要同一功能的不同视觉实例,二者应分别存储并随使用更新。这里的“静态”指相对稳定的功能关联,不表示数据库永远不变。
从成功轨迹抽象流程。 用 MiniCPM-Embedding 表示任务指令,按相似度阈值连边,寻找组内两两相似的任务簇;让规划模型总结共有步骤,并把应用名、搜索词等替换成参数占位符,形成流程记忆。
构建功能与图标对应表。 从点击前截图、点击动作、点击后截图提取三元组。OmniParserV2 找候选元素框,按实际点击位置选中对应元素并裁出图块;Qwen2.5-VL-32B 结合变化写出功能描述。作者得到 UI-40K,含 41,009 条实例、20,618 个不同功能意图。
规划时检索流程。 用新任务与流程名称的语义相似度筛选候选,再按记忆排序规则选出少数流程;将其和当前截图、指令、页面描述及历史动作交给规划器,生成子任务。
定位时检索视觉示例。 用子任务描述查相应功能的图块。通用视觉模型直接读取当前截图与示例;固定输入格式的专门定位模型,则先用模板匹配在当前截图找参考位置,再在附近若干图标外画提示框。这是额外视觉提示,不是直接重用旧点击坐标。
执行并从成功结果更新。 执行器逐步完成子任务;成功轨迹可抽取新流程,新出现的图块按功能归入现有条目或新建条目,同一功能允许多种视觉版本。论文没有训练主模型权重。
按相关性、访问次数与新旧排序。 首先取语义最相关的 N 条;再计算距离上次访问多久、累计访问多少次,常用记忆衰减较慢,排序相同时优先新条目,最终返回 K 条。附录算法把新条目访问数初始化为 1,避免除零。此处“被经常检索”只是效用的代理,并不等同于经常执行成功;算法主要更新和重排,不能夸大成严格删除了所有过时知识。
搜索图标的功能在不同皮肤保持一致,MAGNET检索多个旧搜索图标作为定位示例。但这次购物车里已有2件商品,是会变化的会话事实,不能用稳定功能条目替代。
| 项目 | 本文实际范围 |
|---|---|
| 记忆来源 | 跨任务流程+UI元素功能视觉记忆 |
| 与本方案相同或不同 | 直接保存功能描述与图标patch并检索,是图标memory最直接同类 |
| 应固定的对照条件 | 你的重心若是本次历史,应测试延迟使用的精确事实与状态变更;仅图标存库加语义RAG已重叠。 |
训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。
贡献是规划流程与视觉功能两类记忆的协同,以及适配不同执行器的注入方式。
| 方法 | 优点 | 局限 | 本文改进 |
|---|---|---|---|
| 仅保存完整任务经验 | 可指导相似任务 | 细节与具体界面绑定 | 抽象带参数流程 |
| 按旧页面元素编号记忆 | 查找直接 | 编号和布局变化后失效 | 功能语义关联多种视觉图块 |
| 固定记忆检索 | 简单稳定 | 容易持续取到旧版本 | 加入近期访问和新旧排序 |
适合重复操作、存在稳定功能结构的应用;完全陌生功能或错误语义描述仍可能误导。
离线测试覆盖 AITZ、GUI-Odyssey、Amex,另构造模板、应用和领域变化划分。在线 AndroidWorld 只使用 Easy 的 61 个任务,且记忆方法预先进行了三轮执行以初始化,不能把结果标成完整 116 题的无探索评测。
相同 Qwen2.5-VL-32B 下,在线成功率 42.62%,Agent-S 为 40.98%、AppAgent 为 34.43%。离线 Amex 单步成功率从无记忆 COAT 的 59.68% 到 62.84%,定位从 67.69% 到 71.53%。先用 Amex 记忆再逐轮适配 AndroidWorld 时,成功率 31.14%→40.98%。
两个记忆模块都有消融支持,但分布变化下流程记忆也出现小幅退化,并非所有设置都获益。没有完整延迟和成本分析;额外图块、检索与双模型调用可能增加每步耗时。
本轮未在原文确认独立代码仓库,附录给出构建提示及算法。复现先建立“任务簇→抽象流程”和“功能描述→视觉实例”两张表,再分别接到规划与定位输入。
需要固定任务聚类阈值、检索 N/K、模板匹配方法、附近图标数和访问计数初值;这些数值并非全部在正文明确报告。存储来源应用与版本,分别记录预探索、构图和正式评测成本。无需新增参数训练学习率,但生成记忆要调用模型。
迁移到桌面或网页可以沿用功能与流程分层。用于 GUI 加速时,可研究在可信流程内减少规划调用;原文每步仍有观察与定位,没有验证滚动后的视觉编码复用。
核心思想:分别记住操作流程和功能外观。
速记版 pipeline:从成功操作整理流程与图标 → 根据任务检索流程 → 根据功能检索视觉示例 → 执行并更新常用记忆。
来源与核查:原始摘要 · 论文正文;已核章节:§2.1–2.3、§3主结果与变化测试、附录C.1在线61题、附录E算法与F提示。未读取实现源码。
你的重心若是本次历史,应测试延迟使用的精确事实与状态变更;仅图标存库加语义RAG已重叠。
不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。
原文图示与图题。下面直接引用作者图像;解释以上文为准。

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。
| Methods | AITZ / SR (%) | AITZ / Grd. (%) | GUI-Odyssey / SR (%) | GUI-Odyssey / Grd. (%) | Amex / SR (%) | Amex / Grd. (%) |
|---|---|---|---|---|---|---|
| Specialized Models (Parameter-tuned) | ||||||
| Atlas-Pro-7B | 66.64 | 62.18 | 58.82 | 67.00 | 67.45 | 67.78 |
| GUI-R1-7B | 44.22 | 57.21 | 47.70 | 59.20 | 49.36 | 59.42 |
| UI-Venus-Navi-7B | 60.27 | 70.23 | 65.93 | 74.52 | 63.58 | 79.67 |
| InfiGUI-R1-3B | 49.49 | 55.34 | 55.51 | 64.98 | 62.00 | 69.98 |
| Agentic Frameworks (Training-free / Inference-only) | ||||||
| COAT (Qwen2.5-VL-32B) | 41.09 | 39.28 | 48.13 | 49.38 | 59.68 | 67.69 |
| Agent-S † (Qwen2.5-VL-32B) | 42.98 | 42.87 | 49.21 | 50.74 | 58.29 | 69.85 |
| MAGNET † (Qwen2.5-VL-32B) | 43.50 | 43.78 | 50.16 | 51.91 | 62.84 | 71.53 |
| MAGNET † (Gemini-2.5-Pro) | 52.77 | 57.35 | 49.74 | 57.31 | 62.23 | 75.54 |
| Method | SR (%) |
|---|---|
| M3A ( Rawles et al., 2024 ) | 32.78 |
| AppAgent ( Zhang et al., 2025 ) | 34.43 |
| Agent-S ( Agashe et al., 2024 ) | 40.98 |
| MAGNET (Ours) | 42.62 |
| Variants / Stat. | Variants / Proc. | GUI-Odyssey / SR | GUI-Odyssey / Grd. | Amex / SR | Amex / Grd. |
|---|---|---|---|---|---|
| 48.13 | 49.38 | 59.68 | 67.69 | ||
| \checkmark | 48.62 | 49.98 | 60.20 | 68.57 | |
| \checkmark | 49.72 | 51.28 | 62.34 | 70.86 | |
| \checkmark | \checkmark | 50.16 | 51.91 | 62.84 | 71.53 |
| Variants / Stat. | Variants / Proc. | GUI-Odyssey / SR | GUI-Odyssey / Grd. | Amex / SR | Amex / Grd. |
|---|---|---|---|---|---|
| 48.92 | 55.95 | 60.35 | 73.34 | ||
| \checkmark | 49.35 | 56.55 | 60.52 | 73.60 | |
| \checkmark | 49.65 | 57.18 | 62.11 | 75.40 | |
| \checkmark | \checkmark | 49.74 | 57.31 | 62.23 | 75.54 |
| Backbones / Planner | Backbones / Actor | Avg. Performance / \Delta SR (%) | Avg. Performance / \Delta Grd. (%) |
|---|---|---|---|
| Homogeneous Configurations | |||
| QwenVL | QwenVL | +2.5 | +3.6 |
| Gemini | Gemini | +1.5 | +2.3 |
| Heterogeneous Configurations | |||
| GPT-4o | OS-Atlas | +1.5 | +1.5 |
| QwenVL | OS-Atlas | +4.2 | +3.4 |
| Gemini | OS-Atlas | +1.7 | +2.6 |
| Average | Average | +2.3 | +2.7 |
| Iteration | SR (%) | Proc {}_{\text{Amex}} (%) | Stat {}_{\text{Amex}} (%) |
|---|---|---|---|
| MAGNET | 31.14 | 100 | 100 |
| 1 iteration | 37.70 | 38 | 27 |
| 2 iterations | 39.34 | 32 | 24 |
| 3 iterations | 40.98 | 26 | 18 |
| Dataset | Subset | Episodes | Screens |
|---|---|---|---|
| AITZ | source | 1,998 | 13,919 |
| AITZ | in-domain | 506 | 4,724 |
| Odyssey | source | 4,635 | 71,803 |
| Odyssey | in-domain | 309 | 4,920 |
| Odyssey | template-shifted | 311 | 4,386 |
| Amex | source | 1,794 | 22,639 |
| Amex | in-domain | 448 | 5,563 |
| Amex | app-shifted | 487 | 8,035 |
| Amex | domain-shifted | 259 | 2,472 |
| Backbones | Backbones | MAG. | AITZ | AITZ | GUI-Odyssey | GUI-Odyssey | Amex | Amex |
|---|---|---|---|---|---|---|---|---|
| Planner | Actor | MAG. | SR (%) | Grd. (%) | SR (%) | Grd. (%) | SR (%) | Grd. (%) |
| Standard End-to-End Baselines | ||||||||
| Qwen2.5-VL-32B | Qwen2.5-VL-32B | - | 40.62 | 38.71 | 47.54 | 48.86 | 59.02 | 66.93 |
| Gemini-2.5-Pro | Gemini-2.5-Pro | - | 50.14 | 53.21 | 48.27 | 55.18 | 59.76 | 72.68 |
| Paired Backbone Ablation: Base vs. + MAGNET (Ours) | ||||||||
| GPT-4o | Atlas-Base-7B | \times | 36.92 | 36.54 | 33.84 | 35.30 | 42.17 | 50.16 |
| GPT-4o | Atlas-Base-7B | ✓ | 38.38 | 38.55 | 36.20 | 37.64 | 42.80 | 50.32 |
| GPT-4o | Gemini-2.5-Pro | \times | 42.48 | 41.94 | 38.22 | 39.15 | 46.21 | 54.08 |
| GPT-4o | Gemini-2.5-Pro | ✓ | 43.71 | 42.87 | 40.54 | 41.28 | 46.71 | 54.82 |
| GPT-4o | Qwen2.5-VL-32B | \times | 34.37 | 34.29 | 32.04 | 33.10 | 39.48 | 47.26 |
| GPT-4o | Qwen2.5-VL-32B | ✓ | 36.15 | 35.82 | 34.29 | 34.64 | 41.72 | 49.28 |
| Qwen2.5-VL-32B | Atlas-Base-7B | \times | 43.64 | 41.53 | 49.93 | 51.58 | 53.92 | 70.59 |
| Qwen2.5-VL-32B | Atlas-Base-7B | ✓ | 45.73 | 46.51 | 52.07 | 54.91 | 62.37 | 72.57 |
| Qwen2.5-VL-32B | Qwen2.5-VL-32B | \times | 41.09 | 39.28 | 48.13 | 49.38 | 59.68 | 67.69 |
| Qwen2.5-VL-32B | Qwen2.5-VL-32B | ✓ | 43.50 | 43.78 | 50.16 | 51.91 | 62.84 | 71.53 |
| Gemini-2.5-Pro | Atlas-Base-7B | \times | 45.31 | 48.48 | 44.54 | 52.10 | 56.31 | 69.42 |
| Gemini-2.5-Pro | Atlas-Base-7B | ✓ | 47.44 | 53.03 | 45.40 | 53.67 | 58.32 | 71.04 |
| Gemini-2.5-Pro | Gemini-2.5-Pro | \times | 50.87 | 53.88 | 48.92 | 55.95 | 60.35 | 73.34 |
| Gemini-2.5-Pro | Gemini-2.5-Pro | ✓ | 52.77 | 57.35 | 49.74 | 57.31 | 62.23 | 75.54 |
Open this note in the interactive notebook (comments, hooks) → · All notes