Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

Naive Visual Memory is Not Enough: A Failure-Mode Study of GUI Agents

See original paper
Research paper · arXiv:2606.14106

AGMem replaces indiscriminate full-screen experience with action-related crops, subtask retrieval, and recovery examples.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Retrieved screenshots may improve state understanding yet introduce irrelevant layouts that worsen grounding and hidden-operation errors.

Contributions

The study defines a failure taxonomy and develops action-grounded visual memory in response to the observed error shifts.

Method

Past screenshot transitions yield change regions, expanded to suitable interface containers and stored with actions and subtask descriptions.

Instruction-based retrieval first selects a trajectory pool, then current subtask and visual context select relevant memory steps.

An error detector can redirect retrieval toward a separate recovery library before executing a proposed action.

作者方法图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

On the paper's 316-task OSWorld setting, GPT-5.4-mini improves from 20.4% with full-screen memory to 27.2% with AGMem.

Error labels overlap and use different units across datasets; a 50-task WebForge subset shows no corresponding success improvement.

详细阅读笔记 · Y26-137

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 优先级 P0 · 复核日期:2026-09-07

与当前研究的关系:AGMem证明整图记忆会增加定位错误,局部证据+上下文要配合。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。

0. 摘要

摘要译文,依据本轮缓存的 arXiv 摘要页;原文采用 CC BY 4.0 许可。以下保留作者摘要中的表述,相对提升的基线见第4节。

图形用户界面(GUI)代理越来越多地被用于跨应用、网站和操作系统自动完成复杂计算机任务。为了提高可靠性,近期工作引入了经验记忆,让代理检索过去轨迹,以指导相似状态下的决策。更新的方法进一步将这一思路扩展到视觉记忆,通过保存和检索过去交互的截图,为代理提供比纯文本记忆更丰富的上下文。然而,视觉记忆对 GUI 代理的影响仍缺乏充分理解:尚不清楚它缓解哪些失败,又加重哪些失败。

为系统分析视觉记忆的影响,我们引入四类 GUI 代理失败:认知失败、视觉状态误解、隐藏操作盲区和定位错误,分别对应感知—推理—动作流程的不同阶段。我们发现,在输入前添加整图记忆,会对失败分布产生分化影响:它减少状态层面的失败,却加重动作层面的失败,并增加隐藏操作盲区和定位错误。

受这一发现启发,我们提出面向 GUI 代理的动作关联视觉记忆框架 AGMem。其核心思想是保存与成功动作或恢复过程密切相关的局部 GUI 图像裁剪,而不是完整截图。OSWorld 实验表明,相较整图记忆,AGMem 将任务成功率提高33.3%。结果说明 AGMem 是一种有效的视觉记忆表示。

1. 方法动机

过去截图能提示某个菜单或对话框如何使用,但整屏往往包含大量与当前目标无关的窗口和控件。模型可能借此理解大致页面,却被旧布局或不相关目标干扰,尤其在寻找隐藏入口和精确点击时出现副作用。

作者认为记忆应围绕“某步操作在哪里产生效果”组织,并根据当前子任务缩小检索范围。正常成功示例还不足以帮助处于错误状态的代理,因此进一步区分常规动作记忆和从错误恢复的示例。

2. 方法设计

§2 Failure Modes of GUI Agents

先进行失败模式诊断。 使用四类多标签分类,只有轨迹直接提供证据时才分配标签。OSWorld 和 WebForge 按任务标注,AgentNetBench 按动作标注;坐标错误要求模型意图本来正确,否则归为认知或状态理解问题。标签由基于 Codex 的模型评审产生。

§3.2 Action-grounded Visual Memory

从真实前后画面提取动作局部视图。 计算相邻截图像素差,减去局部平滑背景,以宽松和严格阈值形成掩码,再用形态学开闭运算去噪与连接区域。取变化区域包围框,交给 UI 解析器寻找能包住它的最小窗口/面板/对话框;没有合适容器保留原框,完全无变化则回退到整屏。保存的是后截图中的相关区域。

§3.2 Memory Structure

用成功轨迹构建结构化记忆。 从 AgentNet 保留正确、非冗余轨迹,由模型事后标注实际完成的子任务,并按这些标签切分。记忆原子包含子任务说明、执行动作及局部视图,而非一张无上下文图片。

§3.3 Two-stage Retrieval

先缩小轨迹池再选步骤。 新任务在执行前仅依据指令拆为子任务。Sentence-Transformer 检索贪心选择能覆盖这些子任务的轨迹池;每步策略自报当前子任务,再用 CLIP 文本与图像表征各 0.5 的固定权重,从池中选择 5 个相关记忆步骤加入提示。

§3.3 在线查询的时间顺序

避免读取尚未发生的未来画面。 当前动作尚未执行,无法获取它的后截图;在线检索以最近一次已发生转移的局部视图作为视觉查询,首步使用初始整屏。主策略仍能看到当前完整截图,裁剪主要用于记忆与查询,并非跳过当前屏幕感知。

§3.3 Recovery-aware Memory

在错误状态改用恢复示例。 每次执行候选动作前,LLM 检测器读取近期截图、动作和候选,判断是否已处于错误状态及其类型。触发时阻止原候选,转向从“错误片段后来被纠正”的 AgentNet 数据构建的恢复库,提供对应纠正行为后再决策。

自拟例子:把记忆在什么时候使用讲清楚

一个红色按钮裁得只剩图标,会失去所属商品;整图又混入许多干扰。AGMem按动作变化保相关容器,为你选择证据粒度提供直接对照。

模型输入、输出与记忆边界

项目 本文实际范围
记忆来源 跨任务动作局部视觉经验和恢复
与本方案相同或不同 AGMem证明整图记忆会增加定位错误,局部证据+上下文要配合
应固定的对照条件 必须比较整图、图标裁图、动作区域、图标+周围文本;测试裁太小丢上下文。

训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。

3. 与其他方法对比

对比对象 记忆表示与使用 AGMem 的变化及代价
无记忆代理 依靠当前状态与短历史 增加可复用动作和恢复证据
整屏视觉记忆 检索完整历史截图 减少无关像素,但依赖裁剪正确性
仅裁剪消融 局部图像仍全库检索 先用子任务缩小候选,避免无关局部图
只保存成功轨迹 错误状态也检索正常操作 单独保存恢复路径,增加检测和检索模块
当前截图 token 剪枝 压缩当前观察 本文重点压缩外部记忆,优化位置不同

方法将失败诊断、局部记忆与恢复控制串联。局部区域是由已发生变化得到,不是能够在动作前保证识别全部关键区域的预测器。

4. 实验表现与优势

GPT-5.4-mini 在论文的 316 个 OSWorld 任务、通常 50 步上限设置中,普通代理为 18.3%,全图记忆为 20.4%,仅裁剪为 25.8%,AGMem 为 27.2%。相对全图记忆增加 6.8 个百分点,约相对提升 33.3%;相对普通代理增加 8.9 个百分点。论文表2–3

表2的多标签错误统计显示,全图记忆使隐藏操作错误从 67.1% 升到 78.8%,AGMem 为 52.5%;坐标错误分别为 27.5%、36.1%、22.5%。这些是可重叠的错误类别统计,不能相加成总体失败率,也不能与 AgentNet 的按动作标注直接合并。

AgentNetBench 步骤准确率从全图记忆的 28.1% 提升到 28.8%,里程碑准确率从 33.8% 到 34.6%。但 50 任务 WebForge 子集的三种方法均为 2.0%,因此正文“跨所有基准大幅提升”的概括超过表格证据;结论部分的 9.1 个百分点也与主表算出的 8.9 不一致,本文采用主表。

作者强调单独裁剪不足以控制全部错误。分析上,实验主要依赖一个主模型及模型错误标注,缺乏逐模块完整耗时;原文提及 token 效率但所读结果没有给出可核的对应量化表。像素差计算、解析器、检索和每步恢复检测均有成本,不能由局部图片较小直接推出整任务更快。

5. 学习与应用

本轮从原文未确认官方代码或记忆数据发布链接;不据此断言未开源。可依据原论文先复现四种记忆设置,保存每张裁剪图及其来源动作,人工抽样检查变化框是否被动画、光标或无关弹窗主导。

已报告的配置包括文本/图像权重各 0.5、返回 5 个步骤和 1920×1080 OSWorld 视口。复现前还需核实像素阈值、UI 解析器、轨迹池大小及编码器检查点,并严格隔离记忆来源和评测数据。建议单列恢复检测开销、误拦截率、每任务时间和不同失败类别的人工一致性,才能判断收益来自哪一环。

6. 总结

核心思想:只取动作相关画面作为记忆。

速记流程:从前后变化裁图 → 按子任务缩小检索 → 提供相关动作示例 → 出错时检索恢复方式

来源与核查:原论文,已读§2–5及附录B;本轮未确认官方实现链接。

对“历史摘要+局部视觉证据回查”的具体启发

必须比较整图、图标裁图、动作区域、图标+周围文本;测试裁太小丢上下文。

不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。

原文方法图

原文图示与图题。下面直接引用作者图像;解释以上文为准。

作者方法图

原表核查附录

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。

原表 1(点击展开)

原表位置

Failure mode Description
Cognitive failure The model misunderstands the task goal, current subtask, required next step, success condition, or recovery strategy (e.g., following the wrong plan step, assuming a failed action succeeded, or terminating too early).
Visual state misunderstanding The model misreads the visible screen state (e.g., believing a dialog or dropdown is open when it is not, misidentifying the selected object, or incorrectly inferring that a sort order).
Hidden operation blindness The correct action requires an operation not directly visible until another UI action reveals it (e.g., opening a menu, context menu, or overflow menu; using a keyboard shortcut; performing a non-obvious selection).
Grounding error The model intends the correct visible target and predicts a compatible action type, but the executed coordinate or low-level action misses the target.
原表 2(点击展开)

原表位置

Method Overall Failure Mode (Root Cause %) Failure Mode (Root Cause %) Failure Mode (Root Cause %) Failure Mode (Root Cause %)
Method Acc. (%) Cognitive Visual Mis. Hidden Op. Grounding
Vanilla Agent 18.3 82.6 73.1 67.1 27.5
00 + Visual Memory 20.4 75.0 69.6 78.8 36.1
0000 + Crop 25.8 72.4 68.3 60.3 32.1
AGMem (Ours) 27.2 67.1 32.3 52.5 22.5
原表 3(点击展开)

原表位置

Method OSWorld WebForge AgentNet AgentNet
Method Acc. Acc. Acc. M. Acc.
Vanilla agent 18.3 2.0 25.8 24.2
+ visual memory 20.4 2.0 28.1 33.8
AGMem (Ours) 27.2 2.0 28.8 34.6

Open this note in the interactive notebook (comments, hooks) → · All notes