AGMem replaces indiscriminate full-screen experience with action-related crops, subtask retrieval, and recovery examples.
Retrieved screenshots may improve state understanding yet introduce irrelevant layouts that worsen grounding and hidden-operation errors.
The study defines a failure taxonomy and develops action-grounded visual memory in response to the observed error shifts.
Past screenshot transitions yield change regions, expanded to suitable interface containers and stored with actions and subtask descriptions.
Instruction-based retrieval first selects a trajectory pool, then current subtask and visual context select relevant memory steps.
An error detector can redirect retrieval toward a separate recovery library before executing a proposed action.

On the paper's 316-task OSWorld setting, GPT-5.4-mini improves from 20.4% with full-screen memory to 27.2% with AGMem.
Error labels overlap and use different units across datasets; a 50-task WebForge subset shows no corresponding success improvement.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 优先级 P0 · 复核日期:2026-09-07
与当前研究的关系:AGMem证明整图记忆会增加定位错误,局部证据+上下文要配合。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。
摘要译文,依据本轮缓存的 arXiv 摘要页;原文采用 CC BY 4.0 许可。以下保留作者摘要中的表述,相对提升的基线见第4节。
图形用户界面(GUI)代理越来越多地被用于跨应用、网站和操作系统自动完成复杂计算机任务。为了提高可靠性,近期工作引入了经验记忆,让代理检索过去轨迹,以指导相似状态下的决策。更新的方法进一步将这一思路扩展到视觉记忆,通过保存和检索过去交互的截图,为代理提供比纯文本记忆更丰富的上下文。然而,视觉记忆对 GUI 代理的影响仍缺乏充分理解:尚不清楚它缓解哪些失败,又加重哪些失败。
为系统分析视觉记忆的影响,我们引入四类 GUI 代理失败:认知失败、视觉状态误解、隐藏操作盲区和定位错误,分别对应感知—推理—动作流程的不同阶段。我们发现,在输入前添加整图记忆,会对失败分布产生分化影响:它减少状态层面的失败,却加重动作层面的失败,并增加隐藏操作盲区和定位错误。
受这一发现启发,我们提出面向 GUI 代理的动作关联视觉记忆框架 AGMem。其核心思想是保存与成功动作或恢复过程密切相关的局部 GUI 图像裁剪,而不是完整截图。OSWorld 实验表明,相较整图记忆,AGMem 将任务成功率提高33.3%。结果说明 AGMem 是一种有效的视觉记忆表示。
过去截图能提示某个菜单或对话框如何使用,但整屏往往包含大量与当前目标无关的窗口和控件。模型可能借此理解大致页面,却被旧布局或不相关目标干扰,尤其在寻找隐藏入口和精确点击时出现副作用。
作者认为记忆应围绕“某步操作在哪里产生效果”组织,并根据当前子任务缩小检索范围。正常成功示例还不足以帮助处于错误状态的代理,因此进一步区分常规动作记忆和从错误恢复的示例。
先进行失败模式诊断。 使用四类多标签分类,只有轨迹直接提供证据时才分配标签。OSWorld 和 WebForge 按任务标注,AgentNetBench 按动作标注;坐标错误要求模型意图本来正确,否则归为认知或状态理解问题。标签由基于 Codex 的模型评审产生。
从真实前后画面提取动作局部视图。 计算相邻截图像素差,减去局部平滑背景,以宽松和严格阈值形成掩码,再用形态学开闭运算去噪与连接区域。取变化区域包围框,交给 UI 解析器寻找能包住它的最小窗口/面板/对话框;没有合适容器保留原框,完全无变化则回退到整屏。保存的是后截图中的相关区域。
用成功轨迹构建结构化记忆。 从 AgentNet 保留正确、非冗余轨迹,由模型事后标注实际完成的子任务,并按这些标签切分。记忆原子包含子任务说明、执行动作及局部视图,而非一张无上下文图片。
先缩小轨迹池再选步骤。 新任务在执行前仅依据指令拆为子任务。Sentence-Transformer 检索贪心选择能覆盖这些子任务的轨迹池;每步策略自报当前子任务,再用 CLIP 文本与图像表征各 0.5 的固定权重,从池中选择 5 个相关记忆步骤加入提示。
避免读取尚未发生的未来画面。 当前动作尚未执行,无法获取它的后截图;在线检索以最近一次已发生转移的局部视图作为视觉查询,首步使用初始整屏。主策略仍能看到当前完整截图,裁剪主要用于记忆与查询,并非跳过当前屏幕感知。
在错误状态改用恢复示例。 每次执行候选动作前,LLM 检测器读取近期截图、动作和候选,判断是否已处于错误状态及其类型。触发时阻止原候选,转向从“错误片段后来被纠正”的 AgentNet 数据构建的恢复库,提供对应纠正行为后再决策。
一个红色按钮裁得只剩图标,会失去所属商品;整图又混入许多干扰。AGMem按动作变化保相关容器,为你选择证据粒度提供直接对照。
| 项目 | 本文实际范围 |
|---|---|
| 记忆来源 | 跨任务动作局部视觉经验和恢复 |
| 与本方案相同或不同 | AGMem证明整图记忆会增加定位错误,局部证据+上下文要配合 |
| 应固定的对照条件 | 必须比较整图、图标裁图、动作区域、图标+周围文本;测试裁太小丢上下文。 |
训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。
| 对比对象 | 记忆表示与使用 | AGMem 的变化及代价 |
|---|---|---|
| 无记忆代理 | 依靠当前状态与短历史 | 增加可复用动作和恢复证据 |
| 整屏视觉记忆 | 检索完整历史截图 | 减少无关像素,但依赖裁剪正确性 |
| 仅裁剪消融 | 局部图像仍全库检索 | 先用子任务缩小候选,避免无关局部图 |
| 只保存成功轨迹 | 错误状态也检索正常操作 | 单独保存恢复路径,增加检测和检索模块 |
| 当前截图 token 剪枝 | 压缩当前观察 | 本文重点压缩外部记忆,优化位置不同 |
方法将失败诊断、局部记忆与恢复控制串联。局部区域是由已发生变化得到,不是能够在动作前保证识别全部关键区域的预测器。
GPT-5.4-mini 在论文的 316 个 OSWorld 任务、通常 50 步上限设置中,普通代理为 18.3%,全图记忆为 20.4%,仅裁剪为 25.8%,AGMem 为 27.2%。相对全图记忆增加 6.8 个百分点,约相对提升 33.3%;相对普通代理增加 8.9 个百分点。论文表2–3
表2的多标签错误统计显示,全图记忆使隐藏操作错误从 67.1% 升到 78.8%,AGMem 为 52.5%;坐标错误分别为 27.5%、36.1%、22.5%。这些是可重叠的错误类别统计,不能相加成总体失败率,也不能与 AgentNet 的按动作标注直接合并。
AgentNetBench 步骤准确率从全图记忆的 28.1% 提升到 28.8%,里程碑准确率从 33.8% 到 34.6%。但 50 任务 WebForge 子集的三种方法均为 2.0%,因此正文“跨所有基准大幅提升”的概括超过表格证据;结论部分的 9.1 个百分点也与主表算出的 8.9 不一致,本文采用主表。
作者强调单独裁剪不足以控制全部错误。分析上,实验主要依赖一个主模型及模型错误标注,缺乏逐模块完整耗时;原文提及 token 效率但所读结果没有给出可核的对应量化表。像素差计算、解析器、检索和每步恢复检测均有成本,不能由局部图片较小直接推出整任务更快。
本轮从原文未确认官方代码或记忆数据发布链接;不据此断言未开源。可依据原论文先复现四种记忆设置,保存每张裁剪图及其来源动作,人工抽样检查变化框是否被动画、光标或无关弹窗主导。
已报告的配置包括文本/图像权重各 0.5、返回 5 个步骤和 1920×1080 OSWorld 视口。复现前还需核实像素阈值、UI 解析器、轨迹池大小及编码器检查点,并严格隔离记忆来源和评测数据。建议单列恢复检测开销、误拦截率、每任务时间和不同失败类别的人工一致性,才能判断收益来自哪一环。
核心思想:只取动作相关画面作为记忆。
速记流程:从前后变化裁图 → 按子任务缩小检索 → 提供相关动作示例 → 出错时检索恢复方式
来源与核查:原论文,已读§2–5及附录B;本轮未确认官方实现链接。
必须比较整图、图标裁图、动作区域、图标+周围文本;测试裁太小丢上下文。
不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。
原文图示与图题。下面直接引用作者图像;解释以上文为准。

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。
| Failure mode | Description |
|---|---|
| Cognitive failure | The model misunderstands the task goal, current subtask, required next step, success condition, or recovery strategy (e.g., following the wrong plan step, assuming a failed action succeeded, or terminating too early). |
| Visual state misunderstanding | The model misreads the visible screen state (e.g., believing a dialog or dropdown is open when it is not, misidentifying the selected object, or incorrectly inferring that a sort order). |
| Hidden operation blindness | The correct action requires an operation not directly visible until another UI action reveals it (e.g., opening a menu, context menu, or overflow menu; using a keyboard shortcut; performing a non-obvious selection). |
| Grounding error | The model intends the correct visible target and predicts a compatible action type, but the executed coordinate or low-level action misses the target. |
| Method | Overall | Failure Mode (Root Cause %) | Failure Mode (Root Cause %) | Failure Mode (Root Cause %) | Failure Mode (Root Cause %) |
|---|---|---|---|---|---|
| Method | Acc. (%) | Cognitive | Visual Mis. | Hidden Op. | Grounding |
| Vanilla Agent | 18.3 | 82.6 | 73.1 | 67.1 | 27.5 |
| 00 + Visual Memory | 20.4 | 75.0 | 69.6 | 78.8 | 36.1 |
| 0000 + Crop | 25.8 | 72.4 | 68.3 | 60.3 | 32.1 |
| AGMem (Ours) | 27.2 | 67.1 | 32.3 | 52.5 | 22.5 |
| Method | OSWorld | WebForge | AgentNet | AgentNet |
|---|---|---|---|---|
| Method | Acc. | Acc. | Acc. | M. Acc. |
| Vanilla agent | 18.3 | 2.0 | 25.8 | 24.2 |
| + visual memory | 20.4 | 2.0 | 28.1 | 33.8 |
| AGMem (Ours) | 27.2 | 2.0 | 28.8 | 34.6 |
Open this note in the interactive notebook (comments, hooks) → · All notes