Thinking LineMingshuo Wang · research notebook

Field notes / 2026.09.07 / Priority reading

GUI 历史记忆研究分类树

旧页面上的信息,怎样留到后面用?这张图按“保存什么、怎么找、怎么用、怎么验证”整理本轮论文。先看分支解决的问题,再展开到具体论文。

45篇 P0 阅读笔记
10研究分支
33 / 12方法 / 评测与分析
下载分类图 ↗

GUI 历史与记忆WHAT TO KEEP · FIND · USE · TEST

01 · METHODS · 33 PAPERS怎样保存、找到并使用历史

修改观察接口、记忆表示、检索流程或决策模型;同时提供基准的论文仍标出其评测贡献。

  • 页面与过程摘要5 篇把旧页面和已发生的事写成什么文字?

    把界面内容、动作结果或阶段进展整理为可读文本,由主策略直接使用。

    • P032 · 方法Chain-of-Memory

      比较动作前后画面记录近期结果,再选择应跨步骤和跨应用保留的文字事实。

      同任务 · 动作结果 · 文字事实 · 记忆写入训练
    • P070 · 方法MGA

      观察模型描述页面,记忆模型验证前后状态变化,再把结构化观察和历史交给规划器。

      同任务 · 观察描述 · 动作验证 · 模型分工
    • P071 · 方法GUI-Rise

      策略同时生成动作与更新摘要,并以该摘要对下一步动作预测的帮助作为训练奖励。

      同任务 · 递归摘要 · 下游效用训练 · SFT+RL
    • Y26-067 · 方法SecAgent

      3B 策略在同一次生成中更新语义上下文并输出动作,以短文字承接更早的历史。

      同任务 · 3B · 语义上下文 · 动作与记忆联合训练
    • Y26-164 · 方法HiSA

      从动作前后变化抽象单步结果,再精炼任务上下文,并在任务结束后提炼可复用模式。

      动作差分 ROI · 模型分工 · 分层摘要 · 跨任务经验
  • 结构化任务状态6 篇什么值属于谁,哪些步骤已经完成?

    显式维护变量、来源、依赖、事实或待做/已做状态,使历史成为可更新的任务记录。

    • Y26-026 · 方法AgentProg

      把长任务表示为带分支、循环和变量的程序,按执行位置筛选历史并按步骤 ID 检索记录。

      同任务 · 执行树 · 显式变量 · 步骤 ID 检索
    • Y26-076 · 基准+方法AndroTMem / ASM

      将关键中间事实存成带来源、依赖和状态更新的锚点,并构造长程依赖任务评测。

      同任务 · 来源与依赖 · 状态锚点 · 失效更新 · 延迟依赖评测
    • Y26-124 · 训练方法+环境STAMP

      在可控环境中安排先出现后使用的信息,生成记忆标签并训练模型主动写出关键事实。

      同任务 · 显式文字记忆 · 延迟依赖 · 合成监督 · SFT+RL
    • Y26-146 · 方法+数据MemGUI-Agent

      同一策略输出 GUI 动作和记忆维护操作,分开管理压缩过程、持久界面事实与近期记录。

      同任务 · 事实与过程分存 · 记忆增删改 · 主动上下文管理
    • Y26-155 · 方法+基准ATMem

      把记忆写成工作流和条目执行状态,并对照开启与关闭显式记忆的轨迹训练策略。

      同任务 · 条目 ID · 待做/已做/跳过 · 记忆干预训练
    • SUP-M05 · 方法Task-State Representation

      辅助模型逐步比较前后截图,更新原始要求、完成进度和动作结果,再注入固定执行器。

      同任务 · 目标与进度 · 前后截图验证 · 辅助模型
  • 目录与底稿分存,按需回查6 篇● 当前方案所在分支 / Our current direction概括不够时,能否找到原来的细节?

    保存简短入口和更详细的原记录,再通过步号、证据指针或检索工具恢复所需信息;底稿可为文字、截图或图文消息。

    • P052 · 方法PAL-UI

      用文字概括历史页面,让策略在需要时按历史步号取回旧截图。

      同任务 · 历史摘要 · 步号回查 · 原始截图 · 工具学习
    • Y26-090 · 方法UI-Copilot

      主策略保留简短进度,详细观察写入外部知识文件,需要时调用辅助模型检索或计算。

      同任务 · 短摘要+外存细节 · 按需工具 · 检索与计算 · 工具学习
    • Y26-113 · 方法MementoGUI

      学习何时写入事件、压缩旧记忆并保留局部图像引用,再按需筛选情景经验供执行器读取。

      同任务工作记忆 · 跨任务经验 · 局部截图 · 事件门控 · 读写控制器训练
    • SUP-A01 · 方法ReadAgent

      为长文本分段写提要,原文仍保留,回答时由模型选择需要展开的段落。

      文本长上下文 · 提要目录 · 按需展开 · 含网页 HTML 实验
    • SUP-A27 · 方法+数据M2A

      语义记忆与不可变原始图文分存,通过证据指针和混合检索逐步回查具体细节。

      长期个性化对话 · 语义层+原始图文 · 证据指针 · 混合检索
    • SUP-R02 · 方法+评测Personal Visual Context Learning

      先将个人视觉经历整理成文字目录并关联视觉来源,之后按具体问题展开相应原图。

      个人视觉经历 · 未来问题未知 · 文字目录 · 按需原图 · 更新与撤回
  • 经验、检索线索与分析查询4 篇如何从历史提炼知识,或组合查询多个记录?

    从经验中提炼可复用流程,用压缩记忆生成搜索线索,或将重复属性整理成可分析的表格。

    • Y26-040 · 方法MAGNET

      分别保存可复用流程与功能—图标实例,在规划和当前界面定位时检索使用。

      跨任务经验 · 图标图块 · 功能语义 · 知识更新
    • Y26-062 · 方法

      用摘要链记录本次进度,再从离线成功轨迹提炼的经验库检索可迁移操作指南。

      同任务摘要 · 跨任务经验 · 双层记忆 · 检索
    • SUP-A02 · 方法MemoRAG

      先由压缩记忆产生粗略答案或线索,再用线索检索原始材料支持正式回答。

      文本记忆 · 检索线索 · 小模型分工 · 原文 RAG
    • SUP-A30 · 方法AdaMM

      把重复属性、数值与时间整理成可查询表格,同时保留视觉检索,按问题组合筛选、计算与取证。

      多模态历史 · 来源可追溯 · 表格查询 · 层级视觉检索
  • 保留视觉历史并控制成本8 篇旧画面怎样以更少像素或 token 进入模型?

    采用低分辨率、画布、冗余块删除、浅层信息转移或潜在记忆;不都提供按记录编号回查的接口。

    • P035 · 方法SimpAgent

      先在浅层将旧图信息融入保留的 token 表征,再删除历史视觉 token,配合一致性训练。

      历史视觉 · 浅层压缩 · 一致性训练 · 非可读摘要
    • Y26-025 · 方法HiconAgent

      用不同历史长度训练策略,在浅层视觉融合后保留动作表征、删除旧图 token。

      历史视觉 · 动作锚点 · 浅层压缩 · 策略训练
    • Y26-058 · 方法GUIPruner

      按时间远近给旧截图分配分辨率,同时对当前图进行保留空间参照的 token 筛选。

      历史降分辨率 · 当前图剪枝 · 空间结构 · 效率
    • Y26-105 · 方法Mem-W

      把移出近期窗口的多模态历史分块压成少量连续 token,供当前 GUI 策略读取。

      同任务 · 潜在记忆 · 软 token · 记忆训练
    • Y26-107 · 方法ReVision

      保留窗口首图,后续截图删除与前帧重复的视觉块,并训练动作模型利用这种历史。

      重复 UI · 相邻帧 · 视觉块选择 · 策略微调
    • Y26-170 · 方法FocusMem

      在连续 token 记忆中分开学习内容保留、面向当前状态的读出和无关记忆抑制。

      同任务工作记忆 · 跨任务经验 · 潜在记忆 · 状态条件读出 · 信任门
    • SUP-P18 · 方法+数据UI-Hawk

      将低分辨率旧截图与动作历史持续输入模型,并用视觉重采样降低历史视觉 token 数。

      手机 · 固定窗口历史 · 低分辨率截图 · 视觉重采样
    • SUP-R01 · 方法+对照分析VERA

      将文字历史排成画布并保留原生图像,在固定执行策略下比较历史表示与预算分配。

      多模态历史 · 视觉画布 · 原生图像证据 · 固定策略比较 · 非 GUI 在线任务
  • 动作间观察与短暂事件2 篇两次截图之间消失的信息怎样被记下来?

    补充动作期间的帧流、关键帧或音频,并保存事件描述,处理普通逐步截图未曾采到的内容。

    • Y26-097 · 基准+方法DynamicGUIBench / DynamicUI

      构造短暂信息任务,从动作间视频选择相关画面,再修正动作记录并生成反思反馈。

      短暂事件 · 视频挑帧 · 历史修正 · 动态任务评测
    • Y26-152 · 方法+基准AOI

      把连续观察与离散动作解耦,结合关键帧、语音转写和持久文字叙述保留步骤间事件。

      连续观察 · 关键帧 · 音频 · 持久视觉叙述 · 动态任务评测
  • 历史核验与动作反馈2 篇刚才真的成功了吗,下一步会点错吗?

    用实际前后观察更新进展,或主动取证并检查候选动作,向执行策略反馈问题。

    • Y26-133 · 方法HiViG

      先根据真实前后截图更新阶段进展,再在执行前核查候选动作的视觉落点与任务一致性。

      同任务 · 宏观进展 · 坐标核验 · 批评器训练
    • SUP-A19 · 方法GUI-PRA

      评判代理借助历史摘要和视觉观察判断 GUI 过程;不同版本的回看范围与取证接口需分开理解。

      过程评判 · 历史摘要 · 主动视觉取证 · 版本差异

02 · EVALUATION · 12 PAPERS怎样知道历史真的有用

区分完整任务执行、历史信息恢复与机制诊断;问答分数、步骤匹配与在线终态成功率不能混为一个指标。

  • 长程 GUI 数据与任务环境4 篇在哪些手机、桌面或跨应用任务上测?

    提供交互轨迹或可执行环境,用于评估跨页面、跨应用及长流程能力。

    • P001 · 数据集+方法GUIOdyssey / OdysseyAgent

      提供跨应用手机轨迹,并用 history resampler 将旧截图压成较少视觉 token 辅助下一动作。

      手机 · 跨应用 · 历史视觉重采样 · 离线轨迹
    • Y26-153 · 基准OSWorld 2.0

      提供长程、有状态的真实桌面任务,用终态与任务要求检查代理能否完成完整流程。

      桌面 · 长程 · 有状态任务 · 真实软件
    • SUP-A12 · 基准AndroidWorld

      在真实 Android 应用中初始化任务并验证结果,评估实际交互而非只匹配录制动作。

      Android · 在线执行 · 真实应用 · 可验证任务
    • SUP-A13 · 基准OSWorld

      在真实桌面软件环境中执行开放式任务,并通过执行后的系统状态判断完成情况。

      桌面 · 在线执行 · 真实应用 · 终态验证
  • 记忆能力与历史检索评测5 篇过去出现过的信息,后来还能找对吗?

    针对延迟依赖、视觉细节、时间更新或历史图像检索构造问题;既有 GUI 任务,也有完整历史上的后置问答。

    • Y26-046 · 基准MemGUI-Bench

      构造需要跨步骤保留并使用中间信息的手机任务,专门评估 GUI 代理记忆能力。

      手机 · 长程记忆 · 动态环境 · 任务执行
    • SUP-A04 · 基准+方法LongMemEval-V2 / AgentRunbook-C

      先存入多条完整任务轨迹,再就历史提问;AgentRunbook-C 用代码代理查档案并把证据交给回答模型。

      完整轨迹后置问答 · 网页历史 · 文件与脚本检索 · 多模态证据 · 非动作重执行
    • SUP-R03 · 基准MemEye

      用需要视觉细节与时间判断的问题,诊断多模态记忆是否只依赖文字或取回过期证据。

      视觉记忆 · 文字替代检查 · 时间更新 · 过期证据
    • SUP-R05 · 基准+方法分析DeepImageSearch

      评估从个人视觉历史中依据事件、描述与多步线索找到目标图片的能力。

      个人图像历史 · 上下文图像检索 · 事件锚点 · 多步查询
    • SUP-R06 · 基准+方法DMV-Bench / DualMem

      向长程多模态任务注入稍后才用到的偶然线索,并以双路记忆等方法检查历史恢复能力。

      偶然视觉线索 · 延迟需求 · 视觉与文字双路 · 历史回访
  • 过程、失败类型与预算审计3 篇失败在哪里,收益是否值得额外成本?

    拆分探索与执行、分析记忆引发的错误,或在相同 token 预算下检查技能和记忆模块的价值。

Our current direction

我们的位置:目录与底稿分存,按需回查

拟议方案,尚未训练或报告实验结果

同一任务逐步回放:OCR+YOLO 提取每帧元素,独立 3B 补图标描述并写一行定位目录;7B VLM 看当前截图,用 search_history 和 read_frames 查此前帧的文字明细。

明细全存指全部已抽取记录,不等于无损保存截图;OCR 与描述都漏掉的视觉细节,文字工具无法恢复。

最直接相邻:PAL-UI · UI-Copilot · MementoGUI · ReadAgent · M2A · Personal Visual Context Learning

这是研究导航中的位置,不是声称整套结构首次提出。相邻论文可能共享分层记忆、工具学习或目录回查机制,但任务设置和可访问历史范围不同。

这是为阅读导航整理的主分类,不是论文作者共同认可的正式分类,也不表示各类机制互斥。每篇只计入一个主要分支,跨分支贡献用标签显示。P0 表示阅读优先级,不表示论文质量。 中文详解保留论文版本、原图、结果表和核查边界;复现建议与自拟例子均在笔记中区分。

← GUI agents · All research notes