Field notes / 2026.09.07 / Priority reading
旧页面上的信息,怎样留到后面用?这张图按“保存什么、怎么找、怎么用、怎么验证”整理本轮论文。先看分支解决的问题,再展开到具体论文。
修改观察接口、记忆表示、检索流程或决策模型;同时提供基准的论文仍标出其评测贡献。
把界面内容、动作结果或阶段进展整理为可读文本,由主策略直接使用。
比较动作前后画面记录近期结果,再选择应跨步骤和跨应用保留的文字事实。
观察模型描述页面,记忆模型验证前后状态变化,再把结构化观察和历史交给规划器。
策略同时生成动作与更新摘要,并以该摘要对下一步动作预测的帮助作为训练奖励。
3B 策略在同一次生成中更新语义上下文并输出动作,以短文字承接更早的历史。
从动作前后变化抽象单步结果,再精炼任务上下文,并在任务结束后提炼可复用模式。
显式维护变量、来源、依赖、事实或待做/已做状态,使历史成为可更新的任务记录。
把长任务表示为带分支、循环和变量的程序,按执行位置筛选历史并按步骤 ID 检索记录。
将关键中间事实存成带来源、依赖和状态更新的锚点,并构造长程依赖任务评测。
在可控环境中安排先出现后使用的信息,生成记忆标签并训练模型主动写出关键事实。
同一策略输出 GUI 动作和记忆维护操作,分开管理压缩过程、持久界面事实与近期记录。
把记忆写成工作流和条目执行状态,并对照开启与关闭显式记忆的轨迹训练策略。
辅助模型逐步比较前后截图,更新原始要求、完成进度和动作结果,再注入固定执行器。
保存简短入口和更详细的原记录,再通过步号、证据指针或检索工具恢复所需信息;底稿可为文字、截图或图文消息。
用文字概括历史页面,让策略在需要时按历史步号取回旧截图。
主策略保留简短进度,详细观察写入外部知识文件,需要时调用辅助模型检索或计算。
学习何时写入事件、压缩旧记忆并保留局部图像引用,再按需筛选情景经验供执行器读取。
为长文本分段写提要,原文仍保留,回答时由模型选择需要展开的段落。
语义记忆与不可变原始图文分存,通过证据指针和混合检索逐步回查具体细节。
先将个人视觉经历整理成文字目录并关联视觉来源,之后按具体问题展开相应原图。
从经验中提炼可复用流程,用压缩记忆生成搜索线索,或将重复属性整理成可分析的表格。
分别保存可复用流程与功能—图标实例,在规划和当前界面定位时检索使用。
用摘要链记录本次进度,再从离线成功轨迹提炼的经验库检索可迁移操作指南。
先由压缩记忆产生粗略答案或线索,再用线索检索原始材料支持正式回答。
把重复属性、数值与时间整理成可查询表格,同时保留视觉检索,按问题组合筛选、计算与取证。
采用低分辨率、画布、冗余块删除、浅层信息转移或潜在记忆;不都提供按记录编号回查的接口。
先在浅层将旧图信息融入保留的 token 表征,再删除历史视觉 token,配合一致性训练。
用不同历史长度训练策略,在浅层视觉融合后保留动作表征、删除旧图 token。
按时间远近给旧截图分配分辨率,同时对当前图进行保留空间参照的 token 筛选。
把移出近期窗口的多模态历史分块压成少量连续 token,供当前 GUI 策略读取。
保留窗口首图,后续截图删除与前帧重复的视觉块,并训练动作模型利用这种历史。
在连续 token 记忆中分开学习内容保留、面向当前状态的读出和无关记忆抑制。
将低分辨率旧截图与动作历史持续输入模型,并用视觉重采样降低历史视觉 token 数。
将文字历史排成画布并保留原生图像,在固定执行策略下比较历史表示与预算分配。
补充动作期间的帧流、关键帧或音频,并保存事件描述,处理普通逐步截图未曾采到的内容。
构造短暂信息任务,从动作间视频选择相关画面,再修正动作记录并生成反思反馈。
把连续观察与离散动作解耦,结合关键帧、语音转写和持久文字叙述保留步骤间事件。
用实际前后观察更新进展,或主动取证并检查候选动作,向执行策略反馈问题。
先根据真实前后截图更新阶段进展,再在执行前核查候选动作的视觉落点与任务一致性。
评判代理借助历史摘要和视觉观察判断 GUI 过程;不同版本的回看范围与取证接口需分开理解。
区分完整任务执行、历史信息恢复与机制诊断;问答分数、步骤匹配与在线终态成功率不能混为一个指标。
提供交互轨迹或可执行环境,用于评估跨页面、跨应用及长流程能力。
提供跨应用手机轨迹,并用 history resampler 将旧截图压成较少视觉 token 辅助下一动作。
提供长程、有状态的真实桌面任务,用终态与任务要求检查代理能否完成完整流程。
在真实 Android 应用中初始化任务并验证结果,评估实际交互而非只匹配录制动作。
在真实桌面软件环境中执行开放式任务,并通过执行后的系统状态判断完成情况。
针对延迟依赖、视觉细节、时间更新或历史图像检索构造问题;既有 GUI 任务,也有完整历史上的后置问答。
构造需要跨步骤保留并使用中间信息的手机任务,专门评估 GUI 代理记忆能力。
先存入多条完整任务轨迹,再就历史提问;AgentRunbook-C 用代码代理查档案并把证据交给回答模型。
用需要视觉细节与时间判断的问题,诊断多模态记忆是否只依赖文字或取回过期证据。
评估从个人视觉历史中依据事件、描述与多步线索找到目标图片的能力。
向长程多模态任务注入稍后才用到的偶然线索,并以双路记忆等方法检查历史恢复能力。
拆分探索与执行、分析记忆引发的错误,或在相同 token 预算下检查技能和记忆模块的价值。
让受控网站记录确定性语义状态,把终局成功拆成信息探索、执行与步骤推进。
在 token 预算约束下比较技能与记忆模块,检查额外调用的收益是否抵消其成本。
分析整图经验记忆改善或加重的错误,再用动作相关局部视图、分阶段检索和恢复示例改进。
拟议方案,尚未训练或报告实验结果
同一任务逐步回放:OCR+YOLO 提取每帧元素,独立 3B 补图标描述并写一行定位目录;7B VLM 看当前截图,用 search_history 和 read_frames 查此前帧的文字明细。
明细全存指全部已抽取记录,不等于无损保存截图;OCR 与描述都漏掉的视觉细节,文字工具无法恢复。
最直接相邻:PAL-UI · UI-Copilot · MementoGUI · ReadAgent · M2A · Personal Visual Context Learning。
这是研究导航中的位置,不是声称整套结构首次提出。相邻论文可能共享分层记忆、工具学习或目录回查机制,但任务设置和可访问历史范围不同。
这是为阅读导航整理的主分类,不是论文作者共同认可的正式分类,也不表示各类机制互斥。每篇只计入一个主要分支,跨分支贡献用标签显示。P0 表示阅读优先级,不表示论文质量。 中文详解保留论文版本、原图、结果表和核查边界;复现建议与自拟例子均在笔记中区分。