FocusMem separately learns what latent memory preserves, how it is read for the current state, and whether it should influence the policy.
A single fixed compressed memory can omit useful content, serve different decision stages poorly, and pass irrelevant experience into the policy.
The method factorizes role-aware content learning, state-conditioned readout, and block-level trust filtering.
A shared compressor encodes current-task and retrieved episodic evidence using role-specific queries and content supervision.
A state-conditioned adapter adjusts readout queries, producing different latent views of the same encoded evidence.
A trust module learns from irrelevant-trajectory injections and removes low-confidence memory blocks while the GUI policy and retriever stay frozen.

Across accessible subsets of five web benchmarks with a 15-step budget, mean success is 48.3% versus 33.7% for the matched action-only fixed-memory baseline.
A shopping ablation improves success but increases mean task time from 72.8 s to 109.9 s, so the demonstrated benefit is reliability rather than acceleration.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 优先级 P0 · 复核日期:2026-09-07
与当前研究的关系:内容保真、状态条件读出、信任门三个维度与你的检索选择问题相邻。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。
摘要译文(依据本轮核查原文,CC BY 4.0许可):GUI代理既要记住先前任务的有用经验,也要记住当前交互中尚未完成的进度。潜在记忆通过将多模态轨迹压缩为少量连续token,提供了一种紧凑方案。然而,现有方法通常把每条轨迹映射为一个固定记忆块,并主要用下一动作监督训练。这带来三个实际问题:压缩时可能丢失重要细节,同一个记忆块必须服务于不同决策阶段,而检索到的无关轨迹仍可能误导代理。我们提出FocusMem,在紧凑潜在记忆接口内分离这些职责。感知角色的内容基底鼓励情景记忆保留可复用经验,工作记忆保留任务进度。以状态为条件的读出机制从同一份存储证据中生成针对当前决策的视图,轻量信任门则能抑制看起来与当前步骤无关的记忆块。所有组件均在GUI策略保持冻结时训练。在5个GUI代理基准上,FocusMem持续超过完全匹配的仅动作监督固定记忆基线,以及先前潜在记忆适配方法。进一步分析表明,语义和功能监督保留互补信息;当周围轨迹上下文增长时,状态条件读出更加稳健;信任门减轻了注入无关情景证据造成的损害。结果说明,有效潜在记忆不仅取决于压缩过往交互,还取决于保留什么、呈现什么,以及允许哪些信息发挥作用。
把整条轨迹压成一块固定记忆后,同一表示要同时服务搜索、筛选、确认等不同阶段。只用下一动作监督,压缩器也可能丢掉暂时不影响动作、稍后却需要的进度或约束信息。
过去任务记忆与当前任务历史承担不同职责,相关轨迹也可能在某一步变得无关。作者因此分别回答保留什么、此刻读出什么、这块记忆是否应参与决策,而非单纯增加检索条数或连续 token 数量。
当前任务保留最近3个事件直接可见,过期历史按连续4事件分块;另用固定检索器取3条历史任务轨迹。每个证据项分配8个连续 token,在15步任务上最多两类各3块,总共48 token,未通过门控的块还会被移除。
共享证据编码器与 Q-Former 式压缩器处理两类记忆,角色专属基础查询分别抽取可复用流程和当前进度。语义 KL 让压缩证据保留原始证据支持的语言内容,角色功能伪目标则分别强调程序约束或状态变化。
阶段 A 暂不启用动态查询与信任门,结合示范动作损失及内容监督训练固定记忆。教师分布和功能伪目标由冻结策略产生,梯度只更新记忆路径;主 Qwen3-VL-8B 和 UGround 定位模型始终冻结。
阶段 B 把当前决策状态、证据编码和角色输入轻量适配器,生成基础查询的残差。同一已编码轨迹由此可按当前阶段读出不同连续块;残差输出零初始化,先从阶段 A 学到的固定读出起步。
块级信任模块读取当前状态和动态记忆,判断是否纳入策略注意力。训练注入明确无关的任务轨迹作负例,用可求梯度的硬掩码学习排除;普通检索项不被统一标成正例,其价值通过动作损失学习,负例门控损失不回传修改记忆内容。
推理按验证集选出的0.3阈值删除低信任块,再按两类来源拼到普通决策嵌入之前。检索器固定、候选跨对照一致,动态读出与门控每步有计算开销;存储紧凑不意味着读取免费。
方法依据:原文 3.1–3.4 Method。
同一旧商品页,比较阶段关心价格,退款阶段关心售后政策。FocusMem从同一编码按状态读出;你的显式区域检索应证明更能恢复精确信息并拒绝过时状态。
| 项目 | 本文实际范围 |
|---|---|
| 记忆来源 | 同任务工作证据+跨任务潜在记忆 |
| 与本方案相同或不同 | 内容保真、状态条件读出、信任门三个维度与你的检索选择问题相邻 |
| 应固定的对照条件 | 要固定候选证据与预算,比较有无状态条件读取和信任机制;仅RAG门控不够新。 |
训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。
| 对比对象 | 原有做法与局限 | 本文改变及代价 |
|---|---|---|
| Action-only Fixed | 固定块只用动作监督,所有阶段共用表示 | 增加角色内容监督、条件读出和信任过滤;这是最严格匹配对照 |
| Retrieved Full Trajectory | 原始多模态轨迹占用较大上下文 | 每条压到8 token,但需额外训练记忆路径且有信息瓶颈 |
| Mem-W-style 等潜在记忆 | 在统一框架中复刻,非各原论文完全复现 | FocusMem分开内容、读出和使用决策;跨方案成绩需保留-style条件 |
表1在五个网页基准可访问子集上,以15步上限和 Gemini-3.1-Pro 统一判分,FocusMem 非加权平均成功率48.3%,匹配的 Action-only Fixed 为33.7%,Mem-W-style 为42.5%。五个子集分别308、200、150、598、266题;预先排除验证码阻塞任务,不能称全量公开测试结果。(§4.1–4.2)
MMInA Shopping 消融表2从无记忆到完整方法,成功率41.0%升至59.0%,平均步数9.4降至8.4;但单步从7.72秒增至13.10秒,单任务从72.8秒增至109.9秒。动态读出阶段已经把任务时间从80.1秒推至105.9秒,因此本方法的实测优势是可靠性,不能标成端到端提速。(§4.3)
污染检索诊断中,最多替换3条无关轨迹时,完整门控比无门控高9–11个百分点,块通过率从86%降至35%。这是明显无关负例实验,尚未覆盖更隐蔽的语义冲突或陈旧工作记忆。(§4.6–5)
数据来源:原文 4.1–4.3 Experiments;4.6 Evidence Dependence and Trust;5 Limitation。
作者提供 FocusMem 仓库链接,本轮未核权重与数据发布完整性。监督数据为23,438条8–15步高质量成功轨迹,记忆库、监督轨迹和评估任务通过任务标识、实例及归一化指令模板做去重。
阶段 A/B 学习率分别1e-5和5e-6,全局批量32;每项8 token、历史分块4事件、检索3条是可直接对齐的复现参数。复现建议先保留固定检索候选,依次加内容、读出、门控,避免用不同检索质量解释模块收益。
迁移到手机需重新验证证据编码和读出的时间成本。建议分别计量检索缓存、当前状态编码、动态查询和主策略前向,并评估误删关键约束;本文没有证明跨手机或桌面平台迁移。
核心思想:分开学习记住什么与何时使用
速记流程:收集过去证据→压缩不同角色信息→按当前状态读取→过滤无关记忆→生成操作
来源与核查:原始论文;已读 3.1–3.4 Method、4.1–4.3 Experiments、4.6 Evidence Dependence and Trust、5 Limitation;许可。作者资源:链接。
要固定候选证据与预算,比较有无状态条件读取和信任机制;仅RAG门控不够新。
不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。
原文图示与图题。下面直接引用作者图像;解释以上文为准。

以下保留原表数值、行序与英文方法名称,便于核查;标题与分组行可能在HTML中跨列。各指标含义、测试划分和可比较条件见上面的实验解释,空格不等于0。
| Method | Memory | MMInA | MMInA | DeepShop | WebVoyager | Online- Mind2Web | Overall |
|---|---|---|---|---|---|---|---|
| Method | Memory | Wiki | Shop | DeepShop | WebVoyager | Online- Mind2Web | Overall |
| General VLMs | |||||||
| GLM-4.1V-9B-Thinking | No Memory | 39.9 | 46.5 | 12.0 | 17.2 | 14.3 | 26.0 |
| InternVL3.5-14B | No Memory | 46.1 | 48.0 | 33.3 | 10.9 | 9.4 | 29.5 |
| Qwen3-VL-32B | No Memory | 69.8 | 62.5 | 52.0 | 28.4 | 18.0 | 46.2 |
| Qwen3.6-27B | No Memory | 46.1 | 59.5 | 46.7 | 26.8 | 16.9 | 39.2 |
| GUI Agents | |||||||
| Fara-7B | No Memory | 47.4 | 38.5 | 38.0 | 31.1 | 25.2 | 36.0 |
| Molmo-8B | No Memory | 45.1 | 41.5 | 37.3 | 33.6 | 27.8 | 37.1 |
| UI-TARS-1.5-7B | No Memory | 41.2 | 35.0 | 28.7 | 26.6 | 21.8 | 30.7 |
| UI-Venus-1.5-8B | No Memory | 50.6 | 44.5 | 36.0 | 28.1 | 18.4 | 35.5 |
| Qwen3-VL-8B Memory Study | |||||||
| Qwen3-VL-8B | No Memory | 42.2 | 41.0 | 27.3 | 19.6 | 12.4 | 28.5 |
| ReasoningBank | Text Memory | 47.4 | 44.5 | 30.0 | 22.6 | 13.9 | 31.7 |
| Retrieved Full Trajectory | Raw MM | 45.1 | 45.5 | 36.7 | 24.2 | 14.3 | 33.2 |
| CoMEM-style [ 28 ] | Episodic latent | 49.0 | 47.5 | 34.7 | 27.4 | 18.0 | 35.3 |
| HyMEM-style [ 37 ] | Hybrid | 52.9 | 47.0 | 38.0 | 30.3 | 20.7 | 37.8 |
| Mem-W-style [ 34 ] | Dual fixed latent | 60.7 | 54.5 | 40.7 | 33.1 | 23.3 | 42.5 |
| FocusMem-Base (Action-only Fixed) | Dual fixed latent | 54.5 | 45.5 | 30.7 | 22.6 | 15.0 | 33.7 |
| FocusMem | Factorized latent | 65.3 | 59.0 | 48.7 | 39.6 | 28.9 | 48.3 |
| Setting / No Memory | SR \uparrow / 41.0 | Steps \downarrow / 9.4 | Hit-Max \downarrow / 31.0 | T/Task(s) / 72.8 | T/Step(s) / 7.72 |
|---|---|---|---|---|---|
| \hookrightarrow + Fixed | 45.5 | 9.0 | 28.5 | 79.5 | 8.82 |
| \hookrightarrow + Content | 50.5 | 9.0 | 29.0 | 80.1 | 8.93 |
| \hookrightarrow + Readout | 54.5 | 8.5 | 25.5 | 105.9 | 12.41 |
| \hookrightarrow + Gate | 59.0 | 8.4 | 24.0 | 109.9 | 13.10 |
| Compression backbone | Module | Structure | Trainable parameters |
|---|---|---|---|
| Qwen3-VL-8B H=4096 | LoRA | r=64,\ \alpha=16,\ p=0.05 ; 36 text blocks, targeting {q,k,v,o,\mathrm{gate},\mathrm{up},\mathrm{down}} projections (252 linear modules) | 174,587,904 (174.59M) |
| Q-Former | K=8 , 16 heads ( d_{h}=256 ), eight shared refinement steps, 4H FFN, H{\rightarrow}H input/output projections, two role vectors, and H{\rightarrow}256{\rightarrow}8H dynamic-query adapter | 234,995,712 core + 9,478,400 adapter = 244,474,112 (244.47M) |
| Software | Version |
|---|---|
| Operating system | Ubuntu 22.04 LTS (Linux kernel 5.15.0-25-generic) |
| NVIDIA driver | 580.105.08 |
| CUDA Driver API | 13.0 |
| PyTorch | 2.12.1+cu130 |
| Transformers | 4.57.3 |
| vLLM | 0.21.0 |
| Accelerate | 1.13.0 |
| Component | Configuration |
|---|---|
| CPU | 2 \times Intel Xeon Gold 6530 |
| CPU cores | 32 cores / 64 threads per socket; 64 physical cores / 128 logical threads in total |
| CPU frequency | up to 4.0 GHz |
| CPU cache | L1d 3 MiB, L1i 2 MiB, L2 128 MiB, L3 320 MiB |
| NUMA | 4 NUMA nodes, each with \sim 252 GiB memory and 32 logical CPUs |
| GPU | 8 \times NVIDIA RTX PRO 6000 Blackwell Server Edition |
| GPU memory | 96 GB per card (nominal); 97,887 MiB visible per card ( \sim 95.6 GiB) |
| Total GPU memory | 768 GB (nominal); \sim 764.7 GiB visible |
| GPU power cap | 600 W per card |
| GPU interface | PCIe 5.0 \times 16 per card |
| GPU interconnect | GPU–GPU communication through PCIe/CPU NUMA |
| GPU P2P | P2P read/write supported on all GPU pairs; native atomic P2P not supported |
| System memory | 1 TiB RAM; \sim 1007.5 GiB detected |
| Swap | 68 GiB |
| Hyperparameter | Setting |
|---|---|
| Optimizer | AdamW |
| Learning-rate schedule | Cosine annealing with warmup ratio 0.1 |
| Stage A learning rate | 1\times 10^{-5} |
| Stage B learning rate | 5\times 10^{-6} |
| Global batch size | 32 |
| \lambda_{\mathrm{sem}} / \lambda_{\mathrm{func}} | 0.5 / 0.5 |
| \lambda_{\mathrm{basis}} | 0.25 |
| \lambda_{m} | 0.05 |
| Trust threshold \gamma | 0.3 |
| Gradient clipping | Max norm 1.0 |
| Numerical precision | bfloat16 |
| Distributed training | DDP |
Open this note in the interactive notebook (comments, hooks) → · All notes