DMV-Bench asks agents to revisit products using previously incidental visual cues, while DualMem retrieves through fused image and caption representations.
An agent may later need a visual detail it was not told to memorize, and a generic caption may never have recorded that detail.
The benchmark injects unique color-object cues into 1,000 product images while excluding those cues from environment text, and provides matched browsing histories for memory comparisons.
Agents encode predetermined shopping trajectories without knowing later recall targets; ordinary context is cleared between sessions, leaving the memory store available for later product-revisit tasks.
DualMem stores original images and captions, embeds them with SigLIP-2 and SBERT, and fuses normalized retrieval scores with a reported default visual weight of 0.75.
The top five distinct entries are returned as images plus captions to a navigation VLM; both tested navigation models use Gemini-2.5-Flash captions, and lite baselines are adapted implementations.

In v2, Qwen2.5-VL-7B DualMem reaches 81.2% revisit success at five sessions and 74.6% at fifteen, versus 67.9% and 62.3% for caption memory; success uses the final product URL.
Captions fully record the color-object cue for only 16.5% of products; encoding histories are fixed, so the results do not represent unrestricted closed-loop browsing, and the main tables should not be mixed with smaller ablation sets.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原文:DMV-Bench: Diagnosing Long-Horizon Multimodal Agents’ Visual Memory with Incidental Cue Injection,核查v2,2026-08-31;整理2026-09-07。P0:视觉历史保存与双路检索。中文转述。
代理浏览商品时,后来可能被问“回到刚才带红色帽子的那件商品”。如果当时摘要只写产品用途,帽子细节就丢了。论文构建带独特视觉线索的购物环境,测试多次会话后能否找回商品,并提出DualMem同时存视觉与文字表示,融合检索后把原图与描述送给VLM。
许多评测提前告诉模型记什么,或商品文字已经提供答案,不能检验未被关注的视觉细节是否留下。作者把线索放进图片、从环境文字里去掉,之后才提出回忆要求。
这直接对应用户“概括历史,同时保留图像再RAG”的初始想法。它主要是多会话商品回访,不是单次GUI任务中动作状态的连续更新;两者应分开讨论。

图源:原文图2。上部是评估环境,下部是记忆框架。
环境由10类商品、每类10种风格、每种10个变体形成1000种商品。每件产品图里放一个唯一颜色—物体组合。标题、描述、alt-text、URL等文字只能提供粗粒度商品信息,不出现这些线索。作者扫描13140个环境文字字段检查泄漏。
不是禁止模型的captioner写出所见线索:caption仍可以主动描述图中帽子,只是未必会写。环境文字与模型生成摘要必须区分。附录提到URL含风格词,但不含区分具体商品的线索,这属于明确允许的粗信息。
每个会话执行约22–28步比较购物,开始时不要求记住特殊线索。会话之间清空普通上下文,只有记忆库留下。之后用线索描述要求导航回对应商品,以最终URL判断。
为了公平,不同记忆方法接收同一条预生成浏览轨迹,而不是各自随机浏览后再比较。因此这是有交互回访的评估,但记忆不会反过来改变编码阶段的浏览路线;不能等同自由长任务全流程闭环。
产品图用SigLIP-2编码;Gemini-2.5-Flash写的caption用SBERT编码。原图、caption与表示关联保存。查询也分别得到视觉侧与文字侧表示,各自计算相似度。
两组分数在当前库内归一化,再用视觉权重α和文字权重1−α合并,正文默认α=0.75。取排名最高的5个不同条目,把原图加caption送给VLM,再由VLM生成导航动作。这正是固定top-k的双路视觉RAG,不是一个新训练的摘要器。
编码阶段:页面观察 → caption与视觉/文字向量 → 入库。回访阶段:查询 → 两路检索与融合 → 原图和caption → VLM行动。没有给未来会问哪个商品的提示,写入器不能根据未来答案专门保存线索。
导航模型为Qwen2.5-VL-7B或Gemini-2.5-Flash。两者的caption都由同一个Gemini产生,以隔离摘要器变化,所以Qwen实验并非完全由开源权重组成。方法本身没有训练一个3B记忆模块。
对照的WorldMM-lite、MMA-lite、M2A-lite是作者在同一框架内重实现的机制,不是原项目原样运行。尤其附录表7的M2A-lite注入的是文字片段,原M2A则有原始多模态日志访问。不能据这个表声称完整DualMem击败原M2A的所有视觉能力。
每个回忆探针是一个任务,以结束时商品URL精确匹配计算成功率;按相隔多少会话统计记忆保持曲线。主要链长J为5、10、15,J=50是较小Monte Carlo试验。
不同导航模型在编码阶段看过的商品数不同,探针总数也不同,所以不能把两个模型的同列成绩当完全同样的题。按同一会话链做聚类bootstrap/置换测试,比把每个探针当独立样本更合理。
原文表2,回访成功率%:
| 记忆 | Qwen J=5 | Qwen J=15 | Gemini J=5 | Gemini J=15 |
|---|---|---|---|---|
| Caption | 67.9 | 62.3 | 58.9 | 50.5 |
| M2A-lite | 69.0 | 62.6 | 65.7 | 61.9 |
| DualMem | 81.2 | 74.6 | 82.7 | 71.3 |
原文§5表2。无记忆与只存商品类别的TextOnly为0,但Caption并非0;不能把TextOnly说成强文字摘要基线。
表4在Gemini J=5的较小消融集上,视觉权重0.75为82.0,纯视觉检索79.7,纯文字检索65.1。另组以0.5为基础的注入消融中,图像加caption78.9、只图79.9、只caption72.0。说明双路检索有用,不代表最终同时给图和文字总胜过只图。消融与主表样本集不同,82.0和82.7不是矛盾。
caption只在16.5%的商品上完整写出线索的颜色与物体,支持摘要遗漏问题。附录分别核对环境文字泄漏、图像生成提示、会话例子、各方法适配细节、聚类统计和不同回忆距离。关于库大小的分析是事后统计调整,不能把它说成全部方法硬性同存储字节/同token预算。
J=50时Gemini的DualMem65.1、M2A-lite64.7,作者视为接近;小样本下不能夸大0.4分差异。
“文字摘要不保留偶然视觉线索”“视觉与文字双索引”“加权融合top-k再注入原图”已有直接实证。推荐把DualMem式固定融合做成强基线,而不是把它作为拟议新方法的最终贡献。
可继续研究的是同一GUI任务中的动作相关状态与证据链:过去保存成功了吗、某行的选中状态后来是否改变、哪一帧能支持时间条件。即便如此,也应与MemEye、ASM、AgentRunbook-R比较。当前图输入固定,端到端成本包括caption、建索引、检索及读图,才有清楚的历史模块归因。
Open this note in the interactive notebook (comments, hooks) → · All notes