Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

See original paper
Research paper · arXiv:2605.15128

MemEye tests whether memory systems recover genuinely visual details and reason about relationships and evolving states rather than relying only on image descriptions.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

A nominally multimodal memory question may be answerable from captions, and retrieving a relevant old image may still produce a stale-state answer.

Contributions

The benchmark crosses visual granularity with reasoning demands and includes 371 questions, 221 sessions, 848 dialogue turns, and 438 images.

Method

Question construction checks text-only and caption shortcuts and verifies solvability with supporting visual evidence; these checks establish necessity relative to tested descriptions and models rather than to every possible caption.

The evaluation compares thirteen memory configurations with four readers, supplying both multiple-choice and open-answer versions.

Multiple-choice evaluation rotates answer positions, while separate evidence-oracle analysis helps distinguish retrieval failure from reasoning failure after correct evidence is available.

原文图3:视觉细节与记忆推理二维分类
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

With GPT-5.4-mini, visual SRAG reports 0.6177 overall multiple-choice exact match and 0.4937 open-answer judgment; these are different measures, not GUI success rates.

Even with relevant evidence supplied, reported open-answer scores fall from 0.673 for extraction to 0.601 for relational reasoning and 0.558 for evolution reasoning, showing that correct retrieval alone does not resolve state reasoning.

详细阅读笔记 · SUP-R03

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原文:MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory,v1,2026-05-14。核查日期2026-09-07。P0:历史视觉证据与时间更新的诊断基准。中文转述;不是新GUI执行器。

0. 摘要

很多所谓多模态记忆题,用图片的文字描述就能回答。MemEye筛选确实需要原图细节的问题,同时区分找回一个事实、连接多次经历、随新证据更新旧认知。实验表明保存和检索图片有帮助,但找回相似旧图仍可能忽略后来状态变化。

1. 方法动机

如果问“图中有没有狗”,一条摘要就可能足够;如果问“之前出现的那只狗的项圈是哪种花纹”,摘要未必保留。作者还强调,找对一张图与理解变化过程不同:旧状态出现三次、新状态只出现一次,不能按多数证据判定现在是什么。

因此,本研究不能再把“设计文字不能答的历史题”和“检索会混淆过期状态”本身声称为新的发现。MemEye已有明确问题定义与案例;GUI实验需要证明这些问题如何影响实际动作。

2. 方法设计

原文图3:视觉细节与记忆推理二维分类

图源:原文§3图3。横轴从场景、区域、实例到像素细节,纵轴从单事实提取、关系连接到状态演变推理。

原文3.1:先确定问题究竟难在哪里

例如认出以前的一把钥匙,需要实例级细节;回答物品后来搬去了哪里,需要结合不同时间的观察。两个维度交叉,避免只用“历史很长”描述困难。

原文3.2:删掉能被文字替代轻松回答的题

作者建立多轮多会话视觉经历,构造问题及支持证据。筛查会检查:只给问题与文字线索能否回答;只给简略图像描述能否回答;给真正相关原图和上下文时是否可解。能靠文字捷径答对的题需要修改或剔除,连充分证据都答不了的题也不适合用来单独评价记忆。

后续还用更密集的图像描述测试视觉必要性。这种筛选不是数学证明“任何描述都不可能回答”,而是相对于选定描述和模型的诊断。拟议GUI基准也需要报告用什么摘要器检查了泄漏。

原文4:让多种记忆系统处理相同历史与问题

文字系统先得到图像描述,视觉系统可以保存并返回图片;比较完整历史、简单RAG以及不同专用记忆系统。问题同时提供多选和开放回答版本。多选轮换四种选项位置,减少固定选项偏好。

这不是让系统真正点击、滚动或完成应用任务;成功标准是历史问题答对。论文不训练一个叫MemEye的GUI模型。

3. 模型与训练边界

采用Qwen3-VL-8B、GPT-4.1-nano、GPT-5.4-mini、Gemini-2.5-flash-lite四个读者,比较13种记忆方式,包括文字与视觉完整历史、SRAG、Reflexion、A-Mem、MIRIX、MMA、M2A等。检索配置尽可能标准化,例如适用时top-k=10,但不同开源系统有不同模块,不能说它隔离了每个编码器因素。

MemEye贡献主要是评估体系、数据与诊断;不能把受测方法已有的训练全部说成MemEye训练。给定真实支持证据的oracle是分析上限,正常测试不能获得这些标签。

4. 数据与指标

数据含371个问题、221个会话、848轮对话和438张图片,覆盖8类生活场景。多选报告四种排列平均的精确匹配率;开放题主要用模型判分,BLEU-1作辅助。小规模72条人工核对得到较高一致性,不代表裁判没有误差。

这里没有GUI端到端任务成功率,也没有证明某记忆系统更快。论文里的检索top-k不是公平成本的完整定义;实际图像尺寸、文本量、调用次数仍需额外记录。

5. 结果、附录与具体失败

GPT-5.4-mini的代表性诊断值,开放题分数范围0–1:

条件/任务格 文字方法代表 视觉方法代表 含义
实例细节+单事实 A-Mem 0.4459 SRAG(V) 0.6554 原图能恢复部分描述遗漏
像素细节+单事实 最好文字方法0.3889 SRAG(V)/MMA 0.6389 细节有独立价值
直接给相关证据:单事实→关系→演变 0.673→0.601→0.558 找对图之后仍可能不会推理

来源:正文§4及附录分格结果。不同格难度与题数不同,不能把差值直接解读为同一组题增加模块的消融收益。SRAG(V)总体多选EM为0.6177,开放判分0.4937,也不能混为同一种指标。

附录图12的标签更新例子:较早三张图为C-1127,后来一张改为A-209。检索结果中旧值更多,频次投票会错;应知道新图更晚。这里保留原文标识符便于核查,不是自拟样本。

附录还给出物品从工作台搬到冷藏区的例子、特定牌数变化之后询问另一名玩家手牌的例子。需要完整的变化证据链,只召回一张看起来相关的画面不够。图15则说明某些变化用好的文字状态提取已经能答对,视觉检索系统反而因取错图失败。这反驳了“多存图一定优于文字”的简单论断。

附录包括详细模型与提示、各维度结果、人工核验、可被文字替代的检查,以及检索错/读图错/状态推理错的案例。建议优先读§3、§4和图12–15。

6. 对拟议课题的作用

最值得借用的是三类错误分解:没有保存关键状态、没有召回正确时间的证据、已经召回却推理错误。GUI主实验还应增加“历史理解正确但当前控件定位错误”,这样不会把所有失败怪给memory。

创新需要落到可验证的GUI决策机制,例如用同一当前页面、不同先前状态构造行动差异,并在固定成本下修复证据链遗漏。不过历史视觉必要性、时间更新、旧证据干扰均已有先例;新增任务必须比较这些已有测试,而不是重新命名相同维度。

Open this note in the interactive notebook (comments, hooks) → · All notes