MemEye tests whether memory systems recover genuinely visual details and reason about relationships and evolving states rather than relying only on image descriptions.
A nominally multimodal memory question may be answerable from captions, and retrieving a relevant old image may still produce a stale-state answer.
The benchmark crosses visual granularity with reasoning demands and includes 371 questions, 221 sessions, 848 dialogue turns, and 438 images.
Question construction checks text-only and caption shortcuts and verifies solvability with supporting visual evidence; these checks establish necessity relative to tested descriptions and models rather than to every possible caption.
The evaluation compares thirteen memory configurations with four readers, supplying both multiple-choice and open-answer versions.
Multiple-choice evaluation rotates answer positions, while separate evidence-oracle analysis helps distinguish retrieval failure from reasoning failure after correct evidence is available.

With GPT-5.4-mini, visual SRAG reports 0.6177 overall multiple-choice exact match and 0.4937 open-answer judgment; these are different measures, not GUI success rates.
Even with relevant evidence supplied, reported open-answer scores fall from 0.673 for extraction to 0.601 for relational reasoning and 0.558 for evolution reasoning, showing that correct retrieval alone does not resolve state reasoning.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原文:MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory,v1,2026-05-14。核查日期2026-09-07。P0:历史视觉证据与时间更新的诊断基准。中文转述;不是新GUI执行器。
很多所谓多模态记忆题,用图片的文字描述就能回答。MemEye筛选确实需要原图细节的问题,同时区分找回一个事实、连接多次经历、随新证据更新旧认知。实验表明保存和检索图片有帮助,但找回相似旧图仍可能忽略后来状态变化。
如果问“图中有没有狗”,一条摘要就可能足够;如果问“之前出现的那只狗的项圈是哪种花纹”,摘要未必保留。作者还强调,找对一张图与理解变化过程不同:旧状态出现三次、新状态只出现一次,不能按多数证据判定现在是什么。
因此,本研究不能再把“设计文字不能答的历史题”和“检索会混淆过期状态”本身声称为新的发现。MemEye已有明确问题定义与案例;GUI实验需要证明这些问题如何影响实际动作。

图源:原文§3图3。横轴从场景、区域、实例到像素细节,纵轴从单事实提取、关系连接到状态演变推理。
例如认出以前的一把钥匙,需要实例级细节;回答物品后来搬去了哪里,需要结合不同时间的观察。两个维度交叉,避免只用“历史很长”描述困难。
作者建立多轮多会话视觉经历,构造问题及支持证据。筛查会检查:只给问题与文字线索能否回答;只给简略图像描述能否回答;给真正相关原图和上下文时是否可解。能靠文字捷径答对的题需要修改或剔除,连充分证据都答不了的题也不适合用来单独评价记忆。
后续还用更密集的图像描述测试视觉必要性。这种筛选不是数学证明“任何描述都不可能回答”,而是相对于选定描述和模型的诊断。拟议GUI基准也需要报告用什么摘要器检查了泄漏。
文字系统先得到图像描述,视觉系统可以保存并返回图片;比较完整历史、简单RAG以及不同专用记忆系统。问题同时提供多选和开放回答版本。多选轮换四种选项位置,减少固定选项偏好。
这不是让系统真正点击、滚动或完成应用任务;成功标准是历史问题答对。论文不训练一个叫MemEye的GUI模型。
采用Qwen3-VL-8B、GPT-4.1-nano、GPT-5.4-mini、Gemini-2.5-flash-lite四个读者,比较13种记忆方式,包括文字与视觉完整历史、SRAG、Reflexion、A-Mem、MIRIX、MMA、M2A等。检索配置尽可能标准化,例如适用时top-k=10,但不同开源系统有不同模块,不能说它隔离了每个编码器因素。
MemEye贡献主要是评估体系、数据与诊断;不能把受测方法已有的训练全部说成MemEye训练。给定真实支持证据的oracle是分析上限,正常测试不能获得这些标签。
数据含371个问题、221个会话、848轮对话和438张图片,覆盖8类生活场景。多选报告四种排列平均的精确匹配率;开放题主要用模型判分,BLEU-1作辅助。小规模72条人工核对得到较高一致性,不代表裁判没有误差。
这里没有GUI端到端任务成功率,也没有证明某记忆系统更快。论文里的检索top-k不是公平成本的完整定义;实际图像尺寸、文本量、调用次数仍需额外记录。
GPT-5.4-mini的代表性诊断值,开放题分数范围0–1:
| 条件/任务格 | 文字方法代表 | 视觉方法代表 | 含义 |
|---|---|---|---|
| 实例细节+单事实 | A-Mem 0.4459 | SRAG(V) 0.6554 | 原图能恢复部分描述遗漏 |
| 像素细节+单事实 | 最好文字方法0.3889 | SRAG(V)/MMA 0.6389 | 细节有独立价值 |
| 直接给相关证据:单事实→关系→演变 | — | 0.673→0.601→0.558 | 找对图之后仍可能不会推理 |
来源:正文§4及附录分格结果。不同格难度与题数不同,不能把差值直接解读为同一组题增加模块的消融收益。SRAG(V)总体多选EM为0.6177,开放判分0.4937,也不能混为同一种指标。
附录图12的标签更新例子:较早三张图为C-1127,后来一张改为A-209。检索结果中旧值更多,频次投票会错;应知道新图更晚。这里保留原文标识符便于核查,不是自拟样本。
附录还给出物品从工作台搬到冷藏区的例子、特定牌数变化之后询问另一名玩家手牌的例子。需要完整的变化证据链,只召回一张看起来相关的画面不够。图15则说明某些变化用好的文字状态提取已经能答对,视觉检索系统反而因取错图失败。这反驳了“多存图一定优于文字”的简单论断。
附录包括详细模型与提示、各维度结果、人工核验、可被文字替代的检查,以及检索错/读图错/状态推理错的案例。建议优先读§3、§4和图12–15。
最值得借用的是三类错误分解:没有保存关键状态、没有召回正确时间的证据、已经召回却推理错误。GUI主实验还应增加“历史理解正确但当前控件定位错误”,这样不会把所有失败怪给memory。
创新需要落到可验证的GUI决策机制,例如用同一当前页面、不同先前状态构造行动差异,并在固定成本下修复证据链遗漏。不过历史视觉必要性、时间更新、旧证据干扰均已有先例;新增任务必须比较这些已有测试,而不是重新命名相同维度。
Open this note in the interactive notebook (comments, hooks) → · All notes