AdaMM combines source-linked analytic tables with hierarchical visual retrieval so an agent can aggregate records as well as find similar experiences.
Questions involving ranking, counting, filtering, or temporal comparison may require complete sets of records rather than one semantically similar memory.
The system learns recurring table schemas from observed attributes and combines analytic access with event, episode, and topic retrieval.
Each interaction yields attributes, values, and provenance; recurring co-occurring attributes induce typed schemas, while unobserved values remain missing.
A parallel visual memory organizes individual events, temporally coherent episodes, and topics with descriptions, embeddings, and timestamps.
A planner sees relevant metadata and executes tools such as Lookup, Filter, Compute, Rank, SemanticMatch, and EventLocate sequentially, filling later parameters from actual earlier results.

With GPT-5.4-mini and a reported ten-evidence-unit, three-planning-step budget, AdaMM scores 65.5 on MemEye multiple-choice exact match and 60.7 on open-answer judgment, versus 61.8 and 49.4 for MM-RAG.
Removing analytic memory lowers the reported overall MemEye ablation score by 4.6 points and removing visual retrieval by 7.5; matching evidence counts does not imply matching latency or token cost.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · P0 · 可追溯视觉观察与结构化查询。核查日期:2026-09-07。
中文转述。AdaMM认为长期多模态记忆不仅要找到相似经历,还要能对许多记录做筛选、排序、计数和时间比较。它把带来源的图文观察归成可查询表格,同时保留层级视觉检索记忆;规划器按问题组合两类访问工具。2026-07-31公开,是当前方案的近邻。
如果问题是“最近哪次订单金额最高”,取回最相似的一张截图并不能保证找全候选或正确比较。自由文本摘要可能遗漏数字;把所有图直接交给VLM又昂贵。作者把确定性的查询计算与开放式图文证据检索分开。

作者图注与上下文。原图用于定位所述流程,下面的演示例子均另外标明。
每轮从对话、图片和上下文元数据提取观察,记录属性、取值以及来源p。比如一张订单页可产生“订单号、日期、金额”等信息,并能追溯这条观察来自哪次交互。来源标记让抽取结果有底稿,但不能自动保证OCR或模型读数正确。
系统统计哪些属性经常共同出现,用支持度与共同出现的置信度发现schema;已有schema可在新字段稳定出现后扩展。通过这些字段和样例推断表名、描述、列类型,按交互轮次写行,另外记录order/time;没观察到的值留空,不随意补全。
自拟例子:第3、8、15步分别出现“商品、价格、库存”,反复共现后形成商品观察表。第8步没有库存时是缺值,不能等同库存为0;第3步价格也不能直接当第15步的现价。
event保存单次交互细节,episode聚合时间相邻且语义连贯的事件,topic连接主题。各层保留简短描述、文字/视觉表示和时间。它承认并非所有经历都能变成规整表,视觉外观也可能不适合仅以固定字段表示。
规划上下文只展示和问题相关的表/episode元数据及工具。分析工具含Lookup、Filter、Compute、Rank;检索工具含SemanticMatch、EventLocate。模型先列信息目标和工具,再依据前一工具结果填下一工具参数。最终答案模型读取实际工具输出。它不是把全套工具参数一次猜完,也不是让模型在没有来源的摘要上自由算数。
使用GPT-4.1-nano或GPT-5.4-mini作为记忆构建和回答底座,MiniLM-L6-v2与SigLIP2构建文字/图像表示。实验把取证预算设为10个证据单元,规划最多3步。证据数相同仍不等于推理调用、输入token或延迟完全相同;附录D专门分析成本。
表3,GPT-5.4-mini:MemEye多选EM,MM-RAG61.8、UniversalRAG62.4、AdaMM65.5;开放问答裁判分分别49.4、48.6、60.7。MemGallery裁判分MM-RAG78.7、AdaMM83.9。11.3是MemEye开放判分百分点增幅,不是所有任务或GUI执行的提升。
表2中MemEye记742 QA,是371问题对应多选/开放两个版本;不能与MemEye原文371说成样本数矛盾。MemGallery含240会话、3962轮、1003图像、1711问答,需按该论文所用版本引用。
MemEye上去分析记忆整体降4.6个百分点,在需要记录比较的Health类别降14.9;去视觉检索整体降7.5。去相关元数据规划上下文、一次性实例化工具参数也下降,说明结构与工具编排共同起作用。附录A给层级记忆构建,B给工具schema,C实现,D成本,E案例,F提示。
不能只宣称“历史状态结构化、保存来源、按问题调用工具”是新贡献,AdaMM已有完整实现和相近消融。GUI方向的独立问题是状态变化如何影响下一动作、历史区域如何与当前可操作对象绑定,以及少量原图是否比高质量结构化抽取更划算。建议加入“结构事件表+简单检索”对照,防止视觉RAG看似有用只是因为纯文字基线写得太弱。
原文完整表格附件保留本版本可抽取的正文及附录表;正文解释关键比较,不把异构数据集或不同模型拼为统一排行榜。
原论文:章节、图注与来源 / Original paper。章节包括:1 Introduction;2 Related Work;3 Method;3.1 Problem Formulation;3.2 Overview;3.3 Analytic Memory Construction;3.3.1 Attribute Extraction;3.3.2 Schema Induction;3.3.3 Memory Materialization;3.4 Retrieval Memory Construction;3.5 Adaptive Query Processing;3.5.1 Memory Access Tools;3.5.2 Memory-Aware Joint Query Planning;4 Experimental Evaluation;4.1 Experimental Setup;4.2 Main Results;4.3 Ablation Study;5 Conclusion;Limitations;References;Appendix A Hierarchical Retrieval Memory Construction;Appendix B Memory Access Tool Specifications;Appendix C Implementation Details;Appendix D Cost Analysis;Appendix E Case Study。
Open this note in the interactive notebook (comments, hooks) → · All notes