Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

MemoRAG: Moving towards Next-Gen RAG Via Memory-Inspired Knowledge Discovery

See original paper
Research paper · arXiv:2409.05591

MemoRAG uses compressed global memory to draft retrieval clues, then retrieves source passages for the final answer.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

A question may lack the words needed to retrieve its supporting passages, especially when the answer requires reasoning across a long document.

Contributions

The memory model provides provisional knowledge for query expansion rather than serving as the sole factual source.

The reviewed author version is titled 'Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation'; the reading index retains the earlier title.

Method

Special memory tokens compress a long input into a compact KV representation that can be reused across queries.

At query time, the memory model drafts an answer or clues; these guide retrieval of original passages, which the answer generator reads with the question.

Training includes long-context compression pretraining, supervised query/draft learning, and reinforcement learning from generation feedback; the memory and generation roles need not use different-sized model backbones.

SUP-A02 作者原图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

The reviewed Table 1 reports an average of 40.2 for MemoRAG, compared with 35.0 for full context, 29.7 for BGE retrieval, and 29.4 for GraphRAG across long-context datasets.

This average combines task-specific measures such as F1 and ROUGE; it is neither GUI success rate nor evidence that all compressed details remain recoverable.

详细阅读笔记 · SUP-A02

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · P0 · 小记忆模型引导大模型检索。核查日期:2026-09-07。

0. 摘要

中文转述。MemoRAG让一个能覆盖长材料的记忆模型先产生关于问题的线索,再利用线索检索原文,最后生成答案。当前作者版本题名为“Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation”,发表于WWW 2025;最早题名与本目录保留的旧题名不同,视作同一篇。

1. 方法动机

传统RAG用问题直接检索;如果答案需要跨段推断,问题可能不包含证据关键词。作者认为可先用对整个材料的粗略记忆产生中间答案或检索线索,再找精确证据。粗记忆负责知道大概在哪,不承担所有事实准确性。

2. 方法设计

SUP-A02 作者原图

作者图注与上下文。原图用于定位所述流程,下面的演示例子均另外标明。

原文2.2:先记全局,再用草稿扩大检索线索

长材料进入memory模块,生成可持久保存的压缩状态。查询到达时,模型依据记忆产出草稿答案,抽取其中信息用于检索;被找回的原始段落与问题一起交给答案生成器。自拟例子:问题问“刚才那个蓝色图标对应哪个收藏夹”,问题没有文件夹名字;粗记忆先提示可能与旅行资料有关,再到原记录中找旅行文件夹。草稿可能错,因此不能跳过原文核验。

原文2.3.1:这里的“记忆”主要是模型内部压缩表示

作者在预填充时加入专门的记忆token,把较长输入映射为紧凑KV表示;后续利用这些memory tokens处理查询。它不是把每张图标裁图写入向量数据库,也不是简单冻结一个3B模型输出几十字摘要。压缩率改变能覆盖的材料长度和保留信息量,属于模型设计与训练的一部分。

原文2.3.2:训练记忆模型产生有用检索线索

训练分为长上下文压缩预训练、查询/草稿能力的监督阶段及基于生成反馈的强化训练。重要目标是让粗记忆对检索有帮助。正式查询时不再取得标准答案。最终生成器在体系上可独立,默认实现为参数效率也可以复用记忆模型底座,不能把图中两个角色强行解释为两个不同大小的模型。

3. 输入输出和成本边界

输入是原始长文本与问题;内部产物是压缩记忆、草稿线索、原文候选;输出是答案。记忆构建可以被后续查询复用,但读取材料、训练、检索和最终生成仍有成本。论文主要处理静态知识材料及长上下文问答,未证明GUI动作后状态更新的正确性,也没有元素坐标回映射。

4. 结果如何读

表1跨多个长上下文问答数据集,作者给出的平均值:全文35.0、BGE嵌入检索29.7、GraphRAG29.4、MemoRAG40.2。这些列包含不同任务的F1/Rouge等指标,平均数不是40.2% GUI任务成功率。其论证重点是改进证据发现,不能据此保证缩成摘要后所有视觉细节可恢复。

5. 消融和附录

§3.4比较记忆模块、训练策略、压缩配置,§3.5讨论效率;附录给实现、生成线索案例、数据构建与UltraDomain。读消融时要区分“检索候选改善”和“更强生成器改善”。本轮保存作者原表方便逐行核查,不将图示的长上下文能力当成在线更新性能。

6. 对拟议方案的作用

你提出的小模型摘要→大模型与外部检索,在模块分工上和MemoRAG相近,但你的摘要可以是可读事件表,外部证据可以是原截图。更有价值的问题是:摘要器如何知道哪些历史细节将来重要;能否用证据链接弥补压缩遗漏;检索草稿错误会否形成自证循环。应比较直接问题检索与记忆线索扩展检索,并报告摘要器和查询扩展的额外调用。

7. 来源与核查范围

原文完整表格附件保留本版本可抽取的正文及附录表;正文解释关键比较,不把异构数据集或不同模型拼为统一排行榜。

原论文:章节、图注与来源 / Original paper。章节包括:1. Introduction;2. Method;2.1. Background;2.2. MemoRAG;2.3. Memory Module;2.3.1. Memory Model Design.;2.3.2. Memory Model Training.;3. Experiment;3.1. Dataset;3.2. Baselines;3.3. Main Experiments;3.4. Ablation Study;3.5. Efficiency Analysis;4. Related Work;5. Conclusion;Acknowledgment;References;Appendix A Implementation Details;A.1. Case Study;Appendix B More details of Dataset Construction;Appendix C More details of UltraDomain;Instructions for reporting errors。

Open this note in the interactive notebook (comments, hooks) → · All notes