Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

A Human-Inspired Reading Agent with Gist Memory of Very Long Contexts (ReadAgent)

See original paper
Research paper · arXiv:2402.09727

ReadAgent keeps numbered gists as a compact overview and lets a language model reopen selected source pages before answering.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Full context is expensive, while summaries alone may omit details needed by a later question.

Contributions

The paper combines gist memory with interactive source look-up and also tests the approach for webpage action prediction.

Method

A prompted model divides text into pages and summarizes each page while the original remains available outside the active context.

The parallel variant selects several pages at once; the sequential variant opens pages iteratively, replacing their gists with source text before answering.

The webpage variant segments the current page's DOM into subtrees, summarizes those HTML fragments, and reopens selected fragments to predict an element and action; it does not retrieve historical screenshot crops.

Evaluation

With PaLM 2-L on QuALITY, full context scores 85.83%, gist-only 77.52%, and sequential look-up with a six-page limit 87.17%.

On Mind2Web, parallel look-up scores 29.2/31.1/33.4% step success across task/website/domain splits, versus 19.2/18.2/20.9% for raw HTML; these are offline action-matching results, and reported context compression is not equivalent to end-to-end savings.

详细阅读笔记 · SUP-A01

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · P0 · 摘要加按需原文回查。核查日期:2026-09-07。

0. 摘要

中文摘要转述。ReadAgent先把长材料分段,为各段保存简短的gist和编号;回答问题时,模型先看这些提要,再主动取回必要原文。它不是把摘要当成完整证据,而是让摘要充当可回查目录。论文还在附录E把这一方式用于网页下一步动作预测。

1. 方法动机

只读全文会遇到上下文长度和成本限制;只读摘要则会丢细节。普通向量检索又可能因问题和证据用词不同而漏掉相关段落。作者希望模型先获得全局线索,再决定需要重读哪里。这里已经包含“保留短摘要+需要时回原始记录”的核心结构,不能把这两步在GUI中组合本身当作首次提出。

2. 方法设计

原文3.1:先分页,再保存带编号的提要

一般文本先给段落编号,由LLM在长度约束内找自然分界;每页单独生成gist,保留页码,最后顺序拼接。原文页仍在外部,gist不是不可逆地替换存储。网页版本不同:利用DOM树按目标深度切子树,实验在5–7层中选取,不让LLM重新判断分页。

自拟例子:历史材料第12段记“看过三款背包”,完整段落还含三款颜色和价格。gist可以只写“比较背包候选”;这足以让后续“选刚才那款蓝色的”定位到第12段,但不能直接支持具体价格答案。

原文3.2:由模型选择回查页,恢复原文细节

ReadAgent-P一次选择若干页并行取回;ReadAgent-S逐次看一页,直到模型认为足够或到达回查上限。取回后用原文替换相应位置的gist,其余页仍保持简短。最后模型读这个混合上下文回答。没有按页训练一个新检索网络。

原文附录E:网页任务也已经试过

网页执行输入是任务、此前动作历史和各HTML片段的gist。模型选要看的原始HTML片段,再预测元素ID、click/type/select及输入值。它回看的是当前网页的HTML内容,不是此前截图里的图标裁剪;但“摘要定位线索→回取细节→行动”已进入网页代理实验。

例如“按最低价选商品”先从“商品列表”gist选中对应子树,再读价格和控件ID。若只留“此页有商品”,具体目标无法恢复;论文表10的gist-only低成绩正说明这个问题。

3. 模型与训练

主要实验用PaLM 2-L,通过提示进行分页、摘要、回查和回答;ReadAgent本身不做SFT/RL。MindAct对照有经过网页监督训练的RankLM,比较时必须说明。代理调用数随回查策略增加,不能因主回答上下文变短就称所有计算都减少。

4. 实验与关键结果

QuALITY表1:全文准确率85.83,gist-only77.52;ReadAgent-P回查1–4页86.86,压缩率67.73%;ReadAgent-S上限6页87.17,压缩率58.53%。此压缩率衡量所报告上下文长度,不是端到端token或延迟同比下降。

附录E表10,同为PaLM 2-L的Mind2Web结果:

输入方式 跨任务Step SR 跨网站Step SR 跨领域Step SR
原始HTML 19.2 18.2 20.9
gist-only 9.5 8.4 11.7
向量检索Top-5 22.6 22.3 26.9
ReadAgent-P回查1–5片段 29.2 31.1 33.4

这是离线下一步动作匹配。表中的episode SR由轨迹步骤匹配计算,不能写成在真实浏览器自由运行的成功率。部分全文输入发生截断,也影响比较。

5. 消融、成本与附录

§3.3把分页和gist生成计入多问题总输入量后,回查1页约节省25.4%,回查上限5页约节省13.8%;这远小于仅看最终上下文的压缩率。它说明摘要的前期成本可以被多次查询摊薄,但单任务每步不断追加新截图时必须重新测量。

附录E给网页切分、提示、Mind2Web结果和上下文截断比例;F给提示,G讨论策略变体,H比较MemWalker。网页数据不是专门设计的历史视觉必要性测试。

6. 对拟议方案的作用

必须做一个ReadAgent式基线:对同一历史段落或截图生成相同预算的gist,模型按编号取回原始截图;与拟议的元素级检索保持相同主模型和总预算。可以研究GUI中“回查哪一帧、哪一块、何时停止、证据是否仍有效”的联合策略,但摘要+回查两层结构已有明确先例。

7. 来源与核查范围

原文完整表格附件保留本版本可抽取的正文及附录表;正文解释关键比较,不把异构数据集或不同模型拼为统一排行榜。

原论文:章节、图注与来源 / Original paper。章节包括:1 Introduction;2 Related Work;3 ReadAgent;3.1 Gist Memory;3.2 Interactive Look-Up and Response;3.3 Computational Trade-offs and Scalability;3.4 ReadAgent Variants;4 Experiments;4.1 LLM Raters;4.2 Baseline Methods;4.3 Long-Context Reading Comprehension;4.3.1 QuALITY;4.3.2 NarrativeQA;4.3.3 QMSum;4.4 Ablation Study and Analysis;5 Conclusion;Impact Statement;Acknowledgements;References;Appendix A Author Contributions;Appendix B Evaluation with GPT-3.5;Appendix C Pagination Hyperparameters;Appendix D Case Study;Appendix E ReadAgent for Web Navigation;E.1 Implementation。

Open this note in the interactive notebook (comments, hooks) → · All notes