VERA compresses interaction history into visual canvases that retain native image evidence while keeping the execution model fixed.
Turning multimodal history into text summaries can remove visual evidence, while changing the policy at the same time obscures the effect of the memory representation.
The paper isolates runtime history representation under a shared agent protocol and compares visual canvases with full history, reset, sliding windows, and text summaries.
When context management is triggered, the program lays out historical text with order, role, and tool information and preserves images, crops, or charts as visual content.
Recent interactions retain more detail, while older canvases can be rendered at lower resolution to fit the context budget.
The method does not train a memory model or require query-specific retrieval; its reviewed v2 experiments use a shared Hermes-agent framework and Gemini-3.5-flash-thinking policy.

In v2 Table 2, VERA scores 31.7% on BrowseComp-V3 and 28.5% on MM-BrowseComp, compared with 24.0% and 21.0% for text summaries, averaging three independent runs.
Reported token totals count uncached input and output across calls; they exclude cached reads and are not direct dollar-cost or latency measurements, and the evaluated tasks are search and data analysis rather than GUI execution.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原文:When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents。核查版本:v2,2026-09-01;核查日期:2026-09-07。优先级P0,属于多模态历史表示;实验不是GUI在线操作。以下是中文转述,例子标明为自拟,不是全文翻译。
作者研究长任务的上下文压缩:旧历史既有文字,也可能有图片、局部放大图和图表。把一切变成文字摘要可能遗漏视觉细节。VERA在需要压缩时把历史整理成视觉画布,并保留原本就是图像的证据,让固定VLM继续使用。方法不训练记忆模型,重点是用相同执行模型和运行协议比较不同历史表示。
需要分开三个问题:存哪些历史、用什么形式表示、由谁决定读取。旧方法改变这些因素时往往也换模型或训练策略,很难判断收益来自哪里。VERA先固定执行端,单独研究“文字摘要”和“保留原生视觉内容”有何差别。它还区分保留历史的压缩与直接清空历史;重新开始有时能增加独立尝试机会,不能把清空带来的收益都解释为记忆更好。
对本课题的关系:它已经明确提出原始图片不能总被文字替代,但没有解决GUI中“同一个按钮属于哪个对象、哪次状态更新才有效”的完整问题。

图源:原文§3图1。图中的搜索、裁剪与分析工具是论文场景,不要把它们读成YOLO或GUI点击器。
输入是当前动作之前已经发生的历史与预算。处理器生成较小的历史表示,再交给原执行模型。它不是修改模型的KV缓存,也不是把旧图的视觉编码直接缓存给下一轮。被整理后的视觉记忆仍需要模型读取。
程序保留交互的先后、角色和工具信息,将文字排版到画布。历史里的检索图片、裁剪图、放大结果以及表格图表可以作为视觉材料保留下来,而不是只留下对它们的描述。对于结构化表格,可保留其视觉结构并去掉重复的平铺文字。这样仍能知道一个证据来自哪次交互。
自拟例子:历史中找到一张包含三个近似标志的图片,又裁出其中一个。普通摘要可能只说“找到目标标志”;VERA可以保留对应图片和裁剪结果,让后续模型再次辨认。它不是根据“目标标志”向量查询后取回top-k图片,而是按预定的历史整理规则形成画布。
近期交互保留更多原始内容;较旧内容可以降低呈现分辨率。降低清晰度和彻底删除不是一回事。旧画布保留范围、分辨率和最近保留范围共同决定预算,不能把它写成无限增长历史在固定像素里仍无损。
环境返回新观察 → 上下文达到管理条件 → 确定需要整理的旧历史 → 程序生成画布并保留原始视觉证据 → 固定VLM读取新上下文继续行动。没有额外训练出的读写策略,也不要求执行模型先发一个检索工具调用。
实验使用共同的Hermes-agent运行框架与Gemini-3.5-flash-thinking策略模型,128K上下文设定、64K管理触发点;这些属于该实验配置,不是VERA只能这样运行。方法本身无需SFT或RL,主要变化发生在运行时历史整理。每种设定做三次独立运行后取平均,不是三次挑最好的一次。
正文比较四个文字搜索任务、两个多模态搜索任务及一个数据分析任务。基线包括完整历史、清空、滑动窗口与摘要。
准确率反映对应搜索问答是否成功;数据分析使用官方评估分数。成本指标是所有调用累计的未缓存输入token与输出token,再按评估轨迹平均,包含失败轨迹。它不等于所有实际处理token,也不是美元价格:缓存读取部分未算在这个指标中。不能据此声称相同比例的实际API费用或端到端时间下降。
原文表2的代表结果,搜索为准确率%,数据分析为分数;括号为累计未缓存token:
| 历史方式 | BrowseComp-V3 | MM-BrowseComp(表中名称) | 数据分析 |
|---|---|---|---|
| 完整历史 | 27.3(2.61M) | 23.3(3.74M) | 0.38(510K) |
| 文字摘要 | 24.0(1.66M) | 21.0(2.39M) | 0.37(419K) |
| VERA | 31.7(1.22M) | 28.5(1.38M) | 0.41(406K) |
表2支持这些场景下保留视觉材料有价值,但没有与GUI专用记忆控制器进行直接比较。
表3专门移除原生视觉证据,三个任务的表现均降低;不过BrowseComp-V3保留视觉证据时token从1.12M增加到1.22M,所以不能说这个消融里每个任务都同时省token。
表4给相同近历史增加旧画布后,子集准确率62.9→64.0,平均调用99.8→79.3。附录C改变旧画布清晰度时,中间尺度优于最高尺度;例如0.7/0.8尺度均71.0,1.0尺度64.0。说明“历史越清楚越好”没有得到支持,也不能把该最佳比例直接迁移到GUI小字。
附录A讨论清空与重试的关系;B给协议、超时和成本口径;C/D扩展旧历史清晰度与动作预算;E给提示词。它们不是GUI定位或RAG检索策略的实现说明。
必须对照的已有思想:原生图像证据、文字加图像历史表示、固定执行端下比较历史管理、近旧历史不同清晰度。可直接借用公平实验设计。
与拟议方案的差别是按时间整理的视觉画布,与按当前历史缺口检索的对象/事件证据库之间的差别。仅把画布换成检索还不够构成创新,PAL-UI、MementoGUI及其他视觉记忆方法也需比较。VERA没有证明区域RAG优于整帧,也没有给出GUI对象状态过期的专门解决方案。
Open this note in the interactive notebook (comments, hooks) → · All notes