Agentic Context Bank builds a revisable text catalog of personal visual experiences and lets a model open linked visual evidence when a later question requires it.
A model's general knowledge cannot identify a user's particular people or possessions, and text descriptions can omit the visual details needed to distinguish them.
The paper introduces seven personal-context task types and a two-stage context bank that separates history construction from question-conditioned evidence access.
Without seeing future test questions, the bank extracts entries with stable IDs, descriptions, and source frame or video locations; new evidence may confirm, revise, or retract entries.
At query time, the model receives the text catalog, question, and current query image, then either answers directly or requests original visual material by entry ID.
Selected evidence is expanded while other entries remain textual; this is an access workflow over existing models, not a newly trained 3B summarizer.

In v1 Table 2 with Gemma-4-31B, Context Bank scores 83.25% on person identity and 82.52% on object identity, versus 78.00% and 78.75% with text history alone.
For wearer identification, the same model scores 51.97% with the catalog only, 57.29% with all evidence, and 61.60% with on-demand evidence; tool-request behavior varies substantially across reader models.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原文:Personal Visual Context Learning in Large Multimodal Models,v1,2026-05。核查日期2026-09-07。P0邻近机制:多模态历史问答,不是GUI执行。中文转述。
论文讨论模型如何使用用户自己的视觉经历,辨认认识的人、拥有的物品与习惯。作者构建相应基准,并提出Agentic Context Bank:先从历史视频整理带证据链接的文字条目;回答时先展示目录,模型需要视觉细节才请求相关片段。它与“历史摘要+按需读原始视觉材料”直接相近。
通用预训练不能告诉模型某一把钥匙属于谁。把全部旧照片直接放进上下文,也可能引入干扰。文字容易保存明确事实,原图则保留文字没有写出的外观细节,问题在于如何结合二者。
自拟例子:文字记忆记着“用户有一个黑色背包”,后来要认出多个黑包中的哪一个。银色星形挂饰如果没进文字摘要,需要查原图才可能区分。这个例子说明需要原始证据,但不是论文的实验样本。

当前问题和当前图像之外,还有历史视觉片段。模型不能用训练中可能见过的通用知识代替“这个人是谁”的个人证据。测试的是使用给定个人上下文的能力,不是训练出能认识所有人的识别器。
任务覆盖人物身份/关系、物品身份/定位、行为判断/问答,以及综合的第一视角佩戴者识别。视觉历史给出个人线索,当前问题要求利用这些线索。目标检测问题有框评估,其余许多是选择或判断题,不是点击动作成功率。
从历史片段提取人物外观、拥有物、行为等记录,每条有稳定ID、文字描述和原始帧/视频位置。新材料可增加、确认、修订或撤回旧条目。因此“文字事实可更新+证据可回看”已经存在,不能作为本方案首次提出。
这一阶段不看未来测试问题。若构建记忆时偷看答案再专门写入描述,就会降低任务难度;拟议GUI实验也应遵守同样时间边界。
先把文字条目目录、问题和当前查询图给模型。模型可以直接回答,也可以用条目ID要求看某些原始视觉材料。随后提供被选中的证据,其他条目继续保持文字形式,再生成答案。
它并非只按一个向量相似度自动取固定两张,也不是每次把所有历史图放进去。另一方面,文字目录本身仍需读取,工具请求还会增加调用。不可只算最后送入了几张图就断言总成本更低。
Context Bank主要是构建与访问流程;论文比较多个现有LMM。主表的Gemma-4-31B是实验读者模型,不是用户计划中的3B。它没有证明3B能完成同样质量的抽取与按需读取。
一轮可能涉及历史构建调用、请求证据的模型调用与最终回答调用。不能把多个角色简写成一次模型前向。库的首次构建成本与每题访问成本应该分别统计。
七类任务分别有250、125、660、138、370、98、614个问题。二分类使用宏平均准确率,四选一用普通准确率,目标框使用IoU≥0.5的正确率。任务之间的数字不能当同一种GUI成功率直接平均。
对照包括没有个人上下文、文字上下文、视觉上下文、Context Bank。附录进一步改变抽取器、目录组织方式与证据提供策略。
原文表2,Gemma-4-31B,单位%:
| 提供的上下文 | 人物身份 | 物品身份 | 行为错误判断 | 佩戴者识别 |
|---|---|---|---|---|
| 无个人历史 | 49.25 | 51.08 | 52.43 | 50.13 |
| 文字历史 | 78.00 | 78.75 | 58.11 | 52.99 |
| 视觉历史 | 75.75 | 75.34 | 59.46 | 55.36 |
| Context Bank | 83.25 | 82.52 | 66.22 | 61.60 |
原文表2。文字历史在部分任务优于直接供图,不能把“保留图片”理解为总会更好。
表3在佩戴者识别上,Gemma仅目录51.97、全部证据57.29、按需证据61.60;GPT-5.4-mini对应50.69、51.21、53.77。附录中证据请求比例差异很大:Gemma约96.1%、Gemini约95.8%,GPT约2.1%。因此策略是否真正利用工具取决于模型,不能假定所有模型都会恰当地请求旧图。
附录消融包括目录扁平化、次序扰动、更强抽取模型;例如Gemma扁平目录51.11,完整方法61.60,说明组织方式可能有影响,但需要结合是否同时改变条目结构理解。失败分析展示了模型根据粗文字描述直接猜身份、没有展开关键视觉条目的情况:证据存着也不等于会读。
已经相同的部分:历史文字目录、原始视觉档案、稳定证据ID、记忆修订、按需展开。其任务是个人经历问答;本课题是同一GUI任务内的行动决策。仅切换任务领域不足以自动产生方法创新。
建议借鉴“已保存却未请求”的错误分析,并增加GUI独有的状态更新、动作验证与当前重新定位。它最适合作为历史表示与访问机制对照,不应宣称是同平台可直接运行的GUI基线。
Open this note in the interactive notebook (comments, hooks) → · All notes