DeepImageSearch evaluates complete-set retrieval from personal photo histories, and ImageSeeker uses event clues, metadata, image inspection, and reusable candidate sets to search iteratively.
A photo's relevance can depend on which event it belongs to or how it relates to other photos, so one-shot visual similarity may miss the intended set.
DISBench contains 122 verified questions over 109,467 photos from 57 users, with histories averaging 3.4 years and 3.84 target photos per question.
A graph of photos, albums, clues, and people supports question construction and human verification; the ground-truth graph and album boundaries are not directly handed to the test agent.
ImageSeeker combines text/image retrieval, time and location filtering, explicit image viewing, and external search to identify events and narrow candidate sets.
Named photo-ID sets persist as reusable variables, while a separate text summary records goals, findings, plans, and tool failures; the reviewed setup permits up to thirty interaction rounds.

In reviewed v2 Table 1 with an 8B retriever, Claude-Opus-4.5 ImageSeeker reaches 28.7% exact set match and 55.0% set F1; these measure photo retrieval rather than GUI navigation.
In the Gemini-3-Flash-Preview ablation, removing explicit set memory reduces F1 from 36.8% to 31.9%, and removing summary compression yields 33.9%; this separates candidate-set storage from history summarization.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原文:DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories,核查v2,2026-09-07。P0邻近机制:个人照片历史检索,不是GUI操作。中文转述。
作者研究带事件、时间和地点约束的历史图像检索。用户可能要找“那场有蓝白标志的演唱会里,只有主唱在台上的照片”;一张照片是否满足要求取决于其他照片提供的事件线索。论文构建DISBench,并提出ImageSeeker,用搜索、元数据筛选、看图、变量集合与上下文摘要完成多轮查询。
相似度只能说明“这张图像演唱会”,无法确定是不是用户所指那一次。正确过程需要先定位事件,再查该事件中的目标图片;跨事件问题还要比较不同时间同一对象是否再次出现。
它已经把历史检索写成有依赖的多步搜索,因此“先找时间锚点再检索目标”不能不查它就当新机制。GUI还需解决动作引起的状态更新,但这个差别必须用实验明确。

图源:原文图2,不是GUI流程图。
输入一位用户按时间排列的图像及时间/GPS信息,再给自然语言问题,输出全部满足条件的图片ID。目标可能不止一张,也不提前告诉模型数量。测试时问题只用文字;引用的视觉线索也写成描述,要求先在图库里找到该线索。
先由VLM提取图片里的显著线索、人物和描述,通过检索加复核建立跨图关联。把照片、相册、视觉线索和人物组织成图,再抽子图生成需多步关联的问题。真实相册边界用于建题,却不直接暴露给测试模型。这一点很重要,否则“先找事件”可能变成读取标准标签。
七名标注者核实线索存在、推理链成立、无法只靠单图相似度区分。2000个候选题留下122个;多人分别标注后协商差异。标注集合平均IoU为0.91,是标注一致性,不是模型准确率。
视觉检索接受文字/图片查询;元数据工具读取或筛选时间、地点;查看工具把指定照片放进上下文;外部搜索帮助理解问题中的实体。检索与筛选结果可以存成命名的图片子集,随后对该子集再检索、筛选或求交集。
沿原文例子:先找蓝白标志 → 读这些图的时间/地点 → 确定演唱会候选范围 → 在范围内看哪些照片只有主唱 → 输出所有满足条件的ID。不是第一次top-k命中后立刻结束。
一类记忆是照片ID集合,相当于程序变量;另一类是压缩交互历史,包含全局目标/发现、当前子目标/计划、工具失败经验。历史太长、图片太多或模型主动要求整理时触发压缩。变量仍可引用此前结果,摘要不是唯一存储。
该框架使用现有模型与提示,没有在本文为ImageSeeker训练新GUI模型。实验用不同闭源和开源VLM作为规划器,Qwen3-VL-Embedding-2B/8B作为图像检索器;GPT-4o-mini负责上下文压缩。执行模型、embedding模型和摘要模型是不同角色。
附录D.4设最多30轮,128K上下文限制,搜索默认20个结果,一次最多查看20图。压缩和工具调用均有成本;不能把一次向量检索速度说成完整系统速度。
DISBench包含57位用户的109467张照片、122个问题,历史平均跨3.4年,每题平均3.84张目标图。事件内问题46.7%,跨事件53.3%。它测个人照片检索,不是几百步GUI轨迹。
EM要求预测的整个集合与标准集合相同;F1平衡选中目标和误选/漏选。常规embedding另报MAP、Recall和NDCG,不能直接与集合EM互换。
原文表1,使用8B检索器的代表结果(%):
| ImageSeeker规划模型 | 完整集合EM | 集合F1 |
|---|---|---|
| GPT-4o | 5.7 | 21.8 |
| Gemini-3-Flash-Preview | 12.3 | 36.8 |
| Claude-Sonnet-4.5 | 22.1 | 43.8 |
| Claude-Opus-4.5 | 28.7 | 55.0 |
原文表1。同一Opus换2B检索器为32.0/55.5,不能说更大embedding一定更好。正文部分描述“最佳”时指8B配置;上表只报已明确固定的配置,避免跨配置混淆。
表3拿掉元数据读取后整体F1降低5.7分;去掉显式集合记忆后整体36.8→31.9;去掉摘要压缩为33.9。因此不要把本文整体效果都归结为“做了历史摘要”。正文§5.4称显式记忆对跨事件题影响更大,但表3实际是事件内42.4→34.1(降8.3)、跨事件31.9→30.1(降1.8),文字与表格不一致,本笔记按表列数值,不能沿用相反结论。
测试时多次采样能提高成绩,但Best@k用标准答案F1挑最好结果,是理想选择上限,真实部署没有这个选择器。多数投票与其仍有差距。附录提供数据构建提示、查询例子、工具协议、30轮等参数及失败分析;主任务的难点包括跨事件关联与漏选完整目标集。
需要引用的机制:有时间/对象约束的历史检索、先锚定事件再筛选、把中间结果作为变量保存、多层摘要避免重复探索。它提醒本方案不要直接用总任务embedding检索所有旧图。
可以迁移“候选证据集合+操作记录”到GUI事件链,但不能把照片检索分数当GUI行动收益。主实验应区分:历史证据找齐、状态推理正确、当前定位正确三层。
Open this note in the interactive notebook (comments, hooks) → · All notes