Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories

See original paper
Research paper · arXiv:2602.10809

DeepImageSearch evaluates complete-set retrieval from personal photo histories, and ImageSeeker uses event clues, metadata, image inspection, and reusable candidate sets to search iteratively.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

A photo's relevance can depend on which event it belongs to or how it relates to other photos, so one-shot visual similarity may miss the intended set.

Contributions

DISBench contains 122 verified questions over 109,467 photos from 57 users, with histories averaging 3.4 years and 3.84 target photos per question.

Method

A graph of photos, albums, clues, and people supports question construction and human verification; the ground-truth graph and album boundaries are not directly handed to the test agent.

ImageSeeker combines text/image retrieval, time and location filtering, explicit image viewing, and external search to identify events and narrow candidate sets.

Named photo-ID sets persist as reusable variables, while a separate text summary records goals, findings, plans, and tool failures; the reviewed setup permits up to thirty interaction rounds.

原文图2:事件内与跨事件历史检索
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

In reviewed v2 Table 1 with an 8B retriever, Claude-Opus-4.5 ImageSeeker reaches 28.7% exact set match and 55.0% set F1; these measure photo retrieval rather than GUI navigation.

In the Gemini-3-Flash-Preview ablation, removing explicit set memory reduces F1 from 36.8% to 31.9%, and removing summary compression yields 33.9%; this separates candidate-set storage from history summarization.

详细阅读笔记 · SUP-R05

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原文:DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories,核查v2,2026-09-07。P0邻近机制:个人照片历史检索,不是GUI操作。中文转述。

0. 摘要

作者研究带事件、时间和地点约束的历史图像检索。用户可能要找“那场有蓝白标志的演唱会里,只有主唱在台上的照片”;一张照片是否满足要求取决于其他照片提供的事件线索。论文构建DISBench,并提出ImageSeeker,用搜索、元数据筛选、看图、变量集合与上下文摘要完成多轮查询。

1. 方法动机

相似度只能说明“这张图像演唱会”,无法确定是不是用户所指那一次。正确过程需要先定位事件,再查该事件中的目标图片;跨事件问题还要比较不同时间同一对象是否再次出现。

它已经把历史检索写成有依赖的多步搜索,因此“先找时间锚点再检索目标”不能不查它就当新机制。GUI还需解决动作引起的状态更新,但这个差别必须用实验明确。

2. 方法设计

原文图2:事件内与跨事件历史检索

图源:原文图2,不是GUI流程图。

原文3.1–3.2:目标是一组满足条件的历史照片

输入一位用户按时间排列的图像及时间/GPS信息,再给自然语言问题,输出全部满足条件的图片ID。目标可能不止一张,也不提前告诉模型数量。测试时问题只用文字;引用的视觉线索也写成描述,要求先在图库里找到该线索。

原文3.3:用图构建题目,不是直接把标准图交给执行器

先由VLM提取图片里的显著线索、人物和描述,通过检索加复核建立跨图关联。把照片、相册、视觉线索和人物组织成图,再抽子图生成需多步关联的问题。真实相册边界用于建题,却不直接暴露给测试模型。这一点很重要,否则“先找事件”可能变成读取标准标签。

原文3.4:人工核查线索和完整目标集合

七名标注者核实线索存在、推理链成立、无法只靠单图相似度区分。2000个候选题留下122个;多人分别标注后协商差异。标注集合平均IoU为0.91,是标注一致性,不是模型准确率。

原文4:ImageSeeker调用不同工具缩小范围

视觉检索接受文字/图片查询;元数据工具读取或筛选时间、地点;查看工具把指定照片放进上下文;外部搜索帮助理解问题中的实体。检索与筛选结果可以存成命名的图片子集,随后对该子集再检索、筛选或求交集。

沿原文例子:先找蓝白标志 → 读这些图的时间/地点 → 确定演唱会候选范围 → 在范围内看哪些照片只有主唱 → 输出所有满足条件的ID。不是第一次top-k命中后立刻结束。

原文4:中间集合与文字摘要分开保存

一类记忆是照片ID集合,相当于程序变量;另一类是压缩交互历史,包含全局目标/发现、当前子目标/计划、工具失败经验。历史太长、图片太多或模型主动要求整理时触发压缩。变量仍可引用此前结果,摘要不是唯一存储。

3. 模型、训练与调用成本

该框架使用现有模型与提示,没有在本文为ImageSeeker训练新GUI模型。实验用不同闭源和开源VLM作为规划器,Qwen3-VL-Embedding-2B/8B作为图像检索器;GPT-4o-mini负责上下文压缩。执行模型、embedding模型和摘要模型是不同角色。

附录D.4设最多30轮,128K上下文限制,搜索默认20个结果,一次最多查看20图。压缩和工具调用均有成本;不能把一次向量检索速度说成完整系统速度。

4. 数据与指标

DISBench包含57位用户的109467张照片、122个问题,历史平均跨3.4年,每题平均3.84张目标图。事件内问题46.7%,跨事件53.3%。它测个人照片检索,不是几百步GUI轨迹。

EM要求预测的整个集合与标准集合相同;F1平衡选中目标和误选/漏选。常规embedding另报MAP、Recall和NDCG,不能直接与集合EM互换。

5. 结果、消融与附录

原文表1,使用8B检索器的代表结果(%):

ImageSeeker规划模型 完整集合EM 集合F1
GPT-4o 5.7 21.8
Gemini-3-Flash-Preview 12.3 36.8
Claude-Sonnet-4.5 22.1 43.8
Claude-Opus-4.5 28.7 55.0

原文表1。同一Opus换2B检索器为32.0/55.5,不能说更大embedding一定更好。正文部分描述“最佳”时指8B配置;上表只报已明确固定的配置,避免跨配置混淆。

表3拿掉元数据读取后整体F1降低5.7分;去掉显式集合记忆后整体36.8→31.9;去掉摘要压缩为33.9。因此不要把本文整体效果都归结为“做了历史摘要”。正文§5.4称显式记忆对跨事件题影响更大,但表3实际是事件内42.4→34.1(降8.3)、跨事件31.9→30.1(降1.8),文字与表格不一致,本笔记按表列数值,不能沿用相反结论。

测试时多次采样能提高成绩,但Best@k用标准答案F1挑最好结果,是理想选择上限,真实部署没有这个选择器。多数投票与其仍有差距。附录提供数据构建提示、查询例子、工具协议、30轮等参数及失败分析;主任务的难点包括跨事件关联与漏选完整目标集。

6. 对本方案的借鉴

需要引用的机制:有时间/对象约束的历史检索、先锚定事件再筛选、把中间结果作为变量保存、多层摘要避免重复探索。它提醒本方案不要直接用总任务embedding检索所有旧图。

可以迁移“候选证据集合+操作记录”到GUI事件链,但不能把照片检索分数当GUI行动收益。主实验应区分:历史证据找齐、状态推理正确、当前定位正确三层。

Open this note in the interactive notebook (comments, hooks) → · All notes