Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

UI-Hawk: Unleashing the Screen Stream Understanding for Mobile GUI Agents

See original paper
Research paper · paper page

UI-Hawk jointly reads actions and low-resolution historical screenshots, using visual compression and staged training for mobile interface understanding and navigation.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Action text alone omits screen content, but repeatedly supplying full-resolution historical screens consumes substantial visual context.

Contributions

The paper introduces interface-understanding and navigation data and evaluations, alongside a Qwen2-7B-based model adapted to screenshot streams.

Method

The architecture uses SigLIP-SO, adaptive image cropping, a visual resampler, and a grounding head; the resampler compresses visual tokens sixteenfold and older screenshots use reduced resolution.

Training first covers grounding, widget-function description, interface question answering, and screen summarization, then predicts navigation actions from chronological screenshots and actions.

Inference repeatedly supplies a recent visual window alongside the current screen; it does not provide an external long-term evidence retrieval database or reuse prior-step KV by this mechanism.

Evaluation

On GUI-Odyssey+, UI-Hawk reports 79.4% overall action matching and 76.3% click accuracy, compared with 70.8% and 43.8% for OdysseyAgent; this is offline navigation evaluation.

In the controlled four-step history comparison, adding screenshots to action text raises overall matching from 72.7% to 78.3% on GUI-Odyssey+ and from 43.3% to 45.9% on GUI-Zouwu.

详细阅读笔记 · SUP-P18

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原文:EMNLP 2025 主会正式页20页完整 PDF。正文页码18217–18236;以下摘要为中文转述。

0. 摘要转述

UI-Hawk 认为手机代理需要理解连续截图,而不只理解当前页面。作者用界面定位、控件功能描述、界面问答与整屏摘要训练视觉语言模型,再用截图及动作序列训练导航;历史截图降低分辨率,并通过视觉特征压缩控制输入开销。论文同时建立中英文界面理解评测与导航数据,并比较只放历史动作文字和额外放历史截图的差异。它直接说明历史视觉信息有价值,但采用固定窗口连续输入,没有建立长期证据检索库。

1. 方法动机

假设助手先看见三款耳机的价格,再进入某款详情页。当前截图可能看不到另外两款价格;“点击第三款商品”这条历史动作也没有保存前两款是什么。若历史只记录操作,后续比较就会丢失依据。把所有旧截图原样输入,又会使多图视觉 token 很多。作者因此让模型同时读历史动作和低成本旧截图,并训练它理解页面元素和整个屏幕。

这篇应放在本课题的核心对照中:研究问题与“历史摘要可能丢证据”相近,不过它的解法是保留最近几个低分辨率整屏,而用户的候选解法是保留文本状态并检索较远历史中的局部视觉证据。

2. 按原文走流程

§2.1 Model Architecture:当前画面详细看,旧画面减少像素。 原文图2展示模型,见 PDF第3页附近。底座沿用 TextHawk 的按形状自适应裁图、视觉 resampler 和独立定位头,语言模型换为 Qwen2-7B,视觉编码器为 SigLIP-SO。resampler 将视觉 token 压缩16倍。模型通过 <History Screenshot> 标记区分旧图,并降低旧图输入分辨率;原文称缩为原大小的四分之一,此处不把这句话自行解释成“宽高都乘0.25”。作者给出的典型旧图有8个子图和1个全局缩略图,压缩后共144个视觉 token。

在耳机例子中,当前商品详情仍需看清颜色按钮、价格和购买入口;历史结果页提供曾见过哪些商品的依据。每一步重新把保留的历史窗口与当前画面送入模型。这不是复用上一轮已经算好的视觉特征或 KV,也没有从长时库按问题检索某个耳机裁块。

§2.2 Training:先学看页面,再学跨页面行动。 预训练引入界面元素的结构标注。第一阶段微调包含四种基本能力:文字定位控件、根据控件区域描述功能、回答界面问题、生成屏幕摘要;训练还组合多张图,使模型能接收多图。第二阶段把真实导航轨迹组织成历史截图、历史动作、当前截图和任务,再训练下一动作。只有第二阶段才是按操作时间排列的屏幕流;不能将第一阶段多图拼接说成已经学到了任务进度。

§3 Data Construction:补充界面和轨迹数据。 中文部分收集超过420款应用约11.5万张截图,英文部分使用 RICO;作者训练 RT-DETR 检测控件,结合文字、图标、输入框等结构形成界面标注。检测器服务数据构建,不能据此把最终推理模型解释成用户拟议的 YOLO→OCR→3B→大模型串联。导航数据 GUI-Odyssey+ 改用目标框评估点击,另构建中文跨应用 GUI-Zouwu。

§4 FunUI:分别检查“看懂”的四种能力。 定位看预测框是否与标注框重叠;功能描述和英文屏幕摘要使用 CIDEr;界面问答用答案 F1;中文摘要使用 GPT-4o 裁判。它们测的不是同一件事,也不能用“摘要分数高”替代“任务历史信息保留完整”。

3. 与用户方案的本质差异

UI-Hawk 保存的是最近几张整屏视觉历史;它通过降低分辨率和视觉 resampler 控制成本,再让同一个7B模型联合处理。用户方案想维护可持续更新的文字状态,并在文字不足时找回某个旧时刻的局部画面。前者的历史仍受窗口限制;后者必须额外解决写入哪些证据、如何带时间与实体身份检索、如何防止旧状态被当成当前状态。

因此不能仅提出“历史需要图片”作为创新:该论点已经有直接实验。更具体的贡献可以是同等历史 token 预算下,按当前信息缺口检索证据,优于固定窗口低分辨率截图。本段是研究设计建议,不是原论文结论。

4. 指标、主要结果、消融与附录

表2为离线导航动作匹配;不是从初始环境实际执行到终点的任务成功率。

GUI-Odyssey+ 模型 Overall action matching % ClickAcc %
OdysseyAgent 70.8 43.8
UI-Hawk 79.4 76.3

论文对部分昂贵闭源模型每类任务抽样500例;若重做比较,必须统一样本,而不能直接把所有表格结果视为完全相同评估条件。

最相关的是表5历史消融。 各实验历史长度固定为4;下面取四种基本任务均使用平衡采样数据的第7、8行,其他设置尽量一致。T 是历史动作文字;V 是历史动作加截图,不是“只有图片”。

历史表示 GUI-Odyssey+ Overall % GUI-Zouwu Overall %
T:历史动作文字 72.7 43.3
V:动作文字+历史截图 78.3 45.9

这支持“动作文字不能替代所有历史视觉依据”。它没有比较经过针对性训练的事实摘要、局部证据 RAG、固定预算全历史检索,也没有证明任何场景都必须保留所有旧图。全文表3报告英文定位63.9、功能描述CIDEr144.3、问答F1 85.9、摘要CIDEr106.5;这些量纲不同,不可求均值当总能力。

表4拆分界面预训练与基本任务微调,表5还拆分四种基本能力。附录补数据构建、标注/提示格式及评估细节;评估细节位于附录C,适合核查动作匹配和框标准。局限部分承认应用界面会更新,需要更近期训练数据,未解决长期版本变化。这里没有把固定4帧实验写成无限历史能力。

5. 复现与本方案关系

将它作为一种重要历史基线:最近4帧降分辨率+动作历史,并让所用决策模型保持一致;另比较同预算的历史摘要、随机旧裁块、视觉相似检索、问题驱动证据检索。若更换决策底座或训练数据,应标明是机制复现而非原作者数字复现。

用户的前端可从检测框产生证据单元,但历史保存对象应包含实际任务事实,如“第二款耳机价格、预约前后时间、编辑前原值”,而不只保存齿轮图标。UI-Hawk 的历史消融正好提醒:真正被文字动作漏掉的往往是屏幕内容和状态。建议额外测试超出4帧的延迟询问、相似商品混淆、旧价格更新三类案例,并报告任务成功率、历史证据召回、答案/动作的证据正确率与端到端费用。

6. 速记

UI-Hawk=把低分辨率历史截图和动作一起交给模型;它证明视觉历史有用,没有解决长期历史的局部证据检索。

Open this note in the interactive notebook (comments, hooks) → · All notes