DynamicUI captures events between actions, selects relevant frames, and uses them to correct history and guide replanning.
Transient warnings, reference information, list changes, or video events may disappear before the next action-bound screenshot.
DynamicGUIBench tests four forms of dynamic information loss, while DynamicUI adds a video-aware observation and feedback pipeline.
A dynamic perceiver clusters captured frames and adaptively increases the selection granularity according to relevance and confidence.
An action-conditioned module corrects stored action descriptions using intended and executed actions plus adjacent screenshots.
A reflection model reads selected frames and corrected history to assess progress and guide the next action.

The benchmark contains 149 tasks, including 146 feasible tasks; with a 50-step budget, Qwen3-VL-8B improves from 15.1% to 22.1% task accuracy.
Frame-selection and component ablations use distinct configurations, and the paper's retention-window descriptions are not fully consistent.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 本轮阅读优先级 P0 · 短暂历史信息压力测试
中文转述,非逐句译文。依据 arXiv 全文缓存;许可为 arXiv 非独占分发许可。论文研究动作执行期间短暂出现、在下一张截图中已经消失的信息,提出 DynamicGUIBench 测试这种动态界面困难,并用 DynamicUI 补充视频中的关键画面、修正操作历史和反思反馈。其重点是让智能体掌握遗漏的环境变化,而不是减少每步模型调用。
普通 GUI 闭环往往执行完一个动作才截屏。这个时间间隔可能藏着登录失败提示、短暂展示的参考信息、不断改序的列表或视频中的关键内容;下一步即使使用更强模型,也无法从已消失的画面还原事实。
论文的直觉是把“执行期间发生了什么”纳入状态,而不是只增强当前截图理解。它同时提出评测任务和观察模块,区分动态信息缺失与模型看见信息后仍推理失败的问题。

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。
| 对照 | 可见的信息 | 改进位置与代价 |
|---|---|---|
| Qwen3-VL-8B 原始逐步智能体 | 当前截图与原历史 | DynamicUI 补充动作间事件,但新增模型调用 |
| 均匀抽取 1 或 3 帧 | 固定时间样本 | 相关性聚类能优先保留短暂线索,依赖帧捕获与筛选质量 |
| 仅动态感知器 | 关键画面 | 完整方案进一步修正错误历史并反思,模块收益需结合消融看 |
| 固定截图的静态评测范式(分析归纳) | 易遗漏执行间变化 | 新基准显式控制动态触发,但任务分布和真实网页仍有差异 |
实质贡献是把动作间消失的信息变成可测且可回传的状态。它不保证所有动态变化都需要整段视频输入,也没有证明这些额外模块能够加速任务。
主实验以任务准确率评估,设置 15 或 50 步预算。50 步时,Qwen3-VL-8B 从 15.1% 提高到 22.1%,提升 7.0 个百分点;15 步时为 14.8% 到 15.5%。表 4 的消融中,基线为 15.1%,仅加入动态感知为 17.4%,再加入反思的组合为 20.8%,完整系统为 22.1%。这些是任务完成结果,不是识别帧的准确率。原文表 3、4
表 6 的帧策略对比报告均匀取 1 帧和 3 帧分别为 16.8% 与 16.4%,完整方案的动态选帧为 22.1%,平均保留约 3 帧。该表是在帧策略对比设置下评估,不能与表 4 的“仅动态感知”混成一组结果。OSWorld 上同一 8B 基模型从 25.8% 到 28.4%;反思模型更换也明显影响表现,说明增益部分依赖辅助模型能力。原文表 5–7
作者展示短暂内容仍然难处理,也观察到增加帧数不一定更好。分析推断:若捕获频率不足,后续筛选无法找回未录下的事件;视频描述与反思开销需要单独测量。论文没有给出足以证明端到端加速的任务耗时比较。
开放状态:本轮在原文链接中未确认可直接使用的代码或数据下载地址,不能据此断言不开源。最小复现可先实现带可控提示框和列表重排的本地页面,保存动作起止时刻、完整帧流及终态检查结果,再接入初始 3 簇、相关性 3、置信度 80 的筛选逻辑。
复现建议:固定捕获帧率、视频保留窗口、聚类上限、辅助模型及 50 步预算;逐项消融挑帧、历史细化和反思,额外记录每项模块耗时。论文未核到的帧率和聚类上限应作为明确实验变量。迁移到手机时,应先证明系统能录到短暂提示,再考虑用更轻的事件检测器替换多次模型筛选。
核心思想:保留动作间消失的界面证据
速记流程:录下界面变化→挑出相关画面→修正操作记录→根据反馈行动
来源与核查:论文,读取第 3 节基准、第 4 节方法及第 5 节实验。正文个别结果叙述与表格不同,以上数字以明确列出的表格为准。
EphemRef等动态任务要求保留已消失证据,最能测试摘要损失与视觉历史RAG补救。
本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。
原文阅读定位:3. DynamicGUIBench;3.1. Data Collection and Annotation;3.2. Benchmark Analysis;3.3. POMDP Design;4. Method;4.1. Formulation;4.2. Dynamic Perceiver;4.3. Refinement Strategy;4.4. Reflection Module;5. Experiments;5.1. Implementation Details;5.2. Experimental Results;5.3. Ablation Study;5.4. Qualitative Success and Failure Analysis。完整章节及图表索引见原论文:章节、图注与来源 / Original paper。
Open this note in the interactive notebook (comments, hooks) → · All notes