Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

A History-Aware Visually Grounded Critic for Computer Use Agents (HiViG)

See original paper
Research paper · arXiv:2606.11078

HiViG uses one trained critic to track completed subgoals and visually check proposed actions before execution.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

An action's verbal intent can sound correct even when its coordinate is wrong, while raw action logs obscure actual progress.

Contributions

The paper combines history-state tracking with spatially grounded error explanations for action revision.

Method

A critic compares the previous action's before-and-after screenshots to update a compact record of achieved subgoals.

It then inspects a marker at the proposed action location on the current screenshot and returns approval or corrective feedback.

Joint SFT uses history-tracking examples and synthesized error cases with partial intent masking to emphasize visual evidence.

Y26-133 作者原图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

Online evaluation covers WebArenaLitev2, AndroidLab, and WindowsAgentArena; Qwen3-VL-32B's three-platform average success rises from 31.0% to 38.3%.

The two-policy-call limit does not equalize every critic call or token, and no end-to-end latency result accompanies the main comparison.

详细阅读笔记 · Y26-133

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 本轮阅读优先级 P0 · 历史摘要与视觉证据核验

0. 摘要

中文转述,非逐句译文;依据缓存的 arXiv 全文,其许可为 arXiv 非独占分发许可。HiViG 训练一个视觉批评模型,一方面将已经发生的操作整理成阶段性完成记录,另一方面在动作执行前检查真实点击位置、预计状态变化及任务相关性。它通过额外推理纠正候选动作,提升网页、手机和桌面任务成功率。

1. 方法动机

仅给候选动作打分,在所有候选都不好时很难指导如何改正;只看动作的语言描述,又可能同意“点击正确按钮”这一意图,却忽略坐标落在旁边。与此同时,长任务中的原子动作列表不容易表达哪些子目标已经达成,代理可能重复尝试已失败的方法。

作者把问题拆成历史状态跟踪和执行前视觉校验。前者帮助提出更合理的动作,后者在动作改变环境之前指出具体错误。文中的“宏动作历史”是对过去成就的压缩描述,不是将未来多个动作打包执行的宏指令。

2. 方法设计

Y26-133 作者原图

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。

  1. 从已执行轨迹提取监督单位。 使用 ScaleCUA 的网页、手机和桌面轨迹,将任务、前截图、已执行动作和后截图组成局部样本。Qwen3-VL-32B-Thinking 作为标注模型,能够参考真实的动作结果,减少仅凭意图臆测反馈。
  2. 构建历史跟踪数据。 标注器比较相邻截图,判断有效界面变化或静默失败,并与之前的压缩历史合并。输出以多个原子动作实现的阶段目标为单位,供下一步策略判断整体进展;该部分生成约 20k 样本。
  3. 构建具有空间依据的错误数据。 先描述成功动作的真实状态变化,再按 12 类错误合成合理的错误动作,包括坐标错误、遗漏前置步骤和指向不存在元素等。对动作坐标画视觉标记,并在 30% 样本中遮蔽动作文字意图,迫使标注分析关注截图实际落点。
  4. 生成分层解释并训练批评器。 标注器依次核对标记下的元素、动作结果与任务一致性,输出好坏判断、错误类型和修正解释。错误动作部分使用预定义的失败结果,与成功动作的实际后截图依据不同。合计 52k 样本中约 32k 属于错误分析;将 Qwen3-VL-8B-Thinking 联合监督微调一个 epoch。
  5. 每步先更新历史再提出动作。 在线时,批评器读取上次执行的前后截图、动作和旧历史,更新宏观进展记录;主策略接收该记录及当前观察,生成候选动作。主策略权重不因该过程改变。
  6. 执行前再次调用批评器。 在当前截图的候选坐标处放置标记,批评器检查落点、预测后果并判断任务相关性。好动作放行,坏动作附带文字反馈交给策略改写;实验限制每步最多两次策略调用。完整方案每步通常包含历史跟踪和动作检查两次批评器推理。

3. 与其他方法对比

对比对象 提供的信息 HiViG 的变化及成本
基础代理 自己根据历史提出并执行动作 增加独立历史整理与执行前检查
OpenCUA/SE-WSM 式标量评价 给候选动作打分并挑选 文字解释可指导改写,但生成反馈额外耗时
CGI 提示式批评 多维度语言评价 训练时加强实际落点及状态变化依据
GUI-Critic-R1 专门训练的动作批评 同时加入跨平台历史跟踪与视觉定位
只用历史跟踪消融 压缩已完成过程 成本更低,少了对候选坐标的再次校验

主要贡献是双用途批评器和数据构建方式。它属于增加测试时计算改善可靠性的方案,不能因使用 8B 批评器就归类为已证实加速。

4. 实验表现与优势

主表覆盖 WebArenaLitev2、AndroidLab、WindowsAgentArena,以环境执行后的任务成功率评价。表1中,Qwen3-VL-32B 的三平台平均成功率从 31.0% 提升至 38.3%;最强平均基线为 32.5%,因此差距为 5.8 个百分点,不是相对提高 5.8%。Gemini-3-Flash 从 41.4% 提升至 50.4%,差距为 9.0 个百分点;其网页子集从 30.5% 提升至 45.5%。论文表1

表2中,Gemini 仅使用历史跟踪达到 42.9%,仅使用视觉分析为 35.1%,完整方案为 45.5%。表3的 AndroidLab 结果中,去掉训练时意图遮蔽,Qwen 策略成功率从 51.5% 降至 47.1%。这些消融支持历史表达和空间监督各有作用,但表2无组件基线与表1存在小幅数值差异,应在同一表内进行对应比较。

标量评价基线采用 N=2,以匹配语言反馈方案最多两次策略调用;这不代表所有模型调用、生成长度或实际时间完全匹配。全文主结果没有端到端计时,因此额外两次批评器推理能否由减少失败和重复操作抵消,尚无直接时间证据。

作者指出固定 12 类错误可能无法覆盖未来界面和新模型错误。分析上,合成错误是否覆盖真实失误、预测动作后果是否可靠,以及压缩历史是否遗漏关键信息,都需要进一步检查。

5. 学习与应用

论文提供官方代码链接;本轮未读取源码或确认全部权重与数据发布内容。最小复现可先固定一种主策略,只训练或运行历史跟踪分支,再加入带坐标标记的执行前批评,分别记录增益和调用成本。

应保持 20k/32k 两类样本组成、30% 意图遮蔽、一个 epoch 和每步两次策略调用上限,并明确图像标记方式、轨迹划分与错误类别分布。复现建议同时测整任务时间、批评器总时间、拦截正确动作的比例和被纠正后的执行成功率;这样才能决定是否适合对延迟敏感的场景。

6. 总结

核心思想:记录完成状态并核对动作落点。

速记流程:比较前后画面 → 整理已完成事项 → 提出动作 → 核对后执行

来源与核查:原论文,已读§2–3及局限;论文所列代码

7. 与当前“历史摘要+按需视觉证据”方案的关系

用前后截图构建压缩历史跟踪并批评动作,是证据支持的历史摘要最直接跨组近邻。

本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。

原文阅读定位:3 Experiments;3.1 Setup;3.2 Results and Discussion;3.3 Analysis and Ablations;4 Related work;5 Conclusion;Appendix A Details of Experimental Setups;Appendix B Complete Taxonomy of Synthesized Error Dimensions;Appendix C Computer Use Agent Action Space;Appendix D Additional Experiments;D.2 Lack of History State Tracking in Previous Critics;Appendix E Large Language Model (LLM) Use。完整章节及图表索引见原论文:章节、图注与来源 / Original paper

Open this note in the interactive notebook (comments, hooks) → · All notes