HiViG uses one trained critic to track completed subgoals and visually check proposed actions before execution.
An action's verbal intent can sound correct even when its coordinate is wrong, while raw action logs obscure actual progress.
The paper combines history-state tracking with spatially grounded error explanations for action revision.
A critic compares the previous action's before-and-after screenshots to update a compact record of achieved subgoals.
It then inspects a marker at the proposed action location on the current screenshot and returns approval or corrective feedback.
Joint SFT uses history-tracking examples and synthesized error cases with partial intent masking to emphasize visual evidence.

Online evaluation covers WebArenaLitev2, AndroidLab, and WindowsAgentArena; Qwen3-VL-32B's three-platform average success rises from 31.0% to 38.3%.
The two-policy-call limit does not equalize every critic call or token, and no end-to-end latency result accompanies the main comparison.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 本轮阅读优先级 P0 · 历史摘要与视觉证据核验
中文转述,非逐句译文;依据缓存的 arXiv 全文,其许可为 arXiv 非独占分发许可。HiViG 训练一个视觉批评模型,一方面将已经发生的操作整理成阶段性完成记录,另一方面在动作执行前检查真实点击位置、预计状态变化及任务相关性。它通过额外推理纠正候选动作,提升网页、手机和桌面任务成功率。
仅给候选动作打分,在所有候选都不好时很难指导如何改正;只看动作的语言描述,又可能同意“点击正确按钮”这一意图,却忽略坐标落在旁边。与此同时,长任务中的原子动作列表不容易表达哪些子目标已经达成,代理可能重复尝试已失败的方法。
作者把问题拆成历史状态跟踪和执行前视觉校验。前者帮助提出更合理的动作,后者在动作改变环境之前指出具体错误。文中的“宏动作历史”是对过去成就的压缩描述,不是将未来多个动作打包执行的宏指令。

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。
| 对比对象 | 提供的信息 | HiViG 的变化及成本 |
|---|---|---|
| 基础代理 | 自己根据历史提出并执行动作 | 增加独立历史整理与执行前检查 |
| OpenCUA/SE-WSM 式标量评价 | 给候选动作打分并挑选 | 文字解释可指导改写,但生成反馈额外耗时 |
| CGI 提示式批评 | 多维度语言评价 | 训练时加强实际落点及状态变化依据 |
| GUI-Critic-R1 | 专门训练的动作批评 | 同时加入跨平台历史跟踪与视觉定位 |
| 只用历史跟踪消融 | 压缩已完成过程 | 成本更低,少了对候选坐标的再次校验 |
主要贡献是双用途批评器和数据构建方式。它属于增加测试时计算改善可靠性的方案,不能因使用 8B 批评器就归类为已证实加速。
主表覆盖 WebArenaLitev2、AndroidLab、WindowsAgentArena,以环境执行后的任务成功率评价。表1中,Qwen3-VL-32B 的三平台平均成功率从 31.0% 提升至 38.3%;最强平均基线为 32.5%,因此差距为 5.8 个百分点,不是相对提高 5.8%。Gemini-3-Flash 从 41.4% 提升至 50.4%,差距为 9.0 个百分点;其网页子集从 30.5% 提升至 45.5%。论文表1
表2中,Gemini 仅使用历史跟踪达到 42.9%,仅使用视觉分析为 35.1%,完整方案为 45.5%。表3的 AndroidLab 结果中,去掉训练时意图遮蔽,Qwen 策略成功率从 51.5% 降至 47.1%。这些消融支持历史表达和空间监督各有作用,但表2无组件基线与表1存在小幅数值差异,应在同一表内进行对应比较。
标量评价基线采用 N=2,以匹配语言反馈方案最多两次策略调用;这不代表所有模型调用、生成长度或实际时间完全匹配。全文主结果没有端到端计时,因此额外两次批评器推理能否由减少失败和重复操作抵消,尚无直接时间证据。
作者指出固定 12 类错误可能无法覆盖未来界面和新模型错误。分析上,合成错误是否覆盖真实失误、预测动作后果是否可靠,以及压缩历史是否遗漏关键信息,都需要进一步检查。
论文提供官方代码链接;本轮未读取源码或确认全部权重与数据发布内容。最小复现可先固定一种主策略,只训练或运行历史跟踪分支,再加入带坐标标记的执行前批评,分别记录增益和调用成本。
应保持 20k/32k 两类样本组成、30% 意图遮蔽、一个 epoch 和每步两次策略调用上限,并明确图像标记方式、轨迹划分与错误类别分布。复现建议同时测整任务时间、批评器总时间、拦截正确动作的比例和被纠正后的执行成功率;这样才能决定是否适合对延迟敏感的场景。
核心思想:记录完成状态并核对动作落点。
速记流程:比较前后画面 → 整理已完成事项 → 提出动作 → 核对后执行
用前后截图构建压缩历史跟踪并批评动作,是证据支持的历史摘要最直接跨组近邻。
本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。
原文阅读定位:3 Experiments;3.1 Setup;3.2 Results and Discussion;3.3 Analysis and Ablations;4 Related work;5 Conclusion;Appendix A Details of Experimental Setups;Appendix B Complete Taxonomy of Synthesized Error Dimensions;Appendix C Computer Use Agent Action Space;Appendix D Additional Experiments;D.2 Lack of History State Tracking in Previous Critics;Appendix E Large Language Model (LLM) Use。完整章节及图表索引见原论文:章节、图注与来源 / Original paper。
Open this note in the interactive notebook (comments, hooks) → · All notes