WebStep uses deterministic semantic state tracking to distinguish exploration, execution, and wasted interaction.
Final task success alone cannot explain whether an agent failed to find the target or failed after finding it.
The benchmark couples controlled websites with semantic transition models for process-level diagnosis.
Task worlds include a unique correct target and distractors whose distinguishing attributes require exploration.
GUI actions drive a deterministic hidden semantic model that records revealed information and meaningful state changes.
Aligned semantic trajectories identify decisive branch choices and support skill-level analysis without exposing hidden state to the agent.

Across 1,800 tasks, agents with similar final success show different exploration and post-discovery execution performance.
GUI-to-semantic step ratios quantify interaction redundancy, but are not wall-clock latency ratios.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 本轮阅读优先级 P0 · 语义证据与任务进度评测
摘要完整译文(arXiv v2;CC BY 4.0;原摘要)。以下保留作者摘要的主张;译文按同一许可提供。
网页代理通过较长交互序列执行任务,但现有基准只评估最终成功,丢弃全部过程信息,因而难以为改进提供指导。本文对网页代理开展过程层面分析。我们提出WebStep,一个包含1800个任务实例、难度可控且支持自动语义状态跟踪的基准。每个网站在GUI之外提供确定性的语义马尔可夫决策过程:代理操作界面,环境在后台记录高层状态与转移,使无需人工标注的细粒度分析成为可能。基于语义轨迹,我们首先表明,过程指标能揭示结果评价无法看见的差异:三个成功率集中在34%–37%的代理,在探索范围和执行准确率上表现不同。随后,按技能分解刻画了这些差异的性质,揭示同一网站内部被隐藏的相反技能排名。例如,在问答网站上,Claude CUA的导航动作表现比OpenAI CUA高30%,但检查行为低6.7%,从而即使在同一领域内也能定位具体需要改进的技能。分岔分析进一步定位导致任务丢失的决定性错误,并显示错误因代理而异,而非共同存在。最后,这些差异会随着任务难度增加而扩大:简单任务成功率相近,但探索要求提高时迅速分化。我们的过程分析为网页代理评价开辟新方向,提供细粒度、可执行的洞见,指出各代理应在何处以及如何改进。项目页。
两个代理最终都失败,原因可能完全不同:一个没有找到目标,另一个已经找到却提交错误;即使成功,很多点击也可能没有推进任务。单一任务成功率不能定位这些差异。
从任意网页轨迹事后猜测语义状态又容易依赖主观模型判断。论文让网页本身由已知语义转移驱动,使环境在运行时就能准确记录信息可见性和动作效果。

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。
| 对比评测 | WebStep增加的内容 | 代价与边界 |
|---|---|---|
| 只判最终成功 | 拆分探索和最终执行 | 能定位瓶颈,需要可追踪语义环境 |
| 真实在线网站 | 确定性自托管状态 | 可控可复现,外部动态复杂性较少 |
| 人工里程碑评测 | 由语义转移恢复完整过程 | 减少主观标注,建站工作量更大 |
| 只统计点击次数 | 同时统计语义推进次数 | 区分操作冗余,不直接等于时间 |
所谓技能指标主要衡量是否调用参考轨迹所需技能,原文明确没有把所有未完成的尝试都当作可识别技能成功率。
表2中小模型终局成功率接近:Fara 35.7%、GUI-Owl 34.4%、UI-TARS 37.1%。但UI-TARS探索成功49.2%,高于GUI-Owl的43.3%,找到目标后的执行成功73.9%,反而低于GUI-Owl的78.6%。单一终局指标会遮住这种相反趋势。§4.1、表2
Claude CUA终局成功85.3%,平均14.3个GUI步骤与9.3个语义步骤,比值1.5;UI-TARS为35.0、14.0和2.5。它展示交互效率差异,但不同模型每步推理时间不同,步骤比不能换算成相同比例的耗时节省。表2
分析上,基准隐藏属性、唯一正确目标与确定性转移非常适合测信息获取和条件验证;对开放网站的异步加载、视觉漂移和外部状态变化,还需额外测试。
原文提供WebStep项目页,本轮未逐项检查代码资源或实现。复现应确保受测代理只能通过网页行动,语义状态仅供评估,避免泄露答案或下一步提示。
复现建议:先实现一个含列表与详情页的受控网站,生成具有同外观干扰项的唯一目标任务。比较加速策略前后信息覆盖、过早提交和无效GUI步数,同时测实际延迟;这能区分“看少了所以快”与“减少重复但保留必要证据”。
核心思想:用语义状态解释网页执行过程。
速记流程:生成可控任务世界→记录界面背后的状态→拆分探索与执行→定位失败分歧
来源与核查:原论文,已读§2–4.3及表1–2;项目链接取自论文。
记录已向代理揭示的对象属性和确定性语义转移,可测记忆是否丢掉稍后需要的事实。
本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。
原文阅读定位:2 Process-level evaluation via semantic MDP duals;3 WebStep;4 Experiments and Results;4.1 Aggregate Results;4.2 Skill-level diagnosis;4.3 Trajectory bifurcations;4.4 Exploration success by task complexity;5 Conclusion;Appendix A Limitations;Appendix B Related Work;Process-level and intermediate evaluation.;Automated trajectory evaluation.;Appendix C Implementation Details;C.3 Evaluation Protocol;Appendix D Benchmark Specification;Appendix E Data Generation Pipeline;Appendix F Extended Quantitative Results;Appendix G Artifact Viewer;Appendix H Data Examples;Appendix I Case Study。完整章节及图表索引见原论文:章节、图注与来源 / Original paper。
Open this note in the interactive notebook (comments, hooks) → · All notes