Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

See original paper
Research paper · arXiv:2606.29537

OSWorld 2.0 evaluates complete stateful desktop workflows with dynamic information and fine-grained terminal checks.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Short interaction tests do not establish whether an agent can reconcile multiple information sources and deliver an entire professional workflow.

Contributions

The benchmark adds reproducible stateful environments, dynamic inputs, partial-credit checks, and separate behavioral audits.

Method

Tasks combine local artifacts and self-hosted services with consistent accounts, messages, and records.

New information and limited-knowledge simulated users can require plan updates during execution.

Scoring primarily inspects final files and environment state, supplemented by validated checklist-based model judging for selected requirements.

Y26-153 作者原图
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

The reviewed release contains 108 tasks and uses a 500-step budget, distinguishing strict completion from partial progress.

Single-action and batched-tool settings also report output tokens, rounds, and tool calls; those counts should not be treated as interchangeable latency measures.

详细阅读笔记 · Y26-153

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 本轮阅读优先级 P0 · 长程有状态桌面评测

0. 摘要

中文转述,非逐句译文。OSWorld 2.0 将桌面代理评估推进到长程、跨来源且环境会变化的完整工作流。108 个任务结合真实输入材料、一致的用户状态、自托管服务和细粒度终态评分,并单独审计执行中的安全行为。前沿代理虽能取得部分进展,严格完成率仍较低,特别难以维护隐藏状态、发现中途新信息及完成最终核验。

1. 方法动机

短任务的点击能力提升不能说明代理能交付一个完整专业结果。长流程中,先前记录、跨应用信息、用户补充和后续检查互相依赖,任何漏项都可能使最终交付失效。

复杂任务也更难评估:固定动作序列会误判合法替代路径,只看少数终态又可能放过绕过要求的结果。本文贡献是构造可复现的环境与评分体系,用它衡量长流程的成功、成本和失败原因,并不提出新的加速算法。

2. 方法设计

Y26-153 作者原图

作者原图;图注与上下文。此图来自本轮获取版本,正文数值以各处明确引用的版本为准。

  1. 收集真实工作流:内部标注者学习应用文档和教程,设计目标、材料与终态,另一人交叉检查可行性和歧义;访谈、问卷和模型提案提供补充。最终约九成任务来自团队构思及专家式标注,不能视作随机职业工作抽样。

  2. 建立有状态环境:在真实桌面中配置本地文档、打开页面、历史消息及账户记录;将邮件、银行、聊天等服务自托管,控制初始状态并减少线上漂移。跨来源的日期、金额和身份信息必须保持一致。

  3. 注入动态信息与有限用户知识:运行期间可出现新邮件或消息,迫使代理更新计划;需要澄清的任务配备只知道指定事实的模拟用户。语义任务状态变化与画面在动作间变化是两类独立挑战。

  4. 以最终状态给分:每任务平均 27.25 个检查点,尽量用文件及环境状态的函数验证,允许不同正确路径。开放式视觉或文字要求辅以二元清单式模型评判;模型判断仅占总分的 11.53%,任何单任务不超过一半。

  5. 执行多层质量检查:生成评分单元检查,两名人类独立完成任务,再用多种代理轨迹找出遗漏。专门检查既能骗分又未完成任务的情况,也检查正确结果被格式限制误罚的情况;仍有歧义则修订或删除任务。

  6. 按配置评估代理:统一 500 步上限、截图观察,每动作后暂停 3 秒,区分单调用和批量工具调用,并分别控制推理强度。保存严格完成率、部分得分、每任务费用、输出 token、工具调用和轮数;所有实验固定 v2026.06.24 发布版本。

方法依据:原文 §2.1–§2.2:任务、环境和评价构建

3. 与其他方法对比

对比对象 原有做法与局限 本文改变及代价
OSWorld 1.0 偏短的单段任务,完整成败较易定义 引入依赖深的完整工作流,环境和审核成本更高
固定动作序列评分 可能拒绝不同但有效的操作路径 基于最终环境多检查点评价
完全模型评判 主观与不稳定判断可能扩大 优先功能检查,仅有限部分使用经验证的模型清单
只报告单一成功率 部分进度和推理代价不可见 同时报告严格完成、部分得分及资源消耗

4. 实验表现与优势

基准含 108 项任务,人类完成时间中位数约 1.6 小时。Table 3 的 500 步、最高推理设置下,Claude Opus 4.8 批量工具配置取得 20.6% 严格完成率、54.8% 部分得分;GPT-5.5 为 13.0%、49.5%。完成大部分检查点与交付完整成果之间仍有明显差距。

同表 Opus 4.8 批量配置平均每任务约 224k 输出 token、103 轮、481.8 次工具调用;单动作配置为 259.5k token、190.5 轮和 190.5 次调用,严格完成率 18.5%。批量调用减少轮数但可以增加底层动作,不能把两种计数混用,也不能直接推算墙钟提速。

GPT-5.5 平均约 37.1k 输出 token,相比 Opus 4.8 更省 token,但完成率较低;表内费用依赖对应模型价格。论文承认职业领域覆盖有限,样本组合、随机行为和对自托管环境的适应会影响结果。任务标签只有在轨迹真正遇到相应挑战时才用于因果式失败诊断。

数据来源:原文 §3、Table 3;§4;§6;附录 C.6

5. 学习与应用

开放状态:原文给出 OSWorld 2.0 项目网站,并声明发布任务、环境、网站和轨迹。本轮未检查具体下载完备性。使用这套基准需保留发布清单中的任务、网站、环境镜像及代码版本,不能跨版本直接比较。

最小复现建议:先选一个跨应用且含动态更新的任务,验证初态、模拟用户与全部检查点,再扩大到完整集合。将批量调用、每动作等待和推理强度分别锁定;同时报告工具调用数与观察轮数,若研究速度还需补采实际墙钟而非用轮数替代。

6. 总结

核心思想:用完整工作流测长程交付能力

速记流程:构造一致工作环境 → 加入隐含状态与动态事件 → 按终态检查点评分 → 联合比较完成率与成本

来源与核查:原始论文;已读 §2.1–§2.2:任务、环境和评价构建、§3、Table 3、§4;§6;附录 C.6;许可。作者资源:链接

7. 与当前“历史摘要+按需视觉证据”方案的关系

真实长任务、动态信息和跨源一致性适合主要在线验证,区别于单帧定位准确率。

本轮原文完整表格(保留原始行列,含可抽取的附录表)。中文正文选取并解释主要结果;本附件是可核原表,不是本项目重新跑出的统一排行榜。

原文阅读定位:2.1.3 Evaluation Protocol;3 Experiments;3.1 Setup;3.2 Main Results;4 Analysis;4.1 Agent Behavior;4.1.1 Solution Strategies;4.1.2 Action Patterns;4.2 Agent Safety Analysis;4.3 Human vs. Model Difficulty Gap;4.4 Qualitative Failure Mode Analysis;5 Related Work;Appendix A Contributions and Acknowledgments;Appendix B OSWorld 1.0 vs. OSWorld 2.0 : Key Improvements;Appendix C Environments, Applications, and Assets;Appendix D External Interviews for Task Inspiration;Appendix E Evaluation Protocol, Validation, and Safety;E.1 Validation of Model-Based Evaluation and User Simulation;Appendix F Agent Behavior Annotation Details;Appendix G Supplemental Analysis;Appendix H Case Studies。完整章节及图表索引见原论文:章节、图注与来源 / Original paper

Open this note in the interactive notebook (comments, hooks) → · All notes