Thinking LineMingshuo Wang · research notebook

GUI agents · note dated 2026-09-07

Agent-Computer Observation Interfaces Enable Dynamic Computer Use (AOI)

See original paper
Research paper · arXiv:2606.29472

AOI decouples observation from action by capturing transient screen events and speech and retaining textual visual narratives.

直接阅读中文详解 ↓ · P0 分类树 ↗

Problem

Periodic action-bound screenshots cannot recover events or spoken information that were never captured.

Contributions

The model-independent observation interface combines gated keyframes, audio transcription, and persistent visual narration.

Method

Background sampling uses inexpensive change gates to select a small number of frames between action rounds.

An audio-energy gate triggers transcription, while the acting model records newly observed visual information alongside its action output.

Current frames, transcripts, earlier narratives, and structured interface information form the next observation record.

AOI原文图3所在页
Author figure from the paper: Method or benchmark overview reproduced in the detailed reading note. Version and source context appear below. (See original source and note for attribution and license; source)

Evaluation

DynaCU-Bench contains 100 dynamic tasks and 50 static controls; the main Claude configuration improves dynamic-task success from 38% to 82% in a mostly single-run table.

Format-only controls explain part of the gain, component effects vary by model, and measured task time can increase despite lower token estimates.

详细阅读笔记 · Y26-152

本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。

目录 / Contents

原论文 · 本轮阅读优先级 P0 · 关键帧与持久视觉叙述

0. 摘要

摘要译文(依据本轮核查原文,CC BY 4.0许可):SWE-agent确立了动作接口是软件工程代理中一个探索不足的设计方向;我们对计算机使用代理的观察接口提出类似主张。目前无论闭源还是开源的计算机使用代理都把观察绑定到动作上,每3至5秒截一张图且没有音频,使其在截图间隔内无法感知视频、动画、短暂UI事件、会议和口头指令。我们提出代理—计算机观察接口AOI,一个不依赖具体模型的感知层,通过三个门控组件把连续自适应观察与离散动作解耦:步骤间关键帧采集、音量门控音频转写,以及由计算机使用模型生成并以文本持久保存的视觉叙述。各组件面对静止无声内容时几乎不产生输出,退化为标准循环而不降低其表现。在DynaCU-Bench的100个动态浏览器任务及50个静态对照任务上,从7B到前沿规模的计算机使用模型,无需重新训练,相比截图基线提高17至48个百分点,使周期性截图下近乎不可能完成的任务大体得到解决。音频上的差距最明显:在口语内容子集上,AOI代理完成全部任务,而流式语音模型虽然能准确听到内容,缺少该框架时却无法据此行动。组件分析与总体增益同样有启发性:关键帧选择本身并不重要,价值来自把采集画面叙述成持久文本;接口也不是固定组件包,因为对较新的Gemini 3 Flash,关键帧流因图像token稀释效应反而降低表现,因此必须按模型选择组件,而不能发布一个统一配置。

来源:原文摘要许可

1. 方法动机

一次动作对应一张截图,会漏掉推理期间消失的提示、轮播内容或会议中的口头信息。增加以往截图历史不能恢复从未采集到的事件,因此本文将采集频率与代理动作频率分开。

直接把高帧率视频都塞给模型成本高,且旧图删除后内容仍会遗失。AOI 用廉价门控少采重复画面,并让代理在生成动作时顺带记下新信息;它补的是信息缺失,未承诺任何模型接入后都会更快。

2. 方法设计

  1. 连续采集并门控:后台约 3 Hz 采样屏幕,每步最多提供 5 张关键帧;默认采用像素变化比例门控,少于 1% 则跳过。Algorithm 1 的 CLIP 二级过滤只是比较变体,主结果默认没有该阶段。

  2. 独立处理语音:采集 16 kHz 单声道系统输出,RMS 能量低于阈值时跳过 ASR,有语音时用 Whisper large-v3 转成文字。跨步保留约 3.5 秒重叠,以避免句子被切断;铃声等非语音事件不会因此得到可靠语义识别。

  3. 生成可保留的视觉叙述:同一次计算机代理推理同时输出动作与新视觉信息的简短描述,无需额外调用描述模型。旧关键帧从上下文删去后,叙述继续保留,因此这属于文本记忆,不是对旧视觉编码的 KV 复用。

  4. 构造观察记录:将过去动作、叙述和语音文本,与本间隔的转录、关键帧及动作后截图合并。记录还含 DOM 元素列表等结构化内容,故静态情况下也并非与纯截图输入完全相同。

  5. 执行离散动作:主代理仍逐轮生成动作,后台观察覆盖推理与动作后的间隔。静默静态时大部分门控关闭;动态时新增图像、ASR 与输出叙述均可能增加耗时,强实时游戏尤其受影响。

  6. 验证各组件:DynaCU-Bench 含 100 个动态任务、10 类场景,另有 50 个静态控制任务;动态任务大多数用页面终态确定性评分。逐项关闭关键帧、转录和叙述,并增加只改观察格式的对照,分离新感知与提示格式收益。

方法依据:原文 §3.1–§3.6、Algorithm 1:连续观察接口

3. 与其他方法对比

对比对象 原有做法与局限 本文改变及代价
逐动作截图 动作之间的视觉与语音事件未被采集 后台持续采集,增加处理开销
CLIP 语义选帧 编码后按语义变化筛选 默认廉价像素门控;实验未显示复杂选帧明显更好
只保留近期图像 删图后丢失先前观察内容 同次推理写视觉叙述,保留文本历史
仅改变提示格式 元素表及历史组织也能改善表现 单独消融格式,避免将全部收益归于动态感知

4. 实验表现与优势

Table 2 中,Claude Sonnet 4.6 在 100 个动态任务上由 38% 到 82%,GPT-5.4 为 37%→57%,Fara-7B 为 17%→34%。主表多数配置每任务只跑一次;Claude 完整配置另两次复测为 78% 和 76%,故 82% 不是稳定无波动的常数。

Table 10 中,Claude 只改变结构化格式已从 38% 到 57%,完整观察才到 82%。Table 9 静态控制从 43/50 到 50/50,但几乎无额外感知触发,主要说明格式收益。较新 Gemini 3 Flash 的完整配置仅增 9 个百分点且检验不显著,不能说所有组件对所有模型都有效。

Table 7 明确区分省钱和变快:Claude 平均 token 估计从 7.6k 降为 3.8k,但整任务时间由 40.6 增至 46.2 秒;GPT-5.4 由 26.6 增至 50.6 秒;EvoCUA-32B 则从 117.0 降至 113.9 秒。新增观察成本可能超过少走步骤节省的推理时间。

数据来源:原文 §4–§6、Table 2;附录 Table 7、Tables 9–11

5. 学习与应用

开放状态:论文提供 AOI 仓库及项目网站,声明发布方法和基准。本轮依据论文核机制,不检查实现;费用表使用特定时期标价和 token 估计器,不应转述成当前实际 API 账单。

最小复现建议:先同时录屏与记录动作边界,复现约 3 Hz、1% 门控和每步最多 5 帧;再分别加语音和持久叙述。保持 DOM 列表与历史格式一致做消融,并报告完整时间、观察处理、模型推理、步骤数与成功率,特别单列会因反应窗口变窄而失败的任务。

6. 总结

核心思想:持续采集事件并写成文本记忆

速记流程:后台捕捉变化与语音 → 门控压低重复处理 → 生成持久叙述 → 将新证据交给行动代理

来源与核查:原始论文;已读 §3.1–§3.6、Algorithm 1:连续观察接口、§4–§6、Table 2、附录 Table 7、Tables 9–11;许可。作者资源:链接链接

7. 与当前“历史摘要+按需视觉证据”方案的关系

旧关键帧删除后保留叙述,同步观察动态页面,直接相似于历史图像转文字摘要。

本轮未取得可解析HTML图表,已保留正文原始PDF来源;不补造图号、表号或未公开参数。

本轮补核原方法图

AOI原文图3所在页

原PDF第4页的图3;展示屏幕变化门控、关键帧、音频转写和视觉叙述记忆怎样形成观察记录。不是单纯把动作后旧截图重传。

Open this note in the interactive notebook (comments, hooks) → · All notes