HiSA turns visual transitions into step summaries, periodically refined context, and reusable cross-task patterns.
Long raw histories repeatedly consume reasoning budget, while fixed windows can lose progress and persistent constraints.
The system separates three levels of state abstraction and coordinates planning, state management, and grounding.
A state manager summarizes the changed region between pre-action and post-action screenshots.
Every five steps, recent abstractions are merged into refined context that preserves milestones and current state.
Completed episodes yield reusable patterns, retrieved for new tasks together with expert-written procedures.
On the 207-task Spider2-V abstract subset, the reported success is 40.58%, with total token accounting split across planner, grounder, and state manager.
The paper also evaluates OSWorld at separate 50- and 100-step budgets; token and monetary savings are not measured full-task wall-clock speedups.
本笔记保留阅读时的论文版本、来源与实验边界。文中“你的方案/当前方案”等比较反映当时的讨论;当前研究方向见分类页。自拟例子与复现建议不是作者实验结果。
原论文 · 优先级 P0 · 复核日期:2026-09-07
与当前研究的关系:动作差分ROI给小模型摘要,三层状态和模型分工直接相邻。用户当前重心为同一任务的历史信息,跨任务经验另列条件,不能把两种记忆的收益混合。
摘要译文(依据本轮核查原文,CC BY 4.0许可):多模态GUI代理通常直接处理原始视觉和文本观察,由此产生根本性的可扩展性挑战。当前先进框架主要依靠推理密集的测试时扩展,或累积无界原始日志来保持任务连贯性;我们认为底层瓶颈在于状态抽象不足。为解决这一问题,我们提出HiSA,一种层次化状态抽象方法,将原始历史组织为抽象步骤、精炼上下文和归纳模式三个层级,从而主动重构知识,而非被动保留历史信息。HiSA把高维观察综合为紧凑语义状态,使推理效果与上下文长度解耦,在交互历史不断增长时仍能实现精确且可扩展的决策。在Spider2-V上评估时,我们的方法建立了新的最佳表现,成功率达到40.58%,相比表现最好的基线,token消耗降低69.85%,货币成本降低55.10%。
把所有原始视觉历史长期塞进上下文会增加推理成本,而只留最近窗口可能丢掉进度与关键约束。HiSA 试图保留历史的任务含义,让规划器不用每轮重新理解全部截图。
跨任务重复探索也会增加步骤。方法进一步从结果中提炼条件、动作序列和预期效果,用经验指导新任务;这部分还结合专家编写 SOP,不能把全部收益解释为自动记忆压缩。
全局规划与定位分工:规划器接收当前截图及分层上下文,输出工具和参数,可选择 GUI、bash、等待、成功终止或有理由的不可行。无坐标动作直接执行,需要坐标时把语义目标交给 GTA1-7B 定位并填入代码占位符。
抽象单步视觉变化:状态管理器比较动作前后截图,取所有非零像素差的最小包围框作为 ROI,再结合执行动作总结结果及意图是否实现。它仍需要两张实际截图和一次语义分析,不是缓存未变区域的视觉编码。
定期精炼历史:每 5 步将近期抽象步骤与已有精炼上下文重新合并,保留里程碑和当前状态,去掉重复细节。输入增长因此被缓解,但模型总结错误也可能永久遗漏原始证据。
终止后诱导经验模式:分析成功子目标和关键失败,生成条件、动作序列、预期结果;以嵌入余弦相似度去重,较相似新模式替换旧条目。失败模式作为后续约束,成功模式作为可参考流程。
新任务检索并综合:按领域向量库取 Top-5、相似阈值 0.5,结合专家 SOP 形成指导;存储去重阈值 0.7。SOP 会包含如 Jupyter 必须执行并保存单元格等评价相关要求,属于额外先验。
固定模块与观察设置:主要配置为 GPT-5 规划、GPT-5-mini 状态管理、GTA1-7B 定位,截图 1280×720,温度 0。比较 token 和价格时计入各模块,不能只看规划器缩短后的提示。
方法依据:原文 §3.1–§3.4:三层状态抽象。
完成一次筛选后只有右侧列表变化,先总结变化区域,再每5步合并进度。若合并抹掉某行条件,新的证据库应允许找到该ROI,而不是再次从头浏览。
| 项目 | 本文实际范围 |
|---|---|
| 记忆来源 | 同任务单步摘要与周期精炼+跨任务模式 |
| 与本方案相同或不同 | 动作差分ROI给小模型摘要,三层状态和模型分工直接相邻 |
| 应固定的对照条件 | 在相同规划器定位器下比较HiSA摘要与摘要+可回查视觉证据;计状态管理成本。 |
训练、模型规模、具体输入输出及调用次数见各方法小节;没有查明的参数不填入建议值冒充原文默认值。
| 对比对象 | 原有做法与局限 | 本文改变及代价 |
|---|---|---|
| 累积原始历史 | 视觉和文字输入持续增长 | 步骤语义化并周期合并,增加摘要调用 |
| 固定最近窗口 | 旧目标和中间结果易丢失 | 精炼上下文保留长期进度 |
| 只做截图裁剪 | 降低局部视觉冗余但不组织任务状态 | ROI 后进一步总结并形成长期模式 |
| 无跨任务经验 | 重复试错探索 | 检索诱导模式及专家 SOP,依赖经验质量 |
Table 1 在 Spider2-V 的 207 项 abstract 子集上,HiSA 为 40.58%±0.97,Agent S3 为 38.96%;平均总 token 为 183.05k 对 607.18k,费用为 0.44 对 0.98 美元,步骤为 15.34 对 23.82。HiSA 为两次运行均值,基线按统一设置复现;并非完整 494 个任务。
Table 4 将 183.05k 拆为规划器 101.27k、定位器 32.51k、状态管理器 49.27k,明确抽象有成本。Table 2 的 OSWorld 为 50 步 58.7%、100 步 59.3%,不能只报 59.3% 却写成 50 步结果。
消融显示去掉 ROI 或步骤抽象都会增加 token,支持减少冗余的机制;但自动摘要可能丢信息,ROI 对全屏微小动画也可能扩大。论文主要效率单位是 token、费用和步骤,没有完整墙钟测量,故 69.85% 省 token 不能写成同幅度加速。
数据来源:原文 §4.1–§4.5、Tables 1–4;§4.6;附录 C。
开放状态:论文脚注链接 HiSA 仓库,附录说明实现 MIT 许可;本轮不检查代码。正式来源是 ACL 2026 Findings,不能混报主会论文。
最小复现建议:先固定一个跨应用任务,对比原始历史、滑窗、单步摘要和完整三层结构;保留摘要前后的证据以审计信息丢失。分列状态管理和模式生成成本,锁定 SOP 与经验库初态,再测真实墙钟,防止经验积累顺序影响对照。
核心思想:把视觉历史分层压成任务状态
速记流程:比较动作前后画面 → 总结单步结果 → 定期精炼长期上下文 → 提炼并检索跨任务模式
来源与核查:原始论文;已读 §3.1–§3.4:三层状态抽象、§4.1–§4.5、Tables 1–4、§4.6;附录 C;许可。作者资源:链接。
在相同规划器定位器下比较HiSA摘要与摘要+可回查视觉证据;计状态管理成本。
不能把检索到的旧图片直接当作当前可点击坐标。历史图可证明过去出现过什么;当前动作的位置和状态必须由当前观察核验。研究评估需区分过去事实回忆正确、当前状态有效和最终动作正确三个环节。
当前来源为PDF或未提供可单独解析的图片链接;在原文中查看方法图。不使用自绘图冒充原图。
该来源本轮没有可靠的HTML表格单元格;已在实验节列出核过的关键数据。完整原表见PDF/正文。不猜测缺失表格行。
Open this note in the interactive notebook (comments, hooks) → · All notes