Research notes
37 notes · interactive index with search and filters
- Beyond OAuth: Task-Scoped Authorization for AI Agents via Natural Language SlicesReshabh K Sharma, Linxi Jiang, Shuo Chen, Zhiqiang Lin · arXiv preprint · 2026 · Agent security
- Progent: Securing AI Agents with Privilege ControlTianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song · arXiv preprint · 2025, revised 2026 · Agent security
- Delegated Authorization for Agents Constrained to Semantic Task-to-Scope MatchingMajed El Helou, Chiara Troiani, Benjamin Ryder, Jean Diaconu, Hervé Muyal, Marcelo Yannuzzi · arXiv preprint · 2025 · Agent security
- MiniScope: A Least Privilege Framework for Authorizing Tool Calling AgentsJinhao Zhu, Kevin Tseng, Gil Vernik, Xiao Huang, Shishir G. Patil, Vivian Fang, Raluca Ada Popa · arXiv preprint · 2025 · Agent security
- OAuth 2.0 Rich Authorization RequestsTorsten Lodderstedt, Justin Richer, Brian Campbell · IETF RFC 9396 · Proposed Standard · May 2023 · Agent security
- Critique of Agent ModelEric Xing, Mingkai Deng, Jinyu Hou · arXiv preprint · 2026 · Models & methods
- CogAgent: A Visual Language Model for GUI AgentsWenyi Hong, Weihan Wang, Qingsong Lv et al. · CVPR 2024 · GUI agents
- You Only Look at Screens: Multimodal Chain-of-Action AgentsZhuosheng Zhang and Aston Zhang · Findings of ACL 2024 · GUI agents
- SeeClick: Harnessing GUI Grounding for Advanced Visual GUI AgentsKanzhi Cheng, Qiushi Sun, Yougang Chu et al. · ACL 2024 · GUI agents
- OS-ATLAS: A Foundation Action Model for Generalist GUI AgentsZhiyong Wu, Zhenyu Wu, Fangzhi Xu et al. · ICLR 2025 · GUI agents
- Aguvis: Unified Pure Vision Agents for Autonomous GUI InteractionYiheng Xu, Zekun Wang, Junli Wang et al. · ICML 2025 · GUI agents
- UI-TARS: Pioneering Automated GUI Interaction with Native AgentsYujia Qin, Yining Ye, Junjie Fang et al. · arXiv preprint, 2025 · GUI agents
- AutoDroid: LLM-powered Task Automation in AndroidHao Wen, Yuanchun Li, Guohong Liu et al. · ACM MobiCom 2024 · GUI agents
- Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. ScreenshotsShiquan Zhang, Tianyi Zhang, Le Fang et al. · arXiv preprint, 2026 · GUI agents
- OmniParser for Pure Vision Based GUI AgentYadong Lu, Jianwei Yang, Yelong Shen et al. · arXiv preprint, 2024 · GUI agents
- CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI AutomationXinbei Ma, Zhuosheng Zhang, Hai Zhao · Findings of ACL 2024 · GUI agents
- GUI-Actor: Coordinate-Free Visual Grounding for GUI AgentsQianhui Wu, Kanzhi Cheng, Rui Yang et al. · NeurIPS 2025 · GUI agents
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis et al. · ICLR 2022 · Models & methods
- FastVLM: Efficient Vision Encoding for Vision Language ModelsPavan Kumar Anasosalu Vasu, Fartash Faghri, Chun-Liang Li, et al. · CVPR 2025 · Models & methods
- TinyClick: Single-Turn Agent for Empowering GUI AutomationPawel Pawlowski, Krystian Zawistowski, Wojciech Lapacz, et al. · Interspeech 2025 · GUI agents
- ShowUI: One Vision-Language-Action Model for GUI Visual AgentKevin Qinghong Lin, Linjie Li, Difei Gao, et al. · CVPR 2025 · GUI agents
- Qwen2.5 Technical ReportQwen Team (An Yang et al.) · arXiv technical report, 2024; revised 2025 · Models & methods
- Android in the Zoo: Chain-of-Action-Thought for GUI AgentsJiwen Zhang, Jihao Wu, Yihua Teng, et al. · Findings of EMNLP 2024 · GUI agents
- GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile DevicesQuanfeng Lu, Wenqi Shao, Zitao Liu, et al. · ICCV 2025 · GUI agents
- Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI AgentsHanzhang Zhou, Panrong Tong, Xu Zhang, et al. · arXiv technical report, 2026 · GUI agents
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer EnvironmentsXie, Zhang, Chen et al. · NeurIPS 2024 Datasets & Benchmarks · GUI agents
- Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI AgentsGou, Wang, Zheng et al. · ICLR 2025 · GUI agents
- Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4VYang, Zhang, Li et al. · arXiv 2023 · GUI agents
- GPT-4V(ision) is a Generalist Web Agent, if GroundedZheng, Gou, Kil et al. · ICML 2024 · GUI agents
- Mind2Web: Towards a Generalist Agent for the WebDeng, Gu, Zheng et al. · NeurIPS 2023 Datasets & Benchmarks · GUI agents
- WebArena: A Realistic Web Environment for Building Autonomous AgentsZhou, Xu, Zhu et al. · ICLR 2024 · GUI agents
- AndroidWorld: A Dynamic Benchmarking Environment for Autonomous AgentsRawles, Clinckemaillie, Chang et al. · ICLR 2025 · GUI agents
- AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM AgentsDebenedetti, Zhang, Balunović et al. · NeurIPS 2024 Datasets & Benchmarks · Agent security
- Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt InjectionGreshake, Abdelnabi, Mishra et al. · AISec 2023 (ACM CCS workshop) · Agent security
- Identifying the Risks of LM Agents with an LM-Emulated SandboxRuan, Dong, Wang et al. · ICLR 2024 · Agent security
- AgentHarm: A Benchmark for Measuring Harmfulness of LLM AgentsAndriushchenko, Souly, Dziemian et al. · ICLR 2025 · Agent security
- Agent-SafetyBench: Evaluating the Safety of LLM AgentsZhang, Cui, Lu et al. · AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent) · Agent security