Artificial Intelligence
Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
12,901 to 12,960 of 15,437
SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering
Ningyan Zhu, Huacan Wang, Jie Zhou +8
cs.AIarXiv:2604.11548v12026Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong +45
cs.AIcs.CLcs.CVarXiv:2604.11490v22026SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
Tianyi Wang, Yixia Li, Long Li +6
cs.AIarXiv:2604.08865v12026Zero-shot World Models Are Developmentally Efficient Learners
Khai Loong Aw, Klemen Kotar, Wanhee Lee +6
cs.AIcs.CVarXiv:2604.10333v12026SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?
Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie +14
cs.AIarXiv:2604.10718v12026IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
Yuzhen Mao, Qitong Wang, Martin Ester +1
cs.LGcs.AIarXiv:2604.10539v12026Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
Yu Li, Xiaoran Shang, Qizhi Pei +11
cs.AIarXiv:2604.10480v12026The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
Xuwei Ding, Skylar Zhai, Linxin Song +6
cs.CRcs.AIarXiv:2604.10577v22026Rethinking the Diffusion Model from a Langevin Perspective
Candi Zheng, Yuan Lan
cs.LGcs.AIcs.CVarXiv:2604.10465v12026Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
Zhipeng Chen, Tao Qian, Wayne Xin Zhao +1
cs.LGcs.AIcs.CLarXiv:2604.11446v12026Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory
Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang +2
cs.CLcs.AIarXiv:2604.11544v12026SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context
Shuquan Lian, Juncheng Liu, Yazhe Chen +2
cs.AIcs.CLarXiv:2604.11716v12026Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization
Zhixin Lin, Jungang Li, Dongliang Xu +5
cs.AIcs.CRarXiv:2604.11259v12026General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
Junlin Liu, Shengnan An, Shuang Zhou +10
cs.CLcs.AIarXiv:2604.11778v12026Introspective Diffusion Language Models
Yifan Yu, Yuqing Jian, Junxiong Wang +12
cs.AIarXiv:2604.11035v12026CocoaBench: Evaluating Unified Digital Agents in the Wild
CocoaBench Team, Shibo Hao, Zhining Zhang +29
cs.CLcs.AIarXiv:2604.11201v22026Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
Songlin Yang, Xianghao Kong, Anyi Rao
cs.CVcs.AIarXiv:2604.10949v12026CodeTracer: Towards Traceable Agent States
Han Li, Yifan Yao, Letian Zhu +13
cs.SEcs.AIarXiv:2604.11641v32026The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
Yang Liu, Enxi Wang, Yufei Gao +6
cs.LGcs.AIcs.CLarXiv:2604.11297v12026You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
Yinuo Yang, Zixian Ma, Manasi Ganti +2
cs.CVcs.AIarXiv:2604.10966v22026LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
Junxiao Yang, Haoran Liu, Jinzhe Tu +9
cs.LGcs.AIcs.CLarXiv:2604.12710v22026ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
Fei Tang, Zhiqiong Lu, Boxuan Zhang +4
cs.LGcs.AIcs.CLarXiv:2604.11784v12026Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
Yunkai Zhang, Linda Li, Yingxin Cui +5
cs.CVcs.AIarXiv:2604.09687v22026Motif-Video 2B: Technical Report
Junghwan Lim, Wai Ting Cheung, Minsu Ha +25
cs.CVcs.AIarXiv:2604.16503v22026Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective
Weijie Wang, Qihang Cao, Sensen Gao +10
cs.CVcs.AIcs.GRarXiv:2604.14025v12026Mobile GUI Agents under Real-world Threats: Are We There Yet?
Guohong Liu, Jialei Ye, Jiacheng Liu +5
cs.CRcs.AIarXiv:2507.04227v22025ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack
Yein Park, Jungwoo Park, Jaewoo Kang
cs.AIarXiv:2509.25843v22025Towards Autonomous Mechanistic Reasoning in Virtual Cells
Yunhui Jang, Lu Zhu, Jake Fawkes +3
cs.LGcs.AIarXiv:2604.11661v32026RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
Jenai Xuning Yang, Rishit Dagli, Alex Zook +5
cs.ROcs.AIarXiv:2604.09860v42026TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration
Zerun Ma, Guoqiang Wang, Xinchen Xie +7
cs.AIcs.CLarXiv:2604.14116v22026MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
Han Wang, David Wan, Hyunji Lee +6
cs.CLcs.AIcs.CVarXiv:2604.13418v12026Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution
Sebastian Cajas, Ashaba Judith, Rahul Gorijavolu +8
cs.CVcs.AIarXiv:2604.12152v12026Towards Long-horizon Agentic Multimodal Search
Yifan Du, Zikang Liu, Jinbiao Peng +5
cs.CVcs.AIarXiv:2604.12890v22026Exploration and Exploitation Errors Are Measurable for Language Model Agents
Jaden Park, Jungtaek Kim, Jongwon Jeong +3
cs.AIarXiv:2604.13151v12026Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems
Jiacheng Liu, Xiaohan Zhao, Xinyi Shang +1
cs.SEcs.AIcs.CLarXiv:2604.14228v22026InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
Oliver Bentham, Vivek Srikumar
cs.CLcs.AIarXiv:2604.13201v22026Forge-UGC: FX optimization and register-graph engine for universal graph compiler
Satyam Kumar, Saurabh Jha
cs.ARcs.AIcs.DCarXiv:2604.16498v12026UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
Fei Tang, Bofan Chen, Zhengxi Lu +8
cs.CVcs.AIcs.CLarXiv:2604.14113v12026Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents
Kangsan Kim, Minki Kang, Taeil Kim +3
cs.AIcs.CLarXiv:2604.14004v12026TIP: Token Importance in On-Policy Distillation
Yuanda Xu, Hejian Sang, Zhengze Zhou +3
cs.LGcs.AIarXiv:2604.14084v42026From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
Yuqiao Tan, Minzheng Wang, Bo Liu +5
cs.LGcs.AIcs.CLarXiv:2604.14142v12026Three-Phase Transformer
Mohammad R. Abu Ayyash
cs.CLcs.AIcs.LGarXiv:2604.14430v12026(1D) Ordered Tokens Enable Efficient Test-Time Search
Zhitong Gao, Parham Rezaei, Ali Cy +7
cs.CVcs.AIcs.LGarXiv:2604.15453v12026RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography
Mélanie Roschewitz, Kenneth Styppa, Yitian Tao +10
cs.AIarXiv:2604.15231v22026HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System
Tianshuo Yang, Guanyu Chen, Yutian Chen +8
cs.CVcs.AIcs.ROarXiv:2604.14125v22026WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training
Yifu Chen, Shengpeng Ji, Qian Chen +9
cs.AIarXiv:2604.14932v12026MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
Yan Li, Zezi Zeng, Yifan Yang +12
cs.CVcs.AIcs.CLarXiv:2604.15309v12026TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM Classification
Adam Rida
cs.AIarXiv:2604.14531v12026OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
Kanzhi Cheng, Zehao Li, Zheng Ma +11
cs.AIcs.CLcs.CVarXiv:2604.15093v12026Where does output diversity collapse in post-training?
Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras
cs.CLcs.AIcs.LGarXiv:2604.16027v12026Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents
Yining Hong, Yining She, Eunsuk Kang +2
cs.SEcs.AIcs.CRarXiv:2604.15579v22026Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1
cs.CVcs.AIarXiv:2604.16060v12026GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
Wangjie Gan, Miao Pan, Linbo Xi +4
cs.AIcs.LGarXiv:2604.14258v32026Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG
Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh
cs.IRcs.AIcs.CLarXiv:2604.14572v32026DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
Qianqian Xie, Qingheng Xiong, He Zhu +16
cs.AIarXiv:2604.14683v12026PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
Tingjia Miao, Wenkai Jin, Muhua Zhang +19
cs.LGcs.AIphysics.data-anarXiv:2604.15411v12026Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips
Ido Galil, Moshe Kimhi, Ran El-Yaniv
cs.LGcs.AIcs.CVarXiv:2502.07408v22025VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
Xiangbo Gao, Sicong Jiang, Bangya Liu +12
cs.CVcs.AIcs.CLarXiv:2604.16272v22026GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
Jize Wang, Xuanxuan Liu, Yining Li +7
cs.CLcs.AIarXiv:2604.15715v12026Mind DeepResearch Technical Report
MindDR Team, Li Auto Inc
cs.AIarXiv:2604.14518v22026