Artificial Intelligence
Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
12,841 to 12,900 of 15,400
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
Wenbo Hu, Xin Chen, Yan Gao-Tian +3
cs.CVcs.AIcs.CLarXiv:2604.08539v22026DMax: Aggressive Parallel Decoding for dLLMs
Zigeng Chen, Gongfan Fang, Xinyin Ma +2
cs.LGcs.AIarXiv:2604.08302v32026LPM 1.0: Video-based Character Performance Model
Ailing Zeng, Casper Yang, Chauncey Ge +22
cs.CVcs.AIcs.MMarXiv:2604.07823v22026ClawBench: Can AI Agents Complete Everyday Online Tasks?
Yuxuan Zhang, Yubo Wang, Yipeng Zhu +25
cs.CLcs.AIarXiv:2604.08523v22026SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
Ziyu Ma, Shidong Yang, Yuxiang Ji +5
cs.AIcs.CLarXiv:2604.08377v22026AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
Ziwei Zhou, Zeyuan Lai, Rui Wang +6
cs.CVcs.AIcs.CLarXiv:2604.08540v12026Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha +2
cs.CVcs.AIarXiv:2604.08476v120263D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou
cs.CVcs.AIcs.LGarXiv:2604.08645v12026EquiformerV3: Scaling Efficient, Expressive, and General SE(3)-Equivariant Graph Attention Transformers
Yi-Lun Liao, Alexander J. Hoffman, Sabrina C. Shen +3
cs.LGcs.AIphysics.comp-pharXiv:2604.09130v12026Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types
Hadas Orgad, Boyi Wei, Kaden Zheng +4
cs.CLcs.AIcs.LGarXiv:2604.09544v22026ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion
Lifeng Chen, Tianqi You, Hao Liu +8
cs.LGcs.AIeess.IVarXiv:2604.09450v22026Many-Tier Instruction Hierarchy in LLM Agents
Jingyu Zhang, Tianjian Li, William Jurayj +3
cs.CLcs.AIarXiv:2604.09443v32026A Temporally Augmented Graph Attention Network for Affordance Classification
Ami Chopra, Supriya Bordoloi, Shyamanta M. Hazarika
cs.LGcs.AIarXiv:2604.10149v12026TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training
Yinyi Luo, Wenwen Wang, Hayes Bai +6
cs.AIarXiv:2604.10784v22026ADD for Multi-Bit Image Watermarking
An Luo, Jie Ding
stat.MLcs.AIcs.LGarXiv:2604.11491v12026Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series
Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas +2
cs.CLcs.AIarXiv:2604.10799v12026How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models
Gregory N. Frank
cs.CLcs.AIcs.LGarXiv:2604.04385v52026Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +15
cs.SDcs.AIcs.CLarXiv:2604.10905v12026Universal statistical signatures of evolution in artificial intelligence architectures
Theodor Spiro
q-bio.PEcs.AIcs.CYarXiv:2604.10571v12026Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
Hanqi Xiao, Vaidehi Patil, Zaid Khan +3
cs.CLcs.AIcs.LGarXiv:2604.11666v22026Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation
Sandro Andric
cs.LGcs.AIcs.CYarXiv:2604.11840v32026Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
Zeyue Tian, Binxin Yang, Zhaoyang Liu +8
cs.SDcs.AIcs.CVarXiv:2604.10708v22026Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
Mihir Prabhudesai, Aryan Satpathy, Yangmin Li +6
cs.LGcs.AIcs.CVarXiv:2604.11805v12026SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering
Ningyan Zhu, Huacan Wang, Jie Zhou +8
cs.AIarXiv:2604.11548v12026Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong +45
cs.AIcs.CLcs.CVarXiv:2604.11490v22026SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
Tianyi Wang, Yixia Li, Long Li +6
cs.AIarXiv:2604.08865v12026Zero-shot World Models Are Developmentally Efficient Learners
Khai Loong Aw, Klemen Kotar, Wanhee Lee +6
cs.AIcs.CVarXiv:2604.10333v12026SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?
Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie +14
cs.AIarXiv:2604.10718v12026IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
Yuzhen Mao, Qitong Wang, Martin Ester +1
cs.LGcs.AIarXiv:2604.10539v12026Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
Yu Li, Xiaoran Shang, Qizhi Pei +11
cs.AIarXiv:2604.10480v12026The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
Xuwei Ding, Skylar Zhai, Linxin Song +6
cs.CRcs.AIarXiv:2604.10577v22026Rethinking the Diffusion Model from a Langevin Perspective
Candi Zheng, Yuan Lan
cs.LGcs.AIcs.CVarXiv:2604.10465v12026Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
Zhipeng Chen, Tao Qian, Wayne Xin Zhao +1
cs.LGcs.AIcs.CLarXiv:2604.11446v12026Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory
Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang +2
cs.CLcs.AIarXiv:2604.11544v12026SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context
Shuquan Lian, Juncheng Liu, Yazhe Chen +2
cs.AIcs.CLarXiv:2604.11716v12026Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization
Zhixin Lin, Jungang Li, Dongliang Xu +5
cs.AIcs.CRarXiv:2604.11259v12026General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
Junlin Liu, Shengnan An, Shuang Zhou +10
cs.CLcs.AIarXiv:2604.11778v12026Introspective Diffusion Language Models
Yifan Yu, Yuqing Jian, Junxiong Wang +12
cs.AIarXiv:2604.11035v12026CocoaBench: Evaluating Unified Digital Agents in the Wild
CocoaBench Team, Shibo Hao, Zhining Zhang +29
cs.CLcs.AIarXiv:2604.11201v22026Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
Songlin Yang, Xianghao Kong, Anyi Rao
cs.CVcs.AIarXiv:2604.10949v12026CodeTracer: Towards Traceable Agent States
Han Li, Yifan Yao, Letian Zhu +13
cs.SEcs.AIarXiv:2604.11641v32026The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
Yang Liu, Enxi Wang, Yufei Gao +6
cs.LGcs.AIcs.CLarXiv:2604.11297v12026You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
Yinuo Yang, Zixian Ma, Manasi Ganti +2
cs.CVcs.AIarXiv:2604.10966v22026LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
Junxiao Yang, Haoran Liu, Jinzhe Tu +9
cs.LGcs.AIcs.CLarXiv:2604.12710v22026ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
Fei Tang, Zhiqiong Lu, Boxuan Zhang +4
cs.LGcs.AIcs.CLarXiv:2604.11784v12026Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
Yunkai Zhang, Linda Li, Yingxin Cui +5
cs.CVcs.AIarXiv:2604.09687v22026Motif-Video 2B: Technical Report
Junghwan Lim, Wai Ting Cheung, Minsu Ha +25
cs.CVcs.AIarXiv:2604.16503v22026Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective
Weijie Wang, Qihang Cao, Sensen Gao +10
cs.CVcs.AIcs.GRarXiv:2604.14025v12026Mobile GUI Agents under Real-world Threats: Are We There Yet?
Guohong Liu, Jialei Ye, Jiacheng Liu +5
cs.CRcs.AIarXiv:2507.04227v22025ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack
Yein Park, Jungwoo Park, Jaewoo Kang
cs.AIarXiv:2509.25843v22025Towards Autonomous Mechanistic Reasoning in Virtual Cells
Yunhui Jang, Lu Zhu, Jake Fawkes +3
cs.LGcs.AIarXiv:2604.11661v32026RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
Jenai Xuning Yang, Rishit Dagli, Alex Zook +5
cs.ROcs.AIarXiv:2604.09860v42026TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration
Zerun Ma, Guoqiang Wang, Xinchen Xie +7
cs.AIcs.CLarXiv:2604.14116v22026MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
Han Wang, David Wan, Hyunji Lee +6
cs.CLcs.AIcs.CVarXiv:2604.13418v12026Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution
Sebastian Cajas, Ashaba Judith, Rahul Gorijavolu +8
cs.CVcs.AIarXiv:2604.12152v12026Towards Long-horizon Agentic Multimodal Search
Yifan Du, Zikang Liu, Jinbiao Peng +5
cs.CVcs.AIarXiv:2604.12890v22026Exploration and Exploitation Errors Are Measurable for Language Model Agents
Jaden Park, Jungtaek Kim, Jongwon Jeong +3
cs.AIarXiv:2604.13151v12026Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems
Jiacheng Liu, Xiaohan Zhao, Xinyi Shang +1
cs.SEcs.AIcs.CLarXiv:2604.14228v22026InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
Oliver Bentham, Vivek Srikumar
cs.CLcs.AIarXiv:2604.13201v22026Forge-UGC: FX optimization and register-graph engine for universal graph compiler
Satyam Kumar, Saurabh Jha
cs.ARcs.AIcs.DCarXiv:2604.16498v12026