Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,841 to 12,900 of 15,400

  1. OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

    Wenbo Hu, Xin Chen, Yan Gao-Tian +3

    cs.CVcs.AIcs.CLarXiv:2604.08539v22026
  2. DMax: Aggressive Parallel Decoding for dLLMs

    Zigeng Chen, Gongfan Fang, Xinyin Ma +2

    cs.LGcs.AIarXiv:2604.08302v32026
  3. LPM 1.0: Video-based Character Performance Model

    Ailing Zeng, Casper Yang, Chauncey Ge +22

    cs.CVcs.AIcs.MMarXiv:2604.07823v22026
  4. ClawBench: Can AI Agents Complete Everyday Online Tasks?

    Yuxuan Zhang, Yubo Wang, Yipeng Zhu +25

    cs.CLcs.AIarXiv:2604.08523v22026
  5. SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

    Ziyu Ma, Shidong Yang, Yuxiang Ji +5

    cs.AIcs.CLarXiv:2604.08377v22026
  6. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

    Ziwei Zhou, Zeyuan Lai, Rui Wang +6

    cs.CVcs.AIcs.CLarXiv:2604.08540v12026
  7. Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

    Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha +2

    cs.CVcs.AIarXiv:2604.08476v12026
  8. 3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

    Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou

    cs.CVcs.AIcs.LGarXiv:2604.08645v12026
  9. EquiformerV3: Scaling Efficient, Expressive, and General SE(3)-Equivariant Graph Attention Transformers

    Yi-Lun Liao, Alexander J. Hoffman, Sabrina C. Shen +3

    cs.LGcs.AIphysics.comp-pharXiv:2604.09130v12026
  10. Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

    Hadas Orgad, Boyi Wei, Kaden Zheng +4

    cs.CLcs.AIcs.LGarXiv:2604.09544v22026
  11. ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion

    Lifeng Chen, Tianqi You, Hao Liu +8

    cs.LGcs.AIeess.IVarXiv:2604.09450v22026
  12. Many-Tier Instruction Hierarchy in LLM Agents

    Jingyu Zhang, Tianjian Li, William Jurayj +3

    cs.CLcs.AIarXiv:2604.09443v32026
  13. A Temporally Augmented Graph Attention Network for Affordance Classification

    Ami Chopra, Supriya Bordoloi, Shyamanta M. Hazarika

    cs.LGcs.AIarXiv:2604.10149v12026
  14. TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

    Yinyi Luo, Wenwen Wang, Hayes Bai +6

    cs.AIarXiv:2604.10784v22026
  15. ADD for Multi-Bit Image Watermarking

    An Luo, Jie Ding

    stat.MLcs.AIcs.LGarXiv:2604.11491v12026
  16. Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

    Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas +2

    cs.CLcs.AIarXiv:2604.10799v12026
  17. How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models

    Gregory N. Frank

    cs.CLcs.AIcs.LGarXiv:2604.04385v52026
  18. Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

    Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +15

    cs.SDcs.AIcs.CLarXiv:2604.10905v12026
  19. Universal statistical signatures of evolution in artificial intelligence architectures

    Theodor Spiro

    q-bio.PEcs.AIcs.CYarXiv:2604.10571v12026
  20. Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind

    Hanqi Xiao, Vaidehi Patil, Zaid Khan +3

    cs.CLcs.AIcs.LGarXiv:2604.11666v22026
  21. Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

    Sandro Andric

    cs.LGcs.AIcs.CYarXiv:2604.11840v32026
  22. Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

    Zeyue Tian, Binxin Yang, Zhaoyang Liu +8

    cs.SDcs.AIcs.CVarXiv:2604.10708v22026
  23. Solving Physics Olympiad via Reinforcement Learning on Physics Simulators

    Mihir Prabhudesai, Aryan Satpathy, Yangmin Li +6

    cs.LGcs.AIcs.CVarXiv:2604.11805v12026
  24. SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering

    Ningyan Zhu, Huacan Wang, Jie Zhou +8

    cs.AIarXiv:2604.11548v12026
  25. Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

    Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong +45

    cs.AIcs.CLcs.CVarXiv:2604.11490v22026
  26. SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

    Tianyi Wang, Yixia Li, Long Li +6

    cs.AIarXiv:2604.08865v12026
  27. Zero-shot World Models Are Developmentally Efficient Learners

    Khai Loong Aw, Klemen Kotar, Wanhee Lee +6

    cs.AIcs.CVarXiv:2604.10333v12026
  28. SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?

    Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie +14

    cs.AIarXiv:2604.10718v12026
  29. IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs

    Yuzhen Mao, Qitong Wang, Martin Ester +1

    cs.LGcs.AIarXiv:2604.10539v12026
  30. Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs

    Yu Li, Xiaoran Shang, Qizhi Pei +11

    cs.AIarXiv:2604.10480v12026
  31. The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents

    Xuwei Ding, Skylar Zhai, Linxin Song +6

    cs.CRcs.AIarXiv:2604.10577v22026
  32. Rethinking the Diffusion Model from a Langevin Perspective

    Candi Zheng, Yuan Lan

    cs.LGcs.AIcs.CVarXiv:2604.10465v12026
  33. Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration

    Zhipeng Chen, Tao Qian, Wayne Xin Zhao +1

    cs.LGcs.AIcs.CLarXiv:2604.11446v12026
  34. Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

    Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang +2

    cs.CLcs.AIarXiv:2604.11544v12026
  35. SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context

    Shuquan Lian, Juncheng Liu, Yazhe Chen +2

    cs.AIcs.CLarXiv:2604.11716v12026
  36. Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

    Zhixin Lin, Jungang Li, Dongliang Xu +5

    cs.AIcs.CRarXiv:2604.11259v12026
  37. General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

    Junlin Liu, Shengnan An, Shuang Zhou +10

    cs.CLcs.AIarXiv:2604.11778v12026
  38. Introspective Diffusion Language Models

    Yifan Yu, Yuqing Jian, Junxiong Wang +12

    cs.AIarXiv:2604.11035v12026
  39. CocoaBench: Evaluating Unified Digital Agents in the Wild

    CocoaBench Team, Shibo Hao, Zhining Zhang +29

    cs.CLcs.AIarXiv:2604.11201v22026
  40. Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

    Songlin Yang, Xianghao Kong, Anyi Rao

    cs.CVcs.AIarXiv:2604.10949v12026
  41. CodeTracer: Towards Traceable Agent States

    Han Li, Yifan Yao, Letian Zhu +13

    cs.SEcs.AIarXiv:2604.11641v32026
  42. The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping

    Yang Liu, Enxi Wang, Yufei Gao +6

    cs.LGcs.AIcs.CLarXiv:2604.11297v12026
  43. You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass

    Yinuo Yang, Zixian Ma, Manasi Ganti +2

    cs.CVcs.AIarXiv:2604.10966v22026
  44. LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

    Junxiao Yang, Haoran Liu, Jinzhe Tu +9

    cs.LGcs.AIcs.CLarXiv:2604.12710v22026
  45. ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

    Fei Tang, Zhiqiong Lu, Boxuan Zhang +4

    cs.LGcs.AIcs.CLarXiv:2604.11784v12026
  46. Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

    Yunkai Zhang, Linda Li, Yingxin Cui +5

    cs.CVcs.AIarXiv:2604.09687v22026
  47. Motif-Video 2B: Technical Report

    Junghwan Lim, Wai Ting Cheung, Minsu Ha +25

    cs.CVcs.AIarXiv:2604.16503v22026
  48. Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

    Weijie Wang, Qihang Cao, Sensen Gao +10

    cs.CVcs.AIcs.GRarXiv:2604.14025v12026
  49. Mobile GUI Agents under Real-world Threats: Are We There Yet?

    Guohong Liu, Jialei Ye, Jiacheng Liu +5

    cs.CRcs.AIarXiv:2507.04227v22025
  50. ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

    Yein Park, Jungwoo Park, Jaewoo Kang

    cs.AIarXiv:2509.25843v22025
  51. Towards Autonomous Mechanistic Reasoning in Virtual Cells

    Yunhui Jang, Lu Zhu, Jake Fawkes +3

    cs.LGcs.AIarXiv:2604.11661v32026
  52. RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies

    Jenai Xuning Yang, Rishit Dagli, Alex Zook +5

    cs.ROcs.AIarXiv:2604.09860v42026
  53. TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

    Zerun Ma, Guoqiang Wang, Xinchen Xie +7

    cs.AIcs.CLarXiv:2604.14116v22026
  54. MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

    Han Wang, David Wan, Hyunji Lee +6

    cs.CLcs.AIcs.CVarXiv:2604.13418v12026
  55. Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution

    Sebastian Cajas, Ashaba Judith, Rahul Gorijavolu +8

    cs.CVcs.AIarXiv:2604.12152v12026
  56. Towards Long-horizon Agentic Multimodal Search

    Yifan Du, Zikang Liu, Jinbiao Peng +5

    cs.CVcs.AIarXiv:2604.12890v22026
  57. Exploration and Exploitation Errors Are Measurable for Language Model Agents

    Jaden Park, Jungtaek Kim, Jongwon Jeong +3

    cs.AIarXiv:2604.13151v12026
  58. Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems

    Jiacheng Liu, Xiaohan Zhao, Xinyi Shang +1

    cs.SEcs.AIcs.CLarXiv:2604.14228v22026
  59. InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

    Oliver Bentham, Vivek Srikumar

    cs.CLcs.AIarXiv:2604.13201v22026
  60. Forge-UGC: FX optimization and register-graph engine for universal graph compiler

    Satyam Kumar, Saurabh Jha

    cs.ARcs.AIcs.DCarXiv:2604.16498v12026