Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,301 to 12,360 of 15,247

  1. MOPO: Model-based Offline Policy Optimization

    Tianhe Yu, Garrett Thomas, Lantao Yu +5

    cs.LGcs.AIstat.MLarXiv:2005.13239v62020
  2. Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

    Stephen Casper, Xander Davies, Claudia Shi +29

    cs.AIcs.CLcs.LGarXiv:2307.15217v22023
  3. Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

    Wenxuan Ding, Nicholas Tomlin, Greg Durrett

    cs.CLcs.AIarXiv:2602.16699v32026
  4. Training Language Models via Neural Cellular Automata

    Dan Lee, Seungwook Han, Akarsh Kumar +1

    cs.LGcs.AIcs.CLarXiv:2603.10055v12026
  5. MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

    Ryan Po, David Junhao Zhang, Amir Hertz +3

    cs.AIcs.CVcs.GRarXiv:2603.06679v22026
  6. UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

    Dianyi Wang, Chaofan Ma, Feng Han +8

    cs.CVcs.AIarXiv:2602.02437v42026
  7. Medical Image Fusion: A survey of the state of the art

    A. P. James, B. V. Dasarathy

    cs.CVcs.AIphysics.med-pharXiv:1401.0166v12013
  8. The AI Hippocampus: How Far are We From Human Memory?

    Zixia Jia, Jiaqi Li, Yipeng Kang +12

    cs.AIarXiv:2601.09113v12026
  9. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

    Zhangquan Chen, Jiale Tao, Ruihuang Li +10

    cs.AIcs.CVarXiv:2602.05847v22026
  10. CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs

    Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen +7

    cs.LGcs.AIarXiv:2602.03048v32026
  11. EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

    Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair +6

    cs.AIcs.LGarXiv:2603.13594v12026
  12. Evolving Deep Neural Networks

    Risto Miikkulainen, Jason Liang, Elliot Meyerson +8

    cs.NEcs.AIarXiv:1703.00548v22017
  13. Agentic Code Reasoning

    Shubham Ugare, Satish Chandra

    cs.SEcs.AIcs.PLarXiv:2603.01896v22026
  14. Learning to Navigate in Complex Environments

    Piotr Mirowski, Razvan Pascanu, Fabio Viola +9

    cs.AIcs.CVcs.LGarXiv:1611.03673v32016
  15. e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings

    Haonan Chen, Sicheng Gao, Radu Timofte +2

    cs.CLcs.AIcs.CVarXiv:2601.03666v22026
  16. What do we need to build explainable AI systems for the medical domain?

    Andreas Holzinger, Chris Biemann, Constantinos S. Pattichis +1

    cs.AIstat.MLarXiv:1712.09923v12017
  17. The Flan Collection: Designing Data and Methods for Effective Instruction Tuning

    Shayne Longpre, Le Hou, Tu Vu +8

    cs.AIcs.CLcs.LGarXiv:2301.13688v22023
  18. LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

    Linquan Wu, Tianxiang Jiang, Yifei Dong +6

    cs.CVcs.AIarXiv:2601.10129v22026
  19. Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

    Ning Ding, Yulin Chen, Bokai Xu +6

    cs.CLcs.AIarXiv:2305.14233v12023
  20. Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

    Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer +5

    cs.CLcs.AIcs.LGarXiv:2602.05547v32026
  21. Refusal in Language Models Is Mediated by a Single Direction

    Andy Arditi, Oscar Obeso, Aaquib Syed +4

    cs.LGcs.AIcs.CLarXiv:2406.11717v32024
  22. R3M: A Universal Visual Representation for Robot Manipulation

    Suraj Nair, Aravind Rajeswaran, Vikash Kumar +2

    cs.ROcs.AIcs.CVarXiv:2203.12601v32022
  23. Beyond Static Tools: Test-Time Tool Evolution for Scientific Reasoning

    Jiaxuan Lu, Ziyu Kong, Yemin Wang +10

    cs.AIcs.CLcs.MAarXiv:2601.07641v12026
  24. MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution

    Minhua Lin, Zhiwei Zhang, Hanqing Lu +5

    cs.AIarXiv:2603.18718v12026
  25. Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report

    Zhuoran Yang, Ed Li, Jianliang He +18

    cs.AIcs.CRcs.LGarXiv:2601.21051v12026
  26. DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

    Fan Nie, Junlin Wang, Harper Hua +6

    cs.AIarXiv:2601.16344v12026
  27. Lost in Stories: Consistency Bugs in Long Story Generation by LLMs

    Junjie Li, Xinrui Guo, Yuhao Wu +3

    cs.CLcs.AIarXiv:2603.05890v12026
  28. Loss Surfaces, Mode Connectivity, and Fast Ensembling of DNNs

    Timur Garipov, Pavel Izmailov, Dmitrii Podoprikhin +2

    stat.MLcs.AIcs.LGarXiv:1802.10026v42018
  29. Behavioral Cloning from Observation

    Faraz Torabi, Garrett Warnell, Peter Stone

    cs.AIarXiv:1805.01954v22018
  30. GraphAgents: Knowledge Graph-Guided Agentic AI for Cross-Domain Materials Design

    Isabella A. Stewart, Tarjei Paule Hage, Yu-Chuan Hsu +1

    cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2602.07491v12026
  31. THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

    Seanie Lee, Sangwoo Park, Yumin Choi +6

    cs.AIarXiv:2601.23143v42026
  32. The Hateful Memes Challenge: Detecting Hate Speech in Multimodal Memes

    Douwe Kiela, Hamed Firooz, Aravind Mohan +4

    cs.AIcs.CLcs.CVarXiv:2005.04790v32020
  33. Terminal Agents Suffice for Enterprise Automation

    Patrice Bechard, Orlando Marquez Ayala, Emily Chen +5

    cs.SEcs.AIcs.CLarXiv:2604.00073v32026
  34. StarCraft II: A New Challenge for Reinforcement Learning

    Oriol Vinyals, Timo Ewalds, Sergey Bartunov +22

    cs.LGcs.AIarXiv:1708.04782v12017
  35. RMA: Rapid Motor Adaptation for Legged Robots

    Ashish Kumar, Zipeng Fu, Deepak Pathak +1

    cs.LGcs.AIcs.CVarXiv:2107.04034v12021
  36. Exploring Reasoning Reward Model for Agents

    Kaixuan Fan, Kaituo Feng, Manyuan Zhang +7

    cs.AIcs.CLarXiv:2601.22154v22026
  37. LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

    Zhiling Yan, Dingjie Song, Zhe Fang +4

    cs.AIarXiv:2602.10367v12026
  38. Recommendation as Language Processing (RLP): A Unified Pretrain, Personalized Prompt & Predict Paradigm (P5)

    Shijie Geng, Shuchang Liu, Zuohui Fu +2

    cs.IRcs.AIcs.CLarXiv:2203.13366v72022
  39. Unity: A General Platform for Intelligent Agents

    Arthur Juliani, Vincent-Pierre Berges, Ervin Teng +8

    cs.LGcs.AIcs.NEarXiv:1809.02627v22018
  40. NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions

    Junbin Xiao, Xindi Shang, Angela Yao +1

    cs.CVcs.AIarXiv:2105.08276v22021
  41. Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

    Zehai He, Wenyi Hong, Zhen Yang +4

    cs.SEcs.AIarXiv:2603.26648v32026
  42. A Survey on the Explainability of Supervised Machine Learning

    Nadia Burkart, Marco F. Huber

    cs.LGcs.AIstat.MLarXiv:2011.07876v12020
  43. The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only

    Guilherme Penedo, Quentin Malartic, Daniel Hesslow +6

    cs.CLcs.AIarXiv:2306.01116v12023
  44. AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

    Lance Ying, Ryan Truong, Prafull Sharma +9

    cs.AIarXiv:2602.17594v12026
  45. Bat Algorithm: Literature Review and Applications

    Xin-She Yang

    cs.AImath.OCarXiv:1308.3900v12013
  46. \$OneMillion-Bench: How Far are Language Agents from Human Experts?

    Qianyu Yang, Yang Liu, Jiaqi Li +20

    cs.LGcs.AIcs.CLarXiv:2603.07980v12026
  47. Understanding disentangling in $β$-VAE

    Christopher P. Burgess, Irina Higgins, Arka Pal +4

    stat.MLcs.AIcs.LGarXiv:1804.03599v12018
  48. Causal-JEPA: Learning World Models through Object-Level Latent Masking

    Heejeong Nam, Quentin Le Lidec, Lucas Maes +2

    cs.AIarXiv:2602.11389v22026
  49. PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

    Xiaofeng Mao, Shaohao Rui, Kaining Ying +4

    cs.CVcs.AIarXiv:2603.25730v12026
  50. MAttNet: Modular Attention Network for Referring Expression Comprehension

    Licheng Yu, Zhe Lin, Xiaohui Shen +4

    cs.CVcs.AIcs.CLarXiv:1801.08186v32018
  51. On the Cross-lingual Transferability of Monolingual Representations

    Mikel Artetxe, Sebastian Ruder, Dani Yogatama

    cs.CLcs.AIcs.LGarXiv:1910.11856v32019
  52. AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

    Ruoyao Wen, Hao Li, Chaowei Xiao +1

    cs.CRcs.AIarXiv:2602.07398v12026
  53. AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents

    Zhaopeng Feng, Liangcai Su, Zhen Zhang +16

    cs.CLcs.AIcs.MAarXiv:2603.27490v12026
  54. Intelligent Clinical Documentation: Harnessing Generative AI for Patient-Centric Clinical Note Generation

    Anjanava Biswas, Wrick Talukdar

    cs.AIarXiv:2405.18346v12024
  55. T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

    Hyomin Lee, Sangwoo Park, Yumin Choi +3

    cs.CRcs.AIcs.CLarXiv:2603.22341v12026
  56. Deep Reinforcement Learning at the Edge of the Statistical Precipice

    Rishabh Agarwal, Max Schwarzer, Pablo Samuel Castro +2

    cs.LGcs.AIstat.MEarXiv:2108.13264v42021
  57. MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation

    Yejin Kim, Wilbert Pumacay, Omar Rayyan +23

    cs.ROcs.AIcs.CVarXiv:2602.11337v22026
  58. Understanding the Challenges in Iterative Generative Optimization with LLMs

    Allen Nie, Xavier Daull, Zhiyi Kuang +10

    cs.LGcs.AIarXiv:2603.23994v22026
  59. GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL

    Rui Yang, Qianhui Wu, Zhaoyang Wang +8

    cs.LGcs.AIcs.CLarXiv:2602.22190v22026
  60. Actor-Attention-Critic for Multi-Agent Reinforcement Learning

    Shariq Iqbal, Fei Sha

    cs.LGcs.AIcs.MAarXiv:1810.02912v22018