Artificial Intelligence
Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
12,301 to 12,360 of 15,247
MOPO: Model-based Offline Policy Optimization
Tianhe Yu, Garrett Thomas, Lantao Yu +5
cs.LGcs.AIstat.MLarXiv:2005.13239v62020Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
Stephen Casper, Xander Davies, Claudia Shi +29
cs.AIcs.CLcs.LGarXiv:2307.15217v22023Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents
Wenxuan Ding, Nicholas Tomlin, Greg Durrett
cs.CLcs.AIarXiv:2602.16699v32026Training Language Models via Neural Cellular Automata
Dan Lee, Seungwook Han, Akarsh Kumar +1
cs.LGcs.AIcs.CLarXiv:2603.10055v12026MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines
Ryan Po, David Junhao Zhang, Amir Hertz +3
cs.AIcs.CVcs.GRarXiv:2603.06679v22026UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
Dianyi Wang, Chaofan Ma, Feng Han +8
cs.CVcs.AIarXiv:2602.02437v42026Medical Image Fusion: A survey of the state of the art
A. P. James, B. V. Dasarathy
cs.CVcs.AIphysics.med-pharXiv:1401.0166v12013The AI Hippocampus: How Far are We From Human Memory?
Zixia Jia, Jiaqi Li, Yipeng Kang +12
cs.AIarXiv:2601.09113v12026OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
Zhangquan Chen, Jiale Tao, Ruihuang Li +10
cs.AIcs.CVarXiv:2602.05847v22026CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen +7
cs.LGcs.AIarXiv:2602.03048v32026EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair +6
cs.AIcs.LGarXiv:2603.13594v12026Evolving Deep Neural Networks
Risto Miikkulainen, Jason Liang, Elliot Meyerson +8
cs.NEcs.AIarXiv:1703.00548v22017Agentic Code Reasoning
Shubham Ugare, Satish Chandra
cs.SEcs.AIcs.PLarXiv:2603.01896v22026Learning to Navigate in Complex Environments
Piotr Mirowski, Razvan Pascanu, Fabio Viola +9
cs.AIcs.CVcs.LGarXiv:1611.03673v32016e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
Haonan Chen, Sicheng Gao, Radu Timofte +2
cs.CLcs.AIcs.CVarXiv:2601.03666v22026What do we need to build explainable AI systems for the medical domain?
Andreas Holzinger, Chris Biemann, Constantinos S. Pattichis +1
cs.AIstat.MLarXiv:1712.09923v12017The Flan Collection: Designing Data and Methods for Effective Instruction Tuning
Shayne Longpre, Le Hou, Tu Vu +8
cs.AIcs.CLcs.LGarXiv:2301.13688v22023LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
Linquan Wu, Tianxiang Jiang, Yifei Dong +6
cs.CVcs.AIarXiv:2601.10129v22026Enhancing Chat Language Models by Scaling High-quality Instructional Conversations
Ning Ding, Yulin Chen, Bokai Xu +6
cs.CLcs.AIarXiv:2305.14233v12023Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer +5
cs.CLcs.AIcs.LGarXiv:2602.05547v32026Refusal in Language Models Is Mediated by a Single Direction
Andy Arditi, Oscar Obeso, Aaquib Syed +4
cs.LGcs.AIcs.CLarXiv:2406.11717v32024R3M: A Universal Visual Representation for Robot Manipulation
Suraj Nair, Aravind Rajeswaran, Vikash Kumar +2
cs.ROcs.AIcs.CVarXiv:2203.12601v32022Beyond Static Tools: Test-Time Tool Evolution for Scientific Reasoning
Jiaxuan Lu, Ziyu Kong, Yemin Wang +10
cs.AIcs.CLcs.MAarXiv:2601.07641v12026MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution
Minhua Lin, Zhiwei Zhang, Hanqing Lu +5
cs.AIarXiv:2603.18718v12026Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
Zhuoran Yang, Ed Li, Jianliang He +18
cs.AIcs.CRcs.LGarXiv:2601.21051v12026DSGym: A Holistic Framework for Evaluating and Training Data Science Agents
Fan Nie, Junlin Wang, Harper Hua +6
cs.AIarXiv:2601.16344v12026Lost in Stories: Consistency Bugs in Long Story Generation by LLMs
Junjie Li, Xinrui Guo, Yuhao Wu +3
cs.CLcs.AIarXiv:2603.05890v12026Loss Surfaces, Mode Connectivity, and Fast Ensembling of DNNs
Timur Garipov, Pavel Izmailov, Dmitrii Podoprikhin +2
stat.MLcs.AIcs.LGarXiv:1802.10026v42018Behavioral Cloning from Observation
Faraz Torabi, Garrett Warnell, Peter Stone
cs.AIarXiv:1805.01954v22018GraphAgents: Knowledge Graph-Guided Agentic AI for Cross-Domain Materials Design
Isabella A. Stewart, Tarjei Paule Hage, Yu-Chuan Hsu +1
cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2602.07491v12026THINKSAFE: Self-Generated Safety Alignment for Reasoning Models
Seanie Lee, Sangwoo Park, Yumin Choi +6
cs.AIarXiv:2601.23143v42026The Hateful Memes Challenge: Detecting Hate Speech in Multimodal Memes
Douwe Kiela, Hamed Firooz, Aravind Mohan +4
cs.AIcs.CLcs.CVarXiv:2005.04790v32020Terminal Agents Suffice for Enterprise Automation
Patrice Bechard, Orlando Marquez Ayala, Emily Chen +5
cs.SEcs.AIcs.CLarXiv:2604.00073v32026StarCraft II: A New Challenge for Reinforcement Learning
Oriol Vinyals, Timo Ewalds, Sergey Bartunov +22
cs.LGcs.AIarXiv:1708.04782v12017RMA: Rapid Motor Adaptation for Legged Robots
Ashish Kumar, Zipeng Fu, Deepak Pathak +1
cs.LGcs.AIcs.CVarXiv:2107.04034v12021Exploring Reasoning Reward Model for Agents
Kaixuan Fan, Kaituo Feng, Manyuan Zhang +7
cs.AIcs.CLarXiv:2601.22154v22026LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation
Zhiling Yan, Dingjie Song, Zhe Fang +4
cs.AIarXiv:2602.10367v12026Recommendation as Language Processing (RLP): A Unified Pretrain, Personalized Prompt & Predict Paradigm (P5)
Shijie Geng, Shuchang Liu, Zuohui Fu +2
cs.IRcs.AIcs.CLarXiv:2203.13366v72022Unity: A General Platform for Intelligent Agents
Arthur Juliani, Vincent-Pierre Berges, Ervin Teng +8
cs.LGcs.AIcs.NEarXiv:1809.02627v22018NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions
Junbin Xiao, Xindi Shang, Angela Yao +1
cs.CVcs.AIarXiv:2105.08276v22021Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
Zehai He, Wenyi Hong, Zhen Yang +4
cs.SEcs.AIarXiv:2603.26648v32026A Survey on the Explainability of Supervised Machine Learning
Nadia Burkart, Marco F. Huber
cs.LGcs.AIstat.MLarXiv:2011.07876v12020The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only
Guilherme Penedo, Quentin Malartic, Daniel Hesslow +6
cs.CLcs.AIarXiv:2306.01116v12023AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games
Lance Ying, Ryan Truong, Prafull Sharma +9
cs.AIarXiv:2602.17594v12026Bat Algorithm: Literature Review and Applications
Xin-She Yang
cs.AImath.OCarXiv:1308.3900v12013\$OneMillion-Bench: How Far are Language Agents from Human Experts?
Qianyu Yang, Yang Liu, Jiaqi Li +20
cs.LGcs.AIcs.CLarXiv:2603.07980v12026Understanding disentangling in $β$-VAE
Christopher P. Burgess, Irina Higgins, Arka Pal +4
stat.MLcs.AIcs.LGarXiv:1804.03599v12018Causal-JEPA: Learning World Models through Object-Level Latent Masking
Heejeong Nam, Quentin Le Lidec, Lucas Maes +2
cs.AIarXiv:2602.11389v22026PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
Xiaofeng Mao, Shaohao Rui, Kaining Ying +4
cs.CVcs.AIarXiv:2603.25730v12026MAttNet: Modular Attention Network for Referring Expression Comprehension
Licheng Yu, Zhe Lin, Xiaohui Shen +4
cs.CVcs.AIcs.CLarXiv:1801.08186v32018On the Cross-lingual Transferability of Monolingual Representations
Mikel Artetxe, Sebastian Ruder, Dani Yogatama
cs.CLcs.AIcs.LGarXiv:1910.11856v32019AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management
Ruoyao Wen, Hao Li, Chaowei Xiao +1
cs.CRcs.AIarXiv:2602.07398v12026AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents
Zhaopeng Feng, Liangcai Su, Zhen Zhang +16
cs.CLcs.AIcs.MAarXiv:2603.27490v12026Intelligent Clinical Documentation: Harnessing Generative AI for Patient-Centric Clinical Note Generation
Anjanava Biswas, Wrick Talukdar
cs.AIarXiv:2405.18346v12024T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
Hyomin Lee, Sangwoo Park, Yumin Choi +3
cs.CRcs.AIcs.CLarXiv:2603.22341v12026Deep Reinforcement Learning at the Edge of the Statistical Precipice
Rishabh Agarwal, Max Schwarzer, Pablo Samuel Castro +2
cs.LGcs.AIstat.MEarXiv:2108.13264v42021MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation
Yejin Kim, Wilbert Pumacay, Omar Rayyan +23
cs.ROcs.AIcs.CVarXiv:2602.11337v22026Understanding the Challenges in Iterative Generative Optimization with LLMs
Allen Nie, Xavier Daull, Zhiyi Kuang +10
cs.LGcs.AIarXiv:2603.23994v22026GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
Rui Yang, Qianhui Wu, Zhaoyang Wang +8
cs.LGcs.AIcs.CLarXiv:2602.22190v22026Actor-Attention-Critic for Multi-Agent Reinforcement Learning
Shariq Iqbal, Fei Sha
cs.LGcs.AIcs.MAarXiv:1810.02912v22018