Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,481 to 12,540 of 15,247

  1. From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents

    Ling Yue, Kushal Raj Bhandari, Ching-Yun Ko +6

    cs.AIcs.CLarXiv:2603.22386v12026
  2. CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion

    Yusong Lin, Haiyang Wang, Shuzhe Wu +4

    cs.AIarXiv:2602.10999v12026
  3. RubricBench: Aligning Model-Generated Rubrics with Human Standards

    Qiyuan Zhang, Junyi Zhou, Yufei Wang +8

    cs.AIarXiv:2603.01562v22026
  4. Large Language Models: A Survey

    Shervin Minaee, Tomas Mikolov, Narjes Nikzad +4

    cs.CLcs.AIarXiv:2402.06196v32024
  5. TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents

    Kaijie Zhu, Yuzhou Nie, Yijiang Li +10

    cs.AIarXiv:2602.07274v12026
  6. Self-Hinting Language Models Enhance Reinforcement Learning

    Baohao Liao, Hanze Dong, Xinxing Xu +2

    cs.LGcs.AIcs.CLarXiv:2602.03143v12026
  7. ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

    António Loison, Quentin Macé, Antoine Edy +7

    cs.AIcs.CVarXiv:2601.08620v22026
  8. A Diagram Is Worth A Dozen Images

    Aniruddha Kembhavi, Mike Salvato, Eric Kolve +3

    cs.CVcs.AIarXiv:1603.07396v12016
  9. LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries

    Shijie Lian, Bin Yu, Xiaopeng Lin +6

    cs.AIcs.CLcs.CVarXiv:2601.15197v72026
  10. Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

    Chi-Pin Huang, Yunze Man, Zhiding Yu +4

    cs.CVcs.AIcs.LGarXiv:2601.09708v22026
  11. Fish Audio S2 Technical Report

    Shijia Liao, Yuxuan Wang, Songting Liu +11

    cs.SDcs.AIcs.CLarXiv:2603.08823v22026
  12. Guided Cost Learning: Deep Inverse Optimal Control via Policy Optimization

    Chelsea Finn, Sergey Levine, Pieter Abbeel

    cs.LGcs.AIcs.ROarXiv:1603.00448v32016
  13. Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling

    Yong Liu, Xingjian Su, Shiyu Wang +7

    cs.AIarXiv:2603.04791v32026
  14. Medical SAM3: A Foundation Model for Universal Prompt-Driven Medical Image Segmentation

    Chongcong Jiang, Tianxingjian Ding, Chuhan Song +7

    cs.CVcs.AIarXiv:2601.10880v12026
  15. OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

    Bowen Yang, Kaiming Jin, Zhenyu Wu +12

    cs.MAcs.AIcs.CLarXiv:2601.07779v12026
  16. VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

    Wenlong Huang, Chen Wang, Ruohan Zhang +3

    cs.ROcs.AIcs.CLarXiv:2307.05973v22023
  17. MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

    Mengru Wang, Haozhe Luo, Zhenqian Xu +6

    cs.AIcs.CLcs.CYarXiv:2608.20202v12026
  18. Benchmark Test-Time Scaling of General LLM Agents

    Xiaochuan Li, Ryan Ming, Pranav Setlur +6

    cs.AIcs.CLarXiv:2602.18998v12026
  19. SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

    Gabriel Orlanski, Devjeet Roy, Alexander Yun +7

    cs.SEcs.AIcs.CLarXiv:2603.24755v22026
  20. Gradient based sample selection for online continual learning

    Rahaf Aljundi, Min Lin, Baptiste Goujaud +1

    cs.LGcs.AIcs.CVarXiv:1903.08671v52019
  21. DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

    Dianyi Wang, Ruihang Li, Feng Han +17

    cs.CVcs.AIarXiv:2602.12205v22026
  22. LongCat-Flash-Thinking-2601 Technical Report

    Meituan LongCat Team, Anchun Gui, Bei Li +163

    cs.AIarXiv:2601.16725v22026
  23. Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

    Romain Froger, Pierre Andrews, Matteo Bettini +21

    cs.AIarXiv:2602.11964v12026
  24. Bilinear Attention Networks

    Jin-Hwa Kim, Jaehyun Jun, Byoung-Tak Zhang

    cs.CVcs.AIcs.CLarXiv:1805.07932v22018
  25. Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations

    Wei Liu, Jiawei Xu, Yingru Li +4

    cs.LGcs.AIcs.CLarXiv:2602.05885v22026
  26. Actional-Structural Graph Convolutional Networks for Skeleton-based Action Recognition

    Maosen Li, Siheng Chen, Xu Chen +3

    cs.CVcs.AIarXiv:1904.12659v12019
  27. SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

    Nicholas Pfaff, Thomas Cohn, Sergey Zakharov +2

    cs.ROcs.AIcs.CVarXiv:2602.09153v22026
  28. ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

    Zedong Chu, Shichao Xie, Xiaolong Wu +41

    cs.ROcs.AIcs.CVarXiv:2602.11598v12026
  29. Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights

    Yulu Gan, Phillip Isola

    cs.LGcs.AIarXiv:2603.12228v12026
  30. ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning

    Yu Li, Rui Miao, Zhengling Qi +1

    cs.AIarXiv:2603.16060v22026
  31. K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model

    Shiyi Cao, Ziming Mao, Joseph E. Gonzalez +1

    cs.AIarXiv:2602.19128v22026
  32. The NarrativeQA Reading Comprehension Challenge

    Tomáš Kočiský, Jonathan Schwarz, Phil Blunsom +4

    cs.CLcs.AIcs.NEarXiv:1712.07040v12017
  33. FeatureBench: Benchmarking Agentic Coding for Complex Feature Development

    Qixing Zhou, Jiacheng Zhang, Haiyang Wang +9

    cs.SEcs.AIarXiv:2602.10975v12026
  34. LoL: Longer than Longer, Scaling Video Generation to Hour

    Justin Cui, Jie Wu, Ming Li +6

    cs.CVcs.AIarXiv:2601.16914v12026
  35. Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

    Zhuolin Yang, Zihan Liu, Yang Chen +14

    cs.CLcs.AIcs.LGarXiv:2603.19220v22026
  36. $τ$-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge

    Quan Shi, Alexandra Zytek, Pedram Razavi +2

    cs.AIcs.CLcs.IRarXiv:2603.04370v12026
  37. Reinforcement-aware Knowledge Distillation for LLM Reasoning

    Zhaoyang Zhang, Shuli Jiang, Yantao Shen +6

    cs.LGcs.AIarXiv:2602.22495v32026
  38. Rethinking the Trust Region in LLM Reinforcement Learning

    Penghui Qi, Xiangxin Zhou, Zichen Liu +4

    cs.LGcs.AIcs.CLarXiv:2602.04879v32026
  39. Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening

    Xiaotong Ji, Rasul Tutunov, Matthieu Zimmer +1

    cs.LGcs.AIarXiv:2601.21590v12026
  40. Continuous Deep Q-Learning with Model-based Acceleration

    Shixiang Gu, Timothy Lillicrap, Ilya Sutskever +1

    cs.LGcs.AIcs.ROarXiv:1603.00748v12016
  41. Hyperagents

    Jenny Zhang, Bingchen Zhao, Wannan Yang +5

    cs.AIarXiv:2603.19461v12026
  42. How AI Impacts Skill Formation

    Judy Hanwen Shen, Alex Tamkin

    cs.CYcs.AIcs.HCarXiv:2601.20245v22026
  43. ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers

    Songyang Liu, Chaozhuo Li, Chenxu Wang +8

    cs.CRcs.AIarXiv:2603.24414v12026
  44. Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering

    Xinyu Zhu, Yuzhu Cai, Zexi Liu +8

    cs.AIarXiv:2601.10402v52026
  45. MuSiQue: Multihop Questions via Single-hop Question Composition

    Harsh Trivedi, Niranjan Balasubramanian, Tushar Khot +1

    cs.CLcs.AIarXiv:2108.00573v32021
  46. Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations

    Dongming Jiang, Yi Li, Songtao Wei +8

    cs.CLcs.AIarXiv:2602.19320v22026
  47. VIBEVOICE-ASR Technical Report

    Zhiliang Peng, Jianwei Yu, Yaoyao Chang +21

    cs.SDcs.AIeess.ASarXiv:2601.18184v22026
  48. Large Language Model Reasoning Failures

    Peiyang Song, Pengrui Han, Noah Goodman

    cs.AIcs.CLcs.LGarXiv:2602.06176v12026
  49. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning

    Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins +10

    cs.AIcs.CLcs.IRarXiv:2603.08655v12026
  50. QTRAN: Learning to Factorize with Transformation for Cooperative Multi-Agent Reinforcement Learning

    Kyunghwan Son, Daewoo Kim, Wan Ju Kang +2

    cs.LGcs.AIcs.MAarXiv:1905.05408v12019
  51. Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters

    Ailin Huang, Ang Li, Aobo Kong +213

    cs.CLcs.AIarXiv:2602.10604v22026
  52. OmniGAIA: Towards Native Omni-Modal AI Agents

    Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10

    cs.AIcs.CLcs.CVarXiv:2602.22897v32026
  53. AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration

    Jianhao Ruan, Zhihao Xu, Yiran Peng +9

    cs.AIcs.CLarXiv:2602.03786v22026
  54. DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints

    Yinger Zhang, Shutong Jiang, Renhao Li +6

    cs.AIcs.CLarXiv:2601.18137v12026
  55. HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

    Haowei Zhang, Shudong Yang, Jinlan Fu +2

    cs.CVcs.AIcs.CLarXiv:2601.14724v42026
  56. AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

    Dongrui Liu, Qihan Ren, Chen Qian +40

    cs.AIcs.CCcs.CLarXiv:2601.18491v22026
  57. Dr. Zero: Self-Evolving Search Agents without Training Data

    Zhenrui Yue, Kartikeya Upasani, Xianjun Yang +5

    cs.AIarXiv:2601.07055v22026
  58. Rethinking Video Generation Model for the Embodied World

    Yufan Deng, Zilin Pan, Hongyu Zhang +6

    cs.CVcs.AIcs.ROarXiv:2601.15282v12026
  59. AIDev: Studying AI Coding Agents on GitHub

    Hao Li, Haoxiang Zhang, Ahmed E. Hassan

    cs.SEcs.AIarXiv:2602.09185v12026
  60. AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations

    Minjun Zhu, Zhen Lin, Yixuan Weng +6

    cs.AIcs.CLcs.CVarXiv:2602.03828v22026