Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

14,941 to 15,000 of 15,225

  1. Wan-Streamer v0.2: Higher Resolution, Same Latency

    Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23

    cs.CVcs.AIcs.GRarXiv:2607.04443v32026
  2. Building to the Test: Coding Agents Deliver What You Check, Not What You Requested

    Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz

    cs.SEcs.AIarXiv:2606.28430v12026
  3. Measuring the Gap Between Human and LLM Research Ideas

    Ziyu Chen, Yilun Zhao, Arman Cohan

    cs.CLcs.AIarXiv:2607.01233v12026
  4. When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

    Yong Yi Bay, Kathleen A. Yearick

    cs.LGcs.AIcs.CLarXiv:2606.28661v12026
  5. Parameter-Efficient Quantum-Inspired Fast Weight Programmers for Traffic-Matrix Forecasting

    Kuo-Chung Peng, Jiun-Cheng Jiang, Chun-Hua Lin +3

    quant-phcs.AIcs.LGarXiv:2606.27821v12026
  6. ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    Karan Goyal, Afreen Hossain, Debojyoti Das +1

    cs.CVcs.AIcs.CLarXiv:2607.20092v12026
  7. Measuring Cross-Task Behavioral Consistency in Language Model Agents

    Amritesh Banerjee, Pranil Raichura

    cs.AIarXiv:2608.13598v12026
  8. No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

    Jia Sheng, Yiwei Lu

    cs.AIcs.CLcs.LGarXiv:2608.13607v12026
  9. Optimal Power Allocation and AI Receiver Design for Superimposed DMRS and Data Transmission

    Sha Hu, Zhongwang Fu

    cs.ITcs.AIarXiv:2608.13809v12026
  10. Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline

    Joào Pedro Monteiro Pereira, Vinicius Cardoso Garcia

    cs.SEcs.AIcs.LGarXiv:2608.13742v12026
  11. SDO: Subspace Deconflicting Operator for Multi-Adapter Composition

    Zhongsheng Wang, Zhedong Lin, Qian Liu +2

    cs.AIarXiv:2608.13820v12026
  12. Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation

    Ajay Pravin Mahale

    cs.AIarXiv:2608.13754v12026
  13. Ontology-Grounded Project Memory for Coding Agents

    James Adam

    cs.AIcs.SEarXiv:2608.13662v12026
  14. A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure

    Dekun Yang

    cs.AIcs.CLcs.LGarXiv:2608.13626v12026
  15. Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

    Tuo Liang, Zhe Hu, Disheng Liu +2

    cs.CLcs.AIcs.MMarXiv:2607.19011v12026
  16. Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?

    Yimeng Chen, Nathanaël Denis, Roberto Di Pietro +1

    cs.CRcs.AIcs.CLarXiv:2607.17986v12026
  17. Differentiable Logic Gate Networks for Low-Latency EEG Classification on Edge Devices

    Shyamal Y. Dharia, Stephen D. Smith, Camilo E. Valderrama

    cs.LGcs.AIarXiv:2607.18149v12026
  18. AI Tour Meeting: Group Travel Planning by LLM Agents

    Daisuke Kikuta

    cs.AIcs.CLcs.MAarXiv:2607.18806v12026
  19. Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

    Hiskias Dingeto

    cs.AIcs.CLarXiv:2607.20379v12026
  20. EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

    Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

    cs.HCcs.AIarXiv:2607.18529v22026
  21. O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

    Mei Yuan, Qi Long, Qifeng Wu +5

    cs.CVcs.AIcs.CLarXiv:2607.18142v12026
  22. TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

    Debottam Dutta, Jaehoon Hahm, Jianchong Chen +1

    cs.AIarXiv:2607.21606v12026
  23. Robostral Navigate

    Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra +273

    cs.ROcs.AIarXiv:2607.20785v32026
  24. OpenForgeRL: Train Harness-native Agents in Any Environment

    Xiao Yu, Baolin Peng, Ruize Xu +7

    cs.AIcs.CLarXiv:2607.21557v32026
  25. A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

    Sietse Schelpe

    cs.CLcs.AIcs.IRarXiv:2607.23806v12026
  26. Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

    Nuemaan Malik

    cs.LGcs.AIarXiv:2607.19058v22026
  27. OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

    Zihan Li, Feiyang Liu, Dandan Shan +2

    cs.CVcs.AIcs.LGarXiv:2607.25108v12026
  28. Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model

    Markus J. Buehler

    cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2607.20058v12026
  29. SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

    Lehan Wang, Boli Chen, Ruixue Ding +7

    cs.CRcs.AIcs.CLarXiv:2607.26791v12026
  30. Distilled Reinforcement Learning for LLM Post-training

    Chen Wang, Zhaochun Li, Jionghao Bai +4

    cs.LGcs.AIarXiv:2607.17247v12026
  31. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Qiangqiang He, Zhongheng Wu, ZiJian Wang

    cs.AIarXiv:2607.27888v12026
  32. CriPO: Enhancing Rubric-based RL via Self-Distillation

    Mingxuan Xia, Yuhang Yang, Chao Ye +7

    cs.LGcs.AIarXiv:2607.18082v32026
  33. WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

    Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3

    cs.AIcs.CLcs.LGarXiv:2607.18084v12026
  34. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    Jiazhen Jiang, Boxi Cao, Lingyong Yan +6

    cs.AIcs.CLcs.LGarXiv:2607.19865v12026
  35. AutoIndex: Learning Representation Programs for Retrieval

    Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy +3

    cs.IRcs.AIcs.CLarXiv:2607.18603v12026
  36. Codifying the Judge: Scalable Evaluation via Program Distillation

    Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

    cs.AIcs.LGarXiv:2607.22561v12026
  37. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Haoyang Huang, Wenjie Huang, Tianqi Xu +14

    cs.AIarXiv:2607.25669v12026
  38. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

    cs.AIcs.CLcs.LGarXiv:2607.25091v12026
  39. SceneActBench: Can Agents Act on the 3D Scenes They See?

    Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11

    cs.AIcs.CVarXiv:2607.22393v12026
  40. dRAE: Representation Autoencoder with Hyper-Spherical Codes

    Tianren Ma, Lin Long, Chuyan Chen +4

    cs.CVcs.AIarXiv:2607.22148v12026
  41. TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs

    Sai Shruthi Sistla, Ashutosh Hathidara, Christopher Toukmaji +2

    cs.AIarXiv:2607.22639v12026
  42. Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

    Xinjie Zhang, Peng Zhang, Shicheng Zheng +21

    cs.CVcs.AIcs.LGarXiv:2607.19064v22026
  43. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

    Pingyu Wu, Lingyao Zhu, Weiming Zhang +1

    cs.CRcs.AIarXiv:2607.27951v12026
  44. Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems

    Ali Zahid Raja

    cs.AIcs.MAarXiv:2607.24117v12026
  45. StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

    Ads Dawson, Adrian Wood

    cs.CRcs.AIarXiv:2607.26314v12026
  46. GPT-Red: Automated Red Teaming via Self-Play at Scale

    Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15

    cs.CRcs.AIcs.CLarXiv:2607.26115v12026
  47. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

    Sizhe Zhou, Sheldon Yu, Hui Wei +8

    cs.CLcs.AIarXiv:2607.26637v12026
  48. IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

    Varun Gumma, Navonil Majumder, Soumitra Sinhahajari +1

    cs.AIarXiv:2607.22375v12026
  49. Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

    Haorui He, Xinwen Chen, Dacheng Wen +3

    cs.CLcs.AIcs.MMarXiv:2607.23514v12026
  50. AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    Kunlun Zhu, Xuyan Ye, Zhiguang Han +9

    cs.AIcs.CLarXiv:2607.18754v12026
  51. QQWorld: Quantile-Quantile Matching for World Model Regularization

    Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

    cs.LGcs.AIcs.CVarXiv:2607.28415v12026
  52. Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

    Zhe Liu

    cs.CLcs.AIcs.SDarXiv:2608.13624v12026
  53. Learning-to-Transition for Large-scale and High-Order MIMO Detection

    Yubo Zhang, Yiyao Liu, Xiaodong Wang

    cs.ITcs.AIarXiv:2608.14511v12026
  54. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    Zhicheng Cai, Xinyuan Guo, Hanlin Wu +4

    cs.LGcs.AIarXiv:2607.10169v12026
  55. UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

    Grace Man Chen, Litao Guo, Yifan Wu +5

    cs.SEcs.AIcs.CVarXiv:2607.06306v12026
  56. ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

    Boyang Zhang, Adrian Lyjak, Eli Stewart +2

    cs.AIarXiv:2607.29677v22026
  57. Visual Contrastive Self-Distillation

    Yijun Liang, Yunjie Tian, Yijiang Li +4

    cs.CVcs.AIarXiv:2607.21556v12026
  58. CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

    Bo-Wen Zhang, Junwei He, Wen Wang +5

    cs.AIarXiv:2607.25659v12026
  59. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

    Jingbo Zhou, Yusai Zhao, Qi Bao +12

    cs.AIcs.CLcs.HCarXiv:2607.27155v12026
  60. $π\mathbf{R}^2$: Reactive Real-time Flow Policies

    Sungjae Park, Shubham Tulsiani

    cs.ROcs.AIcs.LGarXiv:2607.26055v12026