Artificial Intelligence
Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
14,941 to 15,000 of 15,225
Wan-Streamer v0.2: Higher Resolution, Same Latency
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23
cs.CVcs.AIcs.GRarXiv:2607.04443v32026Building to the Test: Coding Agents Deliver What You Check, Not What You Requested
Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz
cs.SEcs.AIarXiv:2606.28430v12026Measuring the Gap Between Human and LLM Research Ideas
Ziyu Chen, Yilun Zhao, Arman Cohan
cs.CLcs.AIarXiv:2607.01233v12026When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling
Yong Yi Bay, Kathleen A. Yearick
cs.LGcs.AIcs.CLarXiv:2606.28661v12026Parameter-Efficient Quantum-Inspired Fast Weight Programmers for Traffic-Matrix Forecasting
Kuo-Chung Peng, Jiun-Cheng Jiang, Chun-Hua Lin +3
quant-phcs.AIcs.LGarXiv:2606.27821v12026ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
Karan Goyal, Afreen Hossain, Debojyoti Das +1
cs.CVcs.AIcs.CLarXiv:2607.20092v12026Measuring Cross-Task Behavioral Consistency in Language Model Agents
Amritesh Banerjee, Pranil Raichura
cs.AIarXiv:2608.13598v12026No Universal Signal Predicts Sample-Level LLM Regression under Version Updates
Jia Sheng, Yiwei Lu
cs.AIcs.CLcs.LGarXiv:2608.13607v12026Optimal Power Allocation and AI Receiver Design for Superimposed DMRS and Data Transmission
Sha Hu, Zhongwang Fu
cs.ITcs.AIarXiv:2608.13809v12026Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline
Joào Pedro Monteiro Pereira, Vinicius Cardoso Garcia
cs.SEcs.AIcs.LGarXiv:2608.13742v12026SDO: Subspace Deconflicting Operator for Multi-Adapter Composition
Zhongsheng Wang, Zhedong Lin, Qian Liu +2
cs.AIarXiv:2608.13820v12026Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation
Ajay Pravin Mahale
cs.AIarXiv:2608.13754v12026Ontology-Grounded Project Memory for Coding Agents
James Adam
cs.AIcs.SEarXiv:2608.13662v12026A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure
Dekun Yang
cs.AIcs.CLcs.LGarXiv:2608.13626v12026Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
Tuo Liang, Zhe Hu, Disheng Liu +2
cs.CLcs.AIcs.MMarXiv:2607.19011v12026Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?
Yimeng Chen, Nathanaël Denis, Roberto Di Pietro +1
cs.CRcs.AIcs.CLarXiv:2607.17986v12026Differentiable Logic Gate Networks for Low-Latency EEG Classification on Edge Devices
Shyamal Y. Dharia, Stephen D. Smith, Camilo E. Valderrama
cs.LGcs.AIarXiv:2607.18149v12026AI Tour Meeting: Group Travel Planning by LLM Agents
Daisuke Kikuta
cs.AIcs.CLcs.MAarXiv:2607.18806v12026Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
Hiskias Dingeto
cs.AIcs.CLarXiv:2607.20379v12026EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration
Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee
cs.HCcs.AIarXiv:2607.18529v22026O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
Mei Yuan, Qi Long, Qifeng Wu +5
cs.CVcs.AIcs.CLarXiv:2607.18142v12026TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
Debottam Dutta, Jaehoon Hahm, Jianchong Chen +1
cs.AIarXiv:2607.21606v12026Robostral Navigate
Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra +273
cs.ROcs.AIarXiv:2607.20785v32026OpenForgeRL: Train Harness-native Agents in Any Environment
Xiao Yu, Baolin Peng, Ruize Xu +7
cs.AIcs.CLarXiv:2607.21557v32026A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
Sietse Schelpe
cs.CLcs.AIcs.IRarXiv:2607.23806v12026Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training
Nuemaan Malik
cs.LGcs.AIarXiv:2607.19058v22026OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis
Zihan Li, Feiyang Liu, Dandan Shan +2
cs.CVcs.AIcs.LGarXiv:2607.25108v12026Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model
Markus J. Buehler
cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2607.20058v12026SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response
Lehan Wang, Boli Chen, Ruixue Ding +7
cs.CRcs.AIcs.CLarXiv:2607.26791v12026Distilled Reinforcement Learning for LLM Post-training
Chen Wang, Zhaochun Li, Jionghao Bai +4
cs.LGcs.AIarXiv:2607.17247v12026Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
Qiangqiang He, Zhongheng Wu, ZiJian Wang
cs.AIarXiv:2607.27888v12026CriPO: Enhancing Rubric-based RL via Self-Distillation
Mingxuan Xia, Yuhang Yang, Chao Ye +7
cs.LGcs.AIarXiv:2607.18082v32026WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting
Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3
cs.AIcs.CLcs.LGarXiv:2607.18084v12026DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
Jiazhen Jiang, Boxi Cao, Lingyong Yan +6
cs.AIcs.CLcs.LGarXiv:2607.19865v12026AutoIndex: Learning Representation Programs for Retrieval
Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy +3
cs.IRcs.AIcs.CLarXiv:2607.18603v12026Codifying the Judge: Scalable Evaluation via Program Distillation
Tzu-Heng Huang, Shengqi Qiu, Frederic Sala
cs.AIcs.LGarXiv:2607.22561v12026OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs
Haoyang Huang, Wenjie Huang, Tianqi Xu +14
cs.AIarXiv:2607.25669v12026Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray
cs.AIcs.CLcs.LGarXiv:2607.25091v12026SceneActBench: Can Agents Act on the 3D Scenes They See?
Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11
cs.AIcs.CVarXiv:2607.22393v12026dRAE: Representation Autoencoder with Hyper-Spherical Codes
Tianren Ma, Lin Long, Chuyan Chen +4
cs.CVcs.AIarXiv:2607.22148v12026TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
Sai Shruthi Sistla, Ashutosh Hathidara, Christopher Toukmaji +2
cs.AIarXiv:2607.22639v12026Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Xinjie Zhang, Peng Zhang, Shicheng Zheng +21
cs.CVcs.AIcs.LGarXiv:2607.19064v22026Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
Pingyu Wu, Lingyao Zhu, Weiming Zhang +1
cs.CRcs.AIarXiv:2607.27951v12026Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems
Ali Zahid Raja
cs.AIcs.MAarXiv:2607.24117v12026StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents
Ads Dawson, Adrian Wood
cs.CRcs.AIarXiv:2607.26314v12026GPT-Red: Automated Red Teaming via Self-Play at Scale
Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15
cs.CRcs.AIcs.CLarXiv:2607.26115v12026Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability
Sizhe Zhou, Sheldon Yu, Hui Wei +8
cs.CLcs.AIarXiv:2607.26637v12026IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
Varun Gumma, Navonil Majumder, Soumitra Sinhahajari +1
cs.AIarXiv:2607.22375v12026Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
Haorui He, Xinwen Chen, Dacheng Wen +3
cs.CLcs.AIcs.MMarXiv:2607.23514v12026AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
Kunlun Zhu, Xuyan Ye, Zhiguang Han +9
cs.AIcs.CLarXiv:2607.18754v12026QQWorld: Quantile-Quantile Matching for World Model Regularization
Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
cs.LGcs.AIcs.CVarXiv:2607.28415v12026Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation
Zhe Liu
cs.CLcs.AIcs.SDarXiv:2608.13624v12026Learning-to-Transition for Large-scale and High-Order MIMO Detection
Yubo Zhang, Yiyao Liu, Xiaodong Wang
cs.ITcs.AIarXiv:2608.14511v12026Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
Zhicheng Cai, Xinyuan Guo, Hanlin Wu +4
cs.LGcs.AIarXiv:2607.10169v12026UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
Grace Man Chen, Litao Guo, Yifan Wu +5
cs.SEcs.AIcs.CVarXiv:2607.06306v12026ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
Boyang Zhang, Adrian Lyjak, Eli Stewart +2
cs.AIarXiv:2607.29677v22026Visual Contrastive Self-Distillation
Yijun Liang, Yunjie Tian, Yijiang Li +4
cs.CVcs.AIarXiv:2607.21556v12026CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
Bo-Wen Zhang, Junwei He, Wen Wang +5
cs.AIarXiv:2607.25659v12026OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
Jingbo Zhou, Yusai Zhao, Qi Bao +12
cs.AIcs.CLcs.HCarXiv:2607.27155v12026$π\mathbf{R}^2$: Reactive Real-time Flow Policies
Sungjae Park, Shubham Tulsiani
cs.ROcs.AIcs.LGarXiv:2607.26055v12026