Artificial Intelligence
Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,061 to 6,120 of 15,269
Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code
Niels Mündler-Sasahara, Hristo Venev, Dawn Song +2
cs.PLcs.AIcs.LGarXiv:2607.13921v22026Summaries:한국어Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings
Jiangang Han
math.STcs.AIcs.LGarXiv:2607.13918v12026SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4
cs.CVcs.AIarXiv:2607.10400v12026Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
Yifan Zhou, Qihao Yang, Yan Li +14
cs.AIarXiv:2607.08758v12026UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents
Niu Lian, Tongbo Chen, Zhehao Yu +8
cs.CLcs.AIcs.CVarXiv:2607.04425v22026Trust Region Policy Distillation
Zhengpeng Xie, Li Lyna Zhang, Zeke Xie +1
cs.LGcs.AIarXiv:2607.04751v12026Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?
Anmol Goel, Iryna Gurevych
cs.AIcs.CLarXiv:2606.23189v12026HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry
Tingyang Chen, Shuo Lu, Kang Zhao +11
cs.AIarXiv:2606.14249v32026Orchestra-o1: Omnimodal Agent Orchestration
Fan Zhang, Vireo Zhang, Shengju Qian +8
cs.AIcs.CLcs.CVarXiv:2606.13707v12026The Hidden Power of Scaling Factor in LoRA Optimization
Zicheng Zhang, Haoran Li, Jiaxing Wang +10
cs.AIarXiv:2606.12883v12026Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting
Avijit Ghosh, Anka Reuel, Jenny Chim +45
cs.AIarXiv:2606.09809v22026APPO: Agentic Procedural Policy Optimization
Xucong Wang, Ziyu Ma, Yong Wang +5
cs.LGcs.AIarXiv:2606.12384v22026Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning
Zhiyuan Zhou, Andy Peng, Charles Xu +4
cs.LGcs.AIarXiv:2606.11087v12026Redesign Mixture-of-Experts Routers with Manifold Power Iteration
Songhao Wu, Ang Lv, Ruobing Xie +1
cs.LGcs.AIcs.CLarXiv:2606.12397v12026Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning
Renjie Mao, Xiangxin Zhou, Lvfang Tao +7
cs.LGcs.AIarXiv:2606.10968v22026The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment
Filippo Tonini, Federico Torrielli, Anton Danholt Lautrup +3
cs.AIarXiv:2606.10747v12026Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests
Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori +3
cs.LGcs.AIcs.CLarXiv:2606.07379v22026OPRD: On-Policy Representation Distillation
Shenzhi Yang, Guangcheng Zhu, Bowen Song +8
cs.LGcs.AIarXiv:2606.06021v42026When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents
Dongsheng Zhu, Xuchen Ma, Yucheng Shen +5
cs.AIarXiv:2606.05806v12026Why Muon Outperforms Adam: A Curvature Perspective
Shuche Wang, Fengzhuo Zhang, Jiaxiang Li +2
cs.LGcs.AIarXiv:2606.04662v12026EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management
Zherui Yang, Fan Liu, Yansong Ning +1
cs.AIarXiv:2606.03841v12026Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents
Yingqi Zhang
cs.OScs.AIcs.CRarXiv:2606.03895v22026Two-Fidelity Best-Action Identification for Stochastic Minimax Tree
Peter Chen, Xi Chen
cs.LGcs.AIarXiv:2606.01708v12026ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree
Vincent Koc, Patrick Erichsen, Jacob Tomlinson +3
cs.CRcs.AIcs.SEarXiv:2606.01494v12026MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems
Xinle Deng, Ruobin Zhong, Hujin Peng +15
cs.CLcs.AIcs.LGarXiv:2605.28732v32026Parallax: Parameterized Local Linear Attention for Language Modeling
Yifei Zuo, Dhruv Pai, Zhichen Zeng +3
cs.LGcs.AIcs.CLarXiv:2605.29157v12026Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
Minhua Lin, Juncheng Wu, Zijun Wang +14
cs.AIarXiv:2605.30621v12026GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
Xiaohang Tang, Keyue Jiang, Che Liu +4
cs.LGcs.AIarXiv:2605.29398v12026The Good, the Bad, and the Ugly of Markov Boundary for Tabular Prediction
Shu Wan, Abhinav Gorantla, Huan Liu +1
cs.LGcs.AIstat.MEarXiv:2605.29411v22026CubePart: An Open-Vocabulary Part-Controllable 3D Generator
Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier +9
cs.AIarXiv:2605.28763v12026Trust Region Q Adjoint Matching
Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2
cs.LGcs.AIcs.ROarXiv:2605.27079v12026Pruning and Distilling Mixture-of-Experts into Dense Language Models
Junhyuck Kim, Jihun Yun, Haechan Kim +3
cs.CLcs.AIcs.LGarXiv:2605.28207v22026AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios
Kou Shi, Ziao Zhang, Shiting Huang +7
cs.AIarXiv:2605.27995v22026When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
Yifan Zeng, Yiran Wu, Yaolun Zhang +4
cs.AIcs.LGarXiv:2605.24202v22026Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers
Tim Tsz-Kit Lau, Weijie Su
math.OCcs.AIcs.LGarXiv:2605.18106v42026The Distillation Game: Adaptive Attacks & Efficient Defenses
Youssef Allouah, Mahdi Haghifam, Sanmi Koyejo +1
cs.LGcs.AIarXiv:2605.22737v32026OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantization
Mark Boss, Vikram Voleti, Simon Donné +1
cs.LGcs.AIarXiv:2605.21226v12026optimize_anything: A Universal API for Optimizing any Text Parameter
Lakshya A Agrawal, Donghyun Lee, Shangyin Tan +11
cs.CLcs.AIcs.LGarXiv:2605.19633v12026Ethical Hyper-Velocity (EHV): A Hardware-Rooted Zero-Trust Runtime Enforcement Architecture for Agentic AI Systems
Riddhi Mohan Sharma
cs.AIcs.LOarXiv:2605.17909v22026Summaries:한국어Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
Chanuk Lee, Sangwoo Park, Minki Kang +1
cs.AIcs.CLarXiv:2605.15726v12026HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts
Tao Zhong, Dongzhe Zheng, Christine Allen-Blanchette
cs.LGcs.AIcs.CLarXiv:2605.13997v12026Holder Policy Optimisation
Yuxiang Chen, Dingli Liang, Yihang Chen +8
cs.LGcs.AIarXiv:2605.12058v22026G-Zero: Self-Play for Open-Ended Generation from Zero Data
Chengsong Huang, Haolin Liu, Tong Zheng +7
cs.LGcs.AIcs.CLarXiv:2605.09959v12026Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding
Zhiqin Yang, Yuhan Liu, Jingwen Fu +4
cs.AIarXiv:2605.09271v12026PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors
Xinmiao Huang, Jinwei Hu, Rajarshi Roy +3
cs.AIarXiv:2605.06455v12026Sub-JEPA: Subspace Gaussian Regularization for Stable End-to-End World Models
Kai Zhao, Dongliang Nie, Yuchen Lin +4
cs.LGcs.AIarXiv:2605.09241v12026AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
Haotian Zhao, Songlin Zhou, Yuxin Zhang +9
cs.AIarXiv:2605.00425v32026Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
Zhisong Qiu, Shuofei Qiao, Kewei Xu +4
cs.CLcs.AIcs.CEarXiv:2604.24198v22026R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL
Hojae Han, Yeonseok Jeong, Seung-won Hwang +2
cs.SEcs.AIcs.CLarXiv:2604.25325v12026Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents
Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel +3
cs.AIarXiv:2604.22085v12026Convergent Evolution: How Different Language Models Learn Similar Number Representations
Deqing Fu, Tianyi Zhou, Mikhail Belkin +2
cs.CLcs.AIcs.LGarXiv:2604.20817v22026Reinforcement Learning via Value Gradient Flow
Haoran Xu, Kaiwen Hu, Somayeh Sojoudi +1
cs.LGcs.AIarXiv:2604.14265v12026ROSE: An Intent-Centered Evaluation Metric for NL2SQL
Wenqi Pei, Shizheng Hou, Boyan Li +3
cs.DBcs.AIarXiv:2604.12988v12026Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
Yecheng Wu, Song Han, Hai Cai
cs.LGcs.AIarXiv:2604.13010v22026Steered LLM Activations are Non-Surjective
Aayush Mishra, Daniel Khashabi, Anqi Liu
cs.AIcs.LGarXiv:2604.09839v22026RewardFlow: Generate Images by Optimizing What You Reward
Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash +7
cs.CVcs.AIarXiv:2604.08536v12026Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling
Yongchang Hao, Lili Mou
cs.LGcs.AImath.OCarXiv:2604.04987v12026Learning to Hint for Reinforcement Learning
Yu Xia, Canwen Xu, Zhewei Yao +2
cs.LGcs.AIcs.CLarXiv:2604.00698v12026Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
Yanjie Zhang, Yafei Li, Rui Sheng +5
cs.CVcs.AIcs.MMarXiv:2603.28583v22026PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost
Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang +9
cs.AIarXiv:2603.21383v12026