Artificial Intelligence
Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
14,881 to 14,940 of 15,269
Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction
Zhuofeng Li, Haoxiang Zhang, Cong Wei +16
cs.IRcs.AIarXiv:2605.05242v12026Summaries:한국어ELF: Embedded Language Flows
Keya Hu, Linlu Qiu, Yiyang Lu +5
cs.CLcs.AIcs.LGarXiv:2605.10938v22026SkillGrad: Optimizing Agent Skills Like Gradient Descent
Hanyu Wang, Yifan Lan, Bochuan Cao +2
cs.AIarXiv:2605.27760v12026MiniMax Sparse Attention
Xunhao Lai, Weiqi Xu, Yufeng Yang +14
cs.AIarXiv:2606.13392v22026AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4
cs.SEcs.AIarXiv:2605.12925v32026Cosmos 3: Omnimodal World Models for Physical AI
NVIDIA, :, Aditi +293
cs.CVcs.AIcs.LGarXiv:2606.02800v42026Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Glenn Jocher, Jing Qiu, Mengyu Liu +3
cs.CVcs.AIarXiv:2606.03748v12026What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics
Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1
cs.CLcs.AIcs.LGarXiv:2606.25182v12026Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
Guoheng Sun, Kaixi Feng, Shwai He +8
cs.ROcs.AIarXiv:2606.27755v12026Critique of Agent Model
Eric Xing, Mingkai Deng, Jinyu Hou
cs.AIcs.LGcs.MAarXiv:2606.23991v12026Mind the Heads: Topological Representation Alignment for Multimodal LLMs
Davide Caffagni, Alberto Compagnoni, Federico Melis +5
cs.CVcs.AIcs.CLarXiv:2606.23885v12026Summaries:한국어InSight: Self-Guided Skill Acquisition via Steerable VLAs
Maggie Wang, Lars Osterberg, Stephen Tian +3
cs.ROcs.AIcs.LGarXiv:2606.24884v12026ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection
Chenhao Dang, Dantong Zhu, Jun Yang +2
cs.AIarXiv:2606.24112v22026Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
Atin Pothiraj, Jaemin Cho, Yue Zhang +2
cs.CVcs.AIarXiv:2606.25306v12026COrigami: An AI Pipeline for Co-Designing Flat-Foldable Visually Recognisable Origami
Tom Zahavy, Shaobo Hou, Thomas Tumiel +16
cs.AIarXiv:2606.26299v12026Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
Changdae Oh, Wendi Li, Seongheon Park +3
cs.LGcs.AIarXiv:2606.26080v12026Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?
Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu +1
cs.ROcs.AIarXiv:2606.26428v22026Information-Aware KV Cache Compression for Long Reasoning
Jushi Kai, Zhuiri Xiao, Alexandra Birch +1
cs.CLcs.AIarXiv:2606.26875v12026Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)
Ilia Larchenko
cs.ROcs.AIcs.LGarXiv:2606.27163v22026MultiHashFormer: Hash-based Generative Language Models
Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras
cs.CLcs.AIcs.LGarXiv:2606.28057v12026Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation
Jiayi Xu, Di He, Guolin Ke
cs.CVcs.AIarXiv:2606.27978v12026A Gravitational Interpretation of Fine-Tuning Reversion
Samuele Poppi, Nils Lukas
cs.LGcs.AIarXiv:2606.28525v12026Towards Automating Scientific Review with Google's Paper Assistant Tool
Rajesh Jayaram, Drew Tyler, David Woodruff +4
cs.LGcs.AIcs.CLarXiv:2606.28277v12026ReFreeKV: Towards Threshold-Free KV Cache Compression
Xuanfan Ni, Liyan Xu, Chenyang Lyu +6
cs.CLcs.AIcs.LGarXiv:2502.16886v42025One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
Xiaohao Xu, Feng Xue, Xiang Li +5
cs.CVcs.AIarXiv:2606.29600v12026PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
Seongjae Kang, Taehyung Yu, Sung Ju Hwang
cs.AIcs.CLarXiv:2606.29225v12026Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark
Matthias Blaschke, Daniel Kienzle, Zsuzsanna Koczor-Benda +3
cs.LGcond-mat.mes-hallcs.AIarXiv:2606.30170v12026SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
Jiacheng Zhang, Haoyu He, Sen Zhang +5
cs.AIarXiv:2606.29887v12026LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents
Yogeswar Reddy Thota
cs.OScs.AIcs.CVarXiv:2606.30697v12026Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim +1
cs.CVcond-mat.mtrl-scics.AIarXiv:2606.29667v12026Little Brains, Big Feats: Exploring Compact Language Models
Dari Baturova, Elena Bruches, Ivan Chernov +3
cs.CLcs.AIarXiv:2606.30062v12026JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
Oxygen AIIC, Chan Long, Chao Liu +52
cs.AIarXiv:2606.28070v22026DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation
Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami +6
cs.LGcs.AIarXiv:2606.29961v120263D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
Dongyoon Hwang, Byungkun Lee, Dongjin Kim +7
cs.ROcs.AIarXiv:2606.31329v22026MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
Yuxuan Fan, Gyusik Seo, Jing Hao +3
cs.CVcs.AIarXiv:2606.30026v12026Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
Mingzhe Du, Luu Anh Tuan, Tianyi Wu +4
cs.AIarXiv:2607.01764v12026Rank-Then-Act: Reward-Free Control from Frame-Order Progress
Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1
cs.LGcs.AIarXiv:2607.01897v12026Spectral Rewiring for Exploration, Purification, and Model Merging
Zhilong Zhang, Hongli Yu, Huan-ang Gao +5
cs.LGcs.AIarXiv:2607.03065v12026MentalThink: Shaping Thoughts in Mental SVG World
Kangheng Lin, Jisheng Yin, Dingming Li +11
cs.AIarXiv:2607.03530v12026CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation
Zhenyu Sun, Xiaohan Zhang, Qi Liu +1
cs.GRcs.AIarXiv:2607.03819v32026CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
Xuyao Huang, Zelai Deng, Xu Wang +2
cs.CVcs.AIarXiv:2607.03803v12026dOPSD: On-Policy Self-Distillation for Diffusion Language Models
Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.CLcs.AIarXiv:2607.04428v12026LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
Yujin Kim, Namgyu Ho, Sangmin Hwang +7
cs.AIarXiv:2607.04412v22026GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
Kaiyuan Chen, Shuangyu Xie, Letian Fu +21
cs.ROcs.AIcs.CLarXiv:2607.05369v12026Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
Suhyeong Park, Junha Jung, Jungwoo Park +1
cs.IRcs.AIcs.CLarXiv:2607.04605v22026Unified Audio Intelligence Without Regressing on Text Intelligence
Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17
cs.CLcs.AIcs.LGarXiv:2607.05196v22026CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training
Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1
cs.CVcs.AIcs.LGarXiv:2607.02998v22026CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
Hairui Zhu, Yiying Yang, Tengjin Weng +5
cs.CVcs.AIarXiv:2607.05465v12026TREK: Distill to Explore, Reinforce to Refine
Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10
cs.LGcs.AIstat.MLarXiv:2607.05339v12026Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.CVcs.AIarXiv:2607.06309v12026Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
Tommaso Cerruti, Tim Rieder, George Rowlands +2
cs.LGcs.AIarXiv:2607.07953v12026Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
Haozhan Tang, Zerui Wang, Yuxian Gu +2
cs.LGcs.AIarXiv:2607.07740v22026DrugGen 2: A disease-aware language model for enhancing drug discovery
Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami +4
q-bio.QMcs.AIcs.LGarXiv:2607.08404v12026Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
Ezgi Korkmaz
cs.LGcs.AIarXiv:2607.07769v12026Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
Matteo Santelmo, Xiuying Wei, Israa Fakih +5
cs.AIarXiv:2607.08317v12026OpenCoF: Learning to Reason Through Video Generation
Xinyan Chen, Ziyu Guo, Renrui Zhang +2
cs.CVcs.AIarXiv:2607.08763v12026Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
Vladislav Beliaev
cs.LGcs.AIcs.CLarXiv:2607.07690v12026Phone Segmentation and Recognition through Phonological Activation Mapping
Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8
eess.AScs.AIcs.CLarXiv:2607.09020v12026CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation
Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1
cs.CVcs.AIarXiv:2607.09362v12026MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models
Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan +2
cs.AIcs.GRarXiv:2607.11594v12026