Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

14,881 to 14,940 of 15,269

  1. Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

    Zhuofeng Li, Haoxiang Zhang, Cong Wei +16

    cs.IRcs.AIarXiv:2605.05242v12026
    Summaries:한국어
  2. ELF: Embedded Language Flows

    Keya Hu, Linlu Qiu, Yiyang Lu +5

    cs.CLcs.AIcs.LGarXiv:2605.10938v22026
  3. SkillGrad: Optimizing Agent Skills Like Gradient Descent

    Hanyu Wang, Yifan Lan, Bochuan Cao +2

    cs.AIarXiv:2605.27760v12026
  4. MiniMax Sparse Attention

    Xunhao Lai, Weiqi Xu, Yufeng Yang +14

    cs.AIarXiv:2606.13392v22026
  5. AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

    Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4

    cs.SEcs.AIarXiv:2605.12925v32026
  6. Cosmos 3: Omnimodal World Models for Physical AI

    NVIDIA, :, Aditi +293

    cs.CVcs.AIcs.LGarXiv:2606.02800v42026
  7. Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

    Glenn Jocher, Jing Qiu, Mengyu Liu +3

    cs.CVcs.AIarXiv:2606.03748v12026
  8. What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

    Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1

    cs.CLcs.AIcs.LGarXiv:2606.25182v12026
  9. Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

    Guoheng Sun, Kaixi Feng, Shwai He +8

    cs.ROcs.AIarXiv:2606.27755v12026
  10. Critique of Agent Model

    Eric Xing, Mingkai Deng, Jinyu Hou

    cs.AIcs.LGcs.MAarXiv:2606.23991v12026
  11. Mind the Heads: Topological Representation Alignment for Multimodal LLMs

    Davide Caffagni, Alberto Compagnoni, Federico Melis +5

    cs.CVcs.AIcs.CLarXiv:2606.23885v12026
    Summaries:한국어
  12. InSight: Self-Guided Skill Acquisition via Steerable VLAs

    Maggie Wang, Lars Osterberg, Stephen Tian +3

    cs.ROcs.AIcs.LGarXiv:2606.24884v12026
  13. ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

    Chenhao Dang, Dantong Zhu, Jun Yang +2

    cs.AIarXiv:2606.24112v22026
  14. Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

    Atin Pothiraj, Jaemin Cho, Yue Zhang +2

    cs.CVcs.AIarXiv:2606.25306v12026
  15. COrigami: An AI Pipeline for Co-Designing Flat-Foldable Visually Recognisable Origami

    Tom Zahavy, Shaobo Hou, Thomas Tumiel +16

    cs.AIarXiv:2606.26299v12026
  16. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

    Changdae Oh, Wendi Li, Seongheon Park +3

    cs.LGcs.AIarXiv:2606.26080v12026
  17. Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

    Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu +1

    cs.ROcs.AIarXiv:2606.26428v22026
  18. Information-Aware KV Cache Compression for Long Reasoning

    Jushi Kai, Zhuiri Xiao, Alexandra Birch +1

    cs.CLcs.AIarXiv:2606.26875v12026
  19. Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

    Ilia Larchenko

    cs.ROcs.AIcs.LGarXiv:2606.27163v22026
  20. MultiHashFormer: Hash-based Generative Language Models

    Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras

    cs.CLcs.AIcs.LGarXiv:2606.28057v12026
  21. Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

    Jiayi Xu, Di He, Guolin Ke

    cs.CVcs.AIarXiv:2606.27978v12026
  22. A Gravitational Interpretation of Fine-Tuning Reversion

    Samuele Poppi, Nils Lukas

    cs.LGcs.AIarXiv:2606.28525v12026
  23. Towards Automating Scientific Review with Google's Paper Assistant Tool

    Rajesh Jayaram, Drew Tyler, David Woodruff +4

    cs.LGcs.AIcs.CLarXiv:2606.28277v12026
  24. ReFreeKV: Towards Threshold-Free KV Cache Compression

    Xuanfan Ni, Liyan Xu, Chenyang Lyu +6

    cs.CLcs.AIcs.LGarXiv:2502.16886v42025
  25. One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

    Xiaohao Xu, Feng Xue, Xiang Li +5

    cs.CVcs.AIarXiv:2606.29600v12026
  26. PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents

    Seongjae Kang, Taehyung Yu, Sung Ju Hwang

    cs.AIcs.CLarXiv:2606.29225v12026
  27. Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark

    Matthias Blaschke, Daniel Kienzle, Zsuzsanna Koczor-Benda +3

    cs.LGcond-mat.mes-hallcs.AIarXiv:2606.30170v12026
  28. SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

    Jiacheng Zhang, Haoyu He, Sen Zhang +5

    cs.AIarXiv:2606.29887v12026
  29. LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents

    Yogeswar Reddy Thota

    cs.OScs.AIcs.CVarXiv:2606.30697v12026
  30. Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature

    Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim +1

    cs.CVcond-mat.mtrl-scics.AIarXiv:2606.29667v12026
  31. Little Brains, Big Feats: Exploring Compact Language Models

    Dari Baturova, Elena Bruches, Ivan Chernov +3

    cs.CLcs.AIarXiv:2606.30062v12026
  32. JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications

    Oxygen AIIC, Chan Long, Chao Liu +52

    cs.AIarXiv:2606.28070v22026
  33. DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation

    Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami +6

    cs.LGcs.AIarXiv:2606.29961v12026
  34. 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

    Dongyoon Hwang, Byungkun Lee, Dongjin Kim +7

    cs.ROcs.AIarXiv:2606.31329v22026
  35. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

    Yuxuan Fan, Gyusik Seo, Jing Hao +3

    cs.CVcs.AIarXiv:2606.30026v12026
  36. Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

    Mingzhe Du, Luu Anh Tuan, Tianyi Wu +4

    cs.AIarXiv:2607.01764v12026
  37. Rank-Then-Act: Reward-Free Control from Frame-Order Progress

    Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1

    cs.LGcs.AIarXiv:2607.01897v12026
  38. Spectral Rewiring for Exploration, Purification, and Model Merging

    Zhilong Zhang, Hongli Yu, Huan-ang Gao +5

    cs.LGcs.AIarXiv:2607.03065v12026
  39. MentalThink: Shaping Thoughts in Mental SVG World

    Kangheng Lin, Jisheng Yin, Dingming Li +11

    cs.AIarXiv:2607.03530v12026
  40. CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation

    Zhenyu Sun, Xiaohan Zhang, Qi Liu +1

    cs.GRcs.AIarXiv:2607.03819v32026
  41. CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

    Xuyao Huang, Zelai Deng, Xu Wang +2

    cs.CVcs.AIarXiv:2607.03803v12026
  42. dOPSD: On-Policy Self-Distillation for Diffusion Language Models

    Phuong Tuan Dat, Qi Li, Xinchao Wang

    cs.CLcs.AIarXiv:2607.04428v12026
  43. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

    Yujin Kim, Namgyu Ho, Sangmin Hwang +7

    cs.AIarXiv:2607.04412v22026
  44. GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

    Kaiyuan Chen, Shuangyu Xie, Letian Fu +21

    cs.ROcs.AIcs.CLarXiv:2607.05369v12026
  45. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Suhyeong Park, Junha Jung, Jungwoo Park +1

    cs.IRcs.AIcs.CLarXiv:2607.04605v22026
  46. Unified Audio Intelligence Without Regressing on Text Intelligence

    Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17

    cs.CLcs.AIcs.LGarXiv:2607.05196v22026
  47. CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

    Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1

    cs.CVcs.AIcs.LGarXiv:2607.02998v22026
  48. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Hairui Zhu, Yiying Yang, Tengjin Weng +5

    cs.CVcs.AIarXiv:2607.05465v12026
  49. TREK: Distill to Explore, Reinforce to Refine

    Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10

    cs.LGcs.AIstat.MLarXiv:2607.05339v12026
  50. Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification

    Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi

    cs.CVcs.AIarXiv:2607.06309v12026
  51. Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

    Tommaso Cerruti, Tim Rieder, George Rowlands +2

    cs.LGcs.AIarXiv:2607.07953v12026
  52. Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

    Haozhan Tang, Zerui Wang, Yuxian Gu +2

    cs.LGcs.AIarXiv:2607.07740v22026
  53. DrugGen 2: A disease-aware language model for enhancing drug discovery

    Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami +4

    q-bio.QMcs.AIcs.LGarXiv:2607.08404v12026
  54. Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms

    Ezgi Korkmaz

    cs.LGcs.AIarXiv:2607.07769v12026
  55. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Matteo Santelmo, Xiuying Wei, Israa Fakih +5

    cs.AIarXiv:2607.08317v12026
  56. OpenCoF: Learning to Reason Through Video Generation

    Xinyan Chen, Ziyu Guo, Renrui Zhang +2

    cs.CVcs.AIarXiv:2607.08763v12026
  57. Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

    Vladislav Beliaev

    cs.LGcs.AIcs.CLarXiv:2607.07690v12026
  58. Phone Segmentation and Recognition through Phonological Activation Mapping

    Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8

    eess.AScs.AIcs.CLarXiv:2607.09020v12026
  59. CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

    Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1

    cs.CVcs.AIarXiv:2607.09362v12026
  60. MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

    Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan +2

    cs.AIcs.GRarXiv:2607.11594v12026