Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

59,401 to 59,460 of 61,255

  1. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    Yifan Dai, Zhenhua Wu, Bohan Zeng +18

    cs.CLcs.CVarXiv:2605.22012v12026
  2. WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models

    Bohai Gu, Taiyi Wu, Yueyang Yuan +9

    cs.CVarXiv:2605.25077v12026
  3. Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis

    Yixuan Yang, Zhen Luo, Wanshui Gan +5

    cs.CVcs.GRarXiv:2605.18451v12026
  4. Interactive Evaluation Requires a Design Science

    Keyang Xuan, Peiyang Song, Pan Lu +10

    cs.AIarXiv:2605.17829v12026
  5. LatentUMM: Dual Latent Alignment for Unified Multimodal Models

    Yinyi Luo, Wenwen Wang, Hayes Bai +2

    cs.CVarXiv:2605.17766v12026
  6. TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization

    Chonghao Zhong, Linfeng Shi, Hua Chen +4

    cs.CVcs.PFarXiv:2605.20150v22026
  7. TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload

    Zhiben Chen, Youpeng Zhao, Yang Sui +2

    cs.CLarXiv:2605.20179v12026
  8. MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

    Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh +3

    cs.CLcs.AIarXiv:2605.18565v22026
  9. Mem-$π$: Adaptive Memory through Learning When and What to Generate

    Xiaoqiang Wang, Chao Wang, Hadi Nekoei +5

    cs.CLcs.AIarXiv:2605.21463v12026
  10. Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines

    Alimurtaza Mustafa Merchant, Krish Veera, Sajal Kumar Goyla +3

    cs.AIarXiv:2605.20630v12026
  11. You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

    Zhepei Wei, Xinyu Zhu, Wei-Lin Chen +3

    cs.LGcs.CLarXiv:2605.21468v12026
  12. FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

    Jangho Park, Geon Yeong Park, Gihyun Kwon +1

    cs.CVarXiv:2605.20910v12026
  13. Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models

    Dong Chen, Fangyun Wei, Ziyu Wan +18

    cs.CVarXiv:2605.21573v12026
  14. FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

    Haokun Wen, Xuemeng Song, Xinghao Xie +3

    cs.CVcs.MMarXiv:2605.22552v12026
  15. ACL-Verbatim: hallucination-free question answering for research

    Gábor Recski, Szilveszter Tóth, Nadia Verdha +2

    cs.CLcs.AIcs.SEarXiv:2605.21102v12026
  16. SceneAligner: 3D-Grounded Floorplan Localization in the Wild

    Junhyeong Cho, Ruojin Cai, Hadar Averbuch-Elor

    cs.CVcs.AIcs.LGarXiv:2605.22581v12026
  17. WorldKV: Efficient World Memory with World Retrieval and Compression

    Jung Yi, Minjae Kim, Paul Hyunbin Cho +3

    cs.CVarXiv:2605.22718v12026
  18. The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm

    Karan Goyal

    cs.CVcs.AIarXiv:2604.20665v22026
  19. CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models

    León Begiristain, Olaf Dünkel, Adam Kortylewski

    cs.CVarXiv:2605.23699v12026
  20. ETCHR: Editing To Clarify and Harness Reasoning

    Beichen Zhang, Yuhong Liu, Jinsong Li +3

    cs.CVcs.AIcs.CLarXiv:2605.23897v12026
  21. SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills

    Yingtie Lei, Zhongwei Wan, Jiankun Zhang +13

    cs.AIarXiv:2605.24117v12026
  22. Breaking the Chains of Probability: Neutrosophic Logic as a New Framework for Epistemic Uncertainty in Large Language Models

    Maikel Yelandi Leyva-Vázquez, Florentin Smarandache

    cs.AIcs.CLcs.LGarXiv:2605.24053v12026
  23. SPACENUM: Revisiting Spatial Numerical Understanding in VLMs

    Jianshu Zhang, Yijiang Li, Huifeixin Chen +4

    cs.AIarXiv:2605.23898v12026
  24. Measuring the Depth of LLM Unlearning via Activation Patching

    Jaeung Lee, Dohyun Kim, Jaemin Jo

    cs.CLcs.AIcs.LGarXiv:2605.24614v12026
  25. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion

    Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu +10

    cs.CVarXiv:2605.25449v32026
  26. Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

    Fanhu Zeng, Zhicong Luo, Zefan Wang +3

    cs.CVarXiv:2605.25437v12026
  27. When Tool-Backed Skill Retrieval Fails: Source-Style Collapse in Executable Capability Retrieval

    Yiqi Liu, Joseph James, Yang Wang +2

    cs.LGcs.IRarXiv:2608.16502v12026
  28. Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

    Mingqiang Wu, Weilun Feng, Zhefeng Zhang +8

    cs.CVarXiv:2605.16003v12026
  29. ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning

    Juncheng Wu, Letian Zhang, Yuhan Wang +5

    cs.CLarXiv:2605.20176v12026
  30. Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

    Dingwei Chen, Zefang Zong, Zhipeng Ma +5

    cs.CLarXiv:2605.26952v12026
  31. AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

    Yiheng Li, Zhuo Li, Ruibing Hou +4

    cs.CVcs.AIarXiv:2605.29488v22026
  32. Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

    Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang +3

    cs.CVcs.AIarXiv:2605.30231v12026
  33. OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

    Yunyang Ge, Xianyi He, Zezhong Zhang +4

    cs.CVarXiv:2605.28691v12026
  34. How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

    Ziwen Xu, Haiwen Hong, Linsong Yu +4

    cs.CLcs.AIcs.CVarXiv:2605.30260v12026
  35. Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

    Cheolhong Min, Jaeyun Jung, Daeun Lee +5

    cs.CVarXiv:2605.30161v12026
  36. A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems

    Titu Ranjan Sarker, Muhammed Jawaad Zulqernine, Ling Yue +3

    cs.AIarXiv:2606.00138v12026
  37. SurGe: Improved Surface Geometry in Point Maps

    Karim Knaebel, Gonzalo Martin Garcia, Christian Schmidt +4

    cs.CVarXiv:2605.31577v12026
  38. PEEK: Picking Essential frames via Efficient Knowledge distillation

    Killian Steunou, Anas Filali Razzouki, Khalil Guetari +2

    cs.CVarXiv:2605.31029v12026
  39. Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

    Ke Lei, Yu Zhang, Changhao Pan +4

    eess.AScs.MMcs.SDarXiv:2605.30940v12026
  40. Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?

    Liyang Li, Muzhi Zhu, Zhiyue Zhao +5

    cs.CVarXiv:2606.01247v12026
  41. Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

    Jiapeng Zhu, Jianxiang Yu, Yibo Zhao +5

    cs.CLarXiv:2605.28424v12026
  42. Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling

    Xinglin Wang, Hao Lin, Shaoxiong Feng +9

    cs.CLarXiv:2605.27030v12026
  43. PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

    Yuchen Guo, Junli Gong, Weicheng Wang +3

    cs.AIarXiv:2605.27762v22026
  44. Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

    Samer Awad, Javier Conde, Carlos Arriaga +3

    cs.CLcs.AIarXiv:2605.27268v12026
  45. Self-Improving Language Models with Bidirectional Evolutionary Search

    Guowei Xu, Zhenting Qi, Huangyuan Su +4

    cs.CLarXiv:2605.28814v12026
  46. SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control

    Zhida Zhang, Jie Ma, Zhan Peng +5

    cs.CVcs.AIarXiv:2605.27891v12026
  47. From Pixels to Words -- Towards Native One-Vision Models at Scale

    Haiwen Diao, Jiahao Wang, Penghao Wu +18

    cs.CVarXiv:2605.28820v12026
  48. FRAPPE: Full Input, Residual Output Autoencoding with Projection Pursuit Encoder

    Dan Jacobellis, Neeraja J. Yadwadkar

    eess.IVarXiv:2605.28992v12026
  49. CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists

    Junlin Yang, Dylan Zhang, Xiangchen Song +7

    cs.AIcs.CLarXiv:2605.26029v22026
  50. Xetrieval: Mechanistically Explaining Dense Retrieval

    Zhixin Cai, Jun Bai, Yang Liu +7

    cs.AIcs.IRarXiv:2605.29507v12026
  51. Colored Noise Diffusion Sampling

    Hadar Davidson, Noam Issachar, Sagie Benaim

    cs.CVarXiv:2605.30332v12026
  52. Linearizing Vision Transformer with Test-Time Training

    Yining Li, Dongchen Han, Zeyu Liu +3

    cs.CVarXiv:2605.02772v22026
  53. Exploring Autonomous Agentic Data Engineering for Model Specialization

    Yujie Luo, Xiangyuan Ru, Jingsheng Zheng +10

    cs.CLcs.AIcs.IRarXiv:2605.30407v22026
  54. SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

    Yunbo Tang, Chengyi Yang, Shiyu Liu +4

    cs.AIcs.CLcs.LGarXiv:2605.29796v32026
  55. VLM3: Vision Language Models Are Native 3D Learners

    Zhipeng Cai, Zhuang Liu, Yunyang Xiong +3

    cs.CVcs.AIarXiv:2605.30561v12026
  56. Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation

    M. Ali Bayram, Banu Diri, Savaş Yıldırım

    cs.CLarXiv:2605.29992v12026
  57. Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents

    Ziyan Liu, Zhezheng Hao, Yeqiu Chen +7

    cs.AIarXiv:2605.30159v12026
  58. Trust-Region Behavior Blending for On-Policy Distillation

    Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov +4

    cs.LGcs.AIarXiv:2605.31159v12026
  59. MindZero: Learning Online Mental Reasoning With Zero Annotations

    Shunchi Zhang, Jin Lu, Chuanyang Jin +3

    cs.AIcs.MAarXiv:2606.00240v12026
  60. LVSA: Training-Free Sparse Attention for Long Video Diffusion

    Gael Glorian, Ioannis Lamprou, Zhen Zhang +2

    cs.CVcs.LGarXiv:2605.31057v12026