Every paper with a summary
Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
59,401 to 59,460 of 61,255
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
Yifan Dai, Zhenhua Wu, Bohan Zeng +18
cs.CLcs.CVarXiv:2605.22012v12026WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models
Bohai Gu, Taiyi Wu, Yueyang Yuan +9
cs.CVarXiv:2605.25077v12026Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis
Yixuan Yang, Zhen Luo, Wanshui Gan +5
cs.CVcs.GRarXiv:2605.18451v12026Interactive Evaluation Requires a Design Science
Keyang Xuan, Peiyang Song, Pan Lu +10
cs.AIarXiv:2605.17829v12026LatentUMM: Dual Latent Alignment for Unified Multimodal Models
Yinyi Luo, Wenwen Wang, Hayes Bai +2
cs.CVarXiv:2605.17766v12026TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization
Chonghao Zhong, Linfeng Shi, Hua Chen +4
cs.CVcs.PFarXiv:2605.20150v22026TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload
Zhiben Chen, Youpeng Zhao, Yang Sui +2
cs.CLarXiv:2605.20179v12026MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh +3
cs.CLcs.AIarXiv:2605.18565v22026Mem-$π$: Adaptive Memory through Learning When and What to Generate
Xiaoqiang Wang, Chao Wang, Hadi Nekoei +5
cs.CLcs.AIarXiv:2605.21463v12026Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines
Alimurtaza Mustafa Merchant, Krish Veera, Sajal Kumar Goyla +3
cs.AIarXiv:2605.20630v12026You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
Zhepei Wei, Xinyu Zhu, Wei-Lin Chen +3
cs.LGcs.CLarXiv:2605.21468v12026FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching
Jangho Park, Geon Yeong Park, Gihyun Kwon +1
cs.CVarXiv:2605.20910v12026Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
Dong Chen, Fangyun Wei, Ziyu Wan +18
cs.CVarXiv:2605.21573v12026FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
Haokun Wen, Xuemeng Song, Xinghao Xie +3
cs.CVcs.MMarXiv:2605.22552v12026ACL-Verbatim: hallucination-free question answering for research
Gábor Recski, Szilveszter Tóth, Nadia Verdha +2
cs.CLcs.AIcs.SEarXiv:2605.21102v12026SceneAligner: 3D-Grounded Floorplan Localization in the Wild
Junhyeong Cho, Ruojin Cai, Hadar Averbuch-Elor
cs.CVcs.AIcs.LGarXiv:2605.22581v12026WorldKV: Efficient World Memory with World Retrieval and Compression
Jung Yi, Minjae Kim, Paul Hyunbin Cho +3
cs.CVarXiv:2605.22718v12026The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
Karan Goyal
cs.CVcs.AIarXiv:2604.20665v22026CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models
León Begiristain, Olaf Dünkel, Adam Kortylewski
cs.CVarXiv:2605.23699v12026ETCHR: Editing To Clarify and Harness Reasoning
Beichen Zhang, Yuhong Liu, Jinsong Li +3
cs.CVcs.AIcs.CLarXiv:2605.23897v12026SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
Yingtie Lei, Zhongwei Wan, Jiankun Zhang +13
cs.AIarXiv:2605.24117v12026Breaking the Chains of Probability: Neutrosophic Logic as a New Framework for Epistemic Uncertainty in Large Language Models
Maikel Yelandi Leyva-Vázquez, Florentin Smarandache
cs.AIcs.CLcs.LGarXiv:2605.24053v12026SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
Jianshu Zhang, Yijiang Li, Huifeixin Chen +4
cs.AIarXiv:2605.23898v12026Measuring the Depth of LLM Unlearning via Activation Patching
Jaeung Lee, Dohyun Kim, Jaemin Jo
cs.CLcs.AIcs.LGarXiv:2605.24614v12026Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion
Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu +10
cs.CVarXiv:2605.25449v32026Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning
Fanhu Zeng, Zhicong Luo, Zefan Wang +3
cs.CVarXiv:2605.25437v12026When Tool-Backed Skill Retrieval Fails: Source-Style Collapse in Executable Capability Retrieval
Yiqi Liu, Joseph James, Yang Wang +2
cs.LGcs.IRarXiv:2608.16502v12026Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation
Mingqiang Wu, Weilun Feng, Zhefeng Zhang +8
cs.CVarXiv:2605.16003v12026ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
Juncheng Wu, Letian Zhang, Yuhan Wang +5
cs.CLarXiv:2605.20176v12026Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement
Dingwei Chen, Zefang Zong, Zhipeng Ma +5
cs.CLarXiv:2605.26952v12026AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling
Yiheng Li, Zhuo Li, Ruibing Hou +4
cs.CVcs.AIarXiv:2605.29488v22026Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang +3
cs.CVcs.AIarXiv:2605.30231v12026OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning
Yunyang Ge, Xianyi He, Zezhong Zhang +4
cs.CVarXiv:2605.28691v12026How LoRA Remembers? A Parametric Memory Law for LLM Finetuning
Ziwen Xu, Haiwen Hong, Linsong Yu +4
cs.CLcs.AIcs.CVarXiv:2605.30260v12026Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
Cheolhong Min, Jaeyun Jung, Daeun Lee +5
cs.CVarXiv:2605.30161v12026A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems
Titu Ranjan Sarker, Muhammed Jawaad Zulqernine, Ling Yue +3
cs.AIarXiv:2606.00138v12026SurGe: Improved Surface Geometry in Point Maps
Karim Knaebel, Gonzalo Martin Garcia, Christian Schmidt +4
cs.CVarXiv:2605.31577v12026PEEK: Picking Essential frames via Efficient Knowledge distillation
Killian Steunou, Anas Filali Razzouki, Khalil Guetari +2
cs.CVarXiv:2605.31029v12026Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
Ke Lei, Yu Zhang, Changhao Pan +4
eess.AScs.MMcs.SDarXiv:2605.30940v12026Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
Liyang Li, Muzhi Zhu, Zhiyue Zhao +5
cs.CVarXiv:2606.01247v12026Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning
Jiapeng Zhu, Jianxiang Yu, Yibo Zhao +5
cs.CLarXiv:2605.28424v12026Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling
Xinglin Wang, Hao Lin, Shaoxiong Feng +9
cs.CLarXiv:2605.27030v12026PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft
Yuchen Guo, Junli Gong, Weicheng Wang +3
cs.AIarXiv:2605.27762v22026Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)
Samer Awad, Javier Conde, Carlos Arriaga +3
cs.CLcs.AIarXiv:2605.27268v12026Self-Improving Language Models with Bidirectional Evolutionary Search
Guowei Xu, Zhenting Qi, Huangyuan Su +4
cs.CLarXiv:2605.28814v12026SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control
Zhida Zhang, Jie Ma, Zhan Peng +5
cs.CVcs.AIarXiv:2605.27891v12026From Pixels to Words -- Towards Native One-Vision Models at Scale
Haiwen Diao, Jiahao Wang, Penghao Wu +18
cs.CVarXiv:2605.28820v12026FRAPPE: Full Input, Residual Output Autoencoding with Projection Pursuit Encoder
Dan Jacobellis, Neeraja J. Yadwadkar
eess.IVarXiv:2605.28992v12026CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists
Junlin Yang, Dylan Zhang, Xiangchen Song +7
cs.AIcs.CLarXiv:2605.26029v22026Xetrieval: Mechanistically Explaining Dense Retrieval
Zhixin Cai, Jun Bai, Yang Liu +7
cs.AIcs.IRarXiv:2605.29507v12026Colored Noise Diffusion Sampling
Hadar Davidson, Noam Issachar, Sagie Benaim
cs.CVarXiv:2605.30332v12026Linearizing Vision Transformer with Test-Time Training
Yining Li, Dongchen Han, Zeyu Liu +3
cs.CVarXiv:2605.02772v22026Exploring Autonomous Agentic Data Engineering for Model Specialization
Yujie Luo, Xiangyuan Ru, Jingsheng Zheng +10
cs.CLcs.AIcs.IRarXiv:2605.30407v22026SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search
Yunbo Tang, Chengyi Yang, Shiyu Liu +4
cs.AIcs.CLcs.LGarXiv:2605.29796v32026VLM3: Vision Language Models Are Native 3D Learners
Zhipeng Cai, Zhuang Liu, Yunyang Xiong +3
cs.CVcs.AIarXiv:2605.30561v12026Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation
M. Ali Bayram, Banu Diri, Savaş Yıldırım
cs.CLarXiv:2605.29992v12026Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents
Ziyan Liu, Zhezheng Hao, Yeqiu Chen +7
cs.AIarXiv:2605.30159v12026Trust-Region Behavior Blending for On-Policy Distillation
Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov +4
cs.LGcs.AIarXiv:2605.31159v12026MindZero: Learning Online Mental Reasoning With Zero Annotations
Shunchi Zhang, Jin Lu, Chuanyang Jin +3
cs.AIcs.MAarXiv:2606.00240v12026LVSA: Training-Free Sparse Attention for Long Video Diffusion
Gael Glorian, Ioannis Lamprou, Zhen Zhang +2
cs.CVcs.LGarXiv:2605.31057v12026