Every paper with a summary
Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
60,481 to 60,540 of 61,302
Trimming the Long-Tail of Visual World Modeling Evaluation
Bingxuan Li, Yining Hong, Cheng Qian +6
cs.CVarXiv:2606.24256v12026Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
Atin Pothiraj, Jaemin Cho, Yue Zhang +2
cs.CVcs.AIarXiv:2606.25306v12026Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports
Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge +1
cs.CVarXiv:2606.28393v12026COrigami: An AI Pipeline for Co-Designing Flat-Foldable Visually Recognisable Origami
Tom Zahavy, Shaobo Hou, Thomas Tumiel +16
cs.AIarXiv:2606.26299v12026Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
Changdae Oh, Wendi Li, Seongheon Park +3
cs.LGcs.AIarXiv:2606.26080v12026The Galaxy's Guide to the Tokenizer: A Benchmark for Scientific Foundation Models
Sogol Sanjaripour, Michael J. Smith, Manuel Pérez-Carrasco +3
astro-ph.IMastro-ph.GAarXiv:2606.25610v12026Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?
Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu +1
cs.ROcs.AIarXiv:2606.26428v22026MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
Yang Chen, Xiaowei Xu, Shuai Wang +4
cs.CVarXiv:2606.26016v32026The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar
Ilseyar Alimova, Bogdan Monogov, Artyom Mazur +5
cs.CLarXiv:2606.26015v12026PhysiFormer: Learning to Simulate Mechanics in World Space
Yiming Chen, Yushi Lan, Andrea Vedaldi
cs.CVarXiv:2606.27364v12026In-Context World Modeling for Robotic Control
Siyin Wang, Junhao Shi, Senyu Fei +4
cs.ROcs.CVarXiv:2606.26025v32026Information-Aware KV Cache Compression for Long Reasoning
Jushi Kai, Zhuiri Xiao, Alexandra Birch +1
cs.CLcs.AIarXiv:2606.26875v12026One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications
Szu-Wei Fu, Rong Chao, Xuesong Yang +4
cs.SDarXiv:2606.25621v22026Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)
Ilia Larchenko
cs.ROcs.AIcs.LGarXiv:2606.27163v22026How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring
Zhihao Lin, Mingyi Zhou, Yizhuo Yang +1
cs.SEarXiv:2606.26979v22026Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents
Minbyul Jeong
cs.CLarXiv:2606.27595v12026Qwen-Image-2.0-RL Technical Report
Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25
cs.CVcs.LGarXiv:2606.27608v12026NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
Tianlin Pan, Lianyu Pang, Cheng Da +4
cs.LGcs.CVarXiv:2606.27771v52026MultiHashFormer: Hash-based Generative Language Models
Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras
cs.CLcs.AIcs.LGarXiv:2606.28057v12026GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems
Xiaocheng Yang, Abdulrahman Alrabah, Dilek Hakkani-Tür +1
cs.MAarXiv:2606.28187v12026How Good Can Linear Models Be for Time-Series Forecasting?
Lang Huang, Jinglue Xu, Luke Darlow
cs.LGarXiv:2606.27282v22026Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation
Jiayi Xu, Di He, Guolin Ke
cs.CVcs.AIarXiv:2606.27978v12026Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE
Haoyou Deng, Keyu Yan, Chaojie Mao +4
cs.CVarXiv:2606.26938v12026A Gravitational Interpretation of Fine-Tuning Reversion
Samuele Poppi, Nils Lukas
cs.LGcs.AIarXiv:2606.28525v12026Towards Automating Scientific Review with Google's Paper Assistant Tool
Rajesh Jayaram, Drew Tyler, David Woodruff +4
cs.LGcs.AIcs.CLarXiv:2606.28277v12026ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval
Siqiao Xue, Chunxue Xu
cs.CVarXiv:2606.27708v12026When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
Yiling Tao, Shihan Deng, Meiling Tao +3
cs.CLarXiv:2606.27669v22026ReFreeKV: Towards Threshold-Free KV Cache Compression
Xuanfan Ni, Liyan Xu, Chenyang Lyu +6
cs.CLcs.AIcs.LGarXiv:2502.16886v42025One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
Xiaohao Xu, Feng Xue, Xiang Li +5
cs.CVcs.AIarXiv:2606.29600v12026Geometric Stability of Neural Population Codes: Regional Variation, Behavioral Relevance, and Circuit Dependence
Prashant C. Raju
q-bio.NCcs.NEq-bio.QMarXiv:2606.29655v12026Learning Transferable Dynamics Priors from Action to World Modeling
Ze Huang, Jiahui Zhang, Hairuo Liu +3
cs.ROarXiv:2606.29501v12026PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
Seongjae Kang, Taehyung Yu, Sung Ju Hwang
cs.AIcs.CLarXiv:2606.29225v12026Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
Chonghuinan Wang, Zhikai Chen, Chunwei Wang +9
cs.CVarXiv:2606.30054v12026One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding
Chen Liu, Ling Chen, Hanzhang Zhou +5
cs.CVarXiv:2606.30084v12026Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark
Matthias Blaschke, Daniel Kienzle, Zsuzsanna Koczor-Benda +3
cs.LGcond-mat.mes-hallcs.AIarXiv:2606.30170v12026SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
Jiacheng Zhang, Haoyu He, Sen Zhang +5
cs.AIarXiv:2606.29887v12026DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model
Daniyel Ayupov, Artur Markov-Tsoy
cs.LGcs.CVarXiv:2606.30292v12026Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis
Shufan Li, Greg Heinrich, Hanrong Ye +4
cs.CVarXiv:2606.29814v22026BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
Haitao Wu, Qirui Zhang, Zhouheng Yao +8
cs.CVcs.LGarXiv:2606.30319v12026CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion
Pan Wang, Yihao Hu, Xiujin Liu
cs.CVarXiv:2606.30030v12026One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining
Philip Zmushko, Egor Petrov, Nursultan Abdullaev +2
cs.LGarXiv:2606.30634v12026LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents
Yogeswar Reddy Thota
cs.OScs.AIcs.CVarXiv:2606.30697v12026Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim +1
cs.CVcond-mat.mtrl-scics.AIarXiv:2606.29667v12026SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
Zhiyuan Ma, Zhengfeng Shi, Yuning An +6
cs.CVarXiv:2606.30124v12026Little Brains, Big Feats: Exploring Compact Language Models
Dari Baturova, Elena Bruches, Ivan Chernov +3
cs.CLcs.AIarXiv:2606.30062v12026JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
Oxygen AIIC, Chan Long, Chao Liu +52
cs.AIarXiv:2606.28070v22026Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
Sen Liang, Cong Wang, Zhentao Yu +8
cs.CVarXiv:2606.30599v22026DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation
Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami +6
cs.LGcs.AIarXiv:2606.29961v12026Teaching LLMs to Recommend and Defer in Underrepresented Epilepsy Care
Shreyas Rajesh, Kartik Sharma, Tonmoy Monsoor +8
cs.LGarXiv:2606.31036v120263D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
Dongyoon Hwang, Byungkun Lee, Dongjin Kim +7
cs.ROcs.AIarXiv:2606.31329v22026MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
Yuxuan Fan, Gyusik Seo, Jing Hao +3
cs.CVcs.AIarXiv:2606.30026v12026RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
Zhihao Lin, Mingyi Zhou, Zhensu Sun +4
cs.SEarXiv:2607.01213v12026Multi-Turn Agentic Scientific Literature Search via Workflow Induction
Jisen Li, Bingxuan Li, Nanyi Jiang +10
cs.CLcs.IRarXiv:2607.00597v22026Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
Yoonhyung Park, Minji Kim, Sungwon Moon +1
cs.CVcs.MMcs.ROarXiv:2607.00302v12026When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
Yushi Sun, Bowen Cao, Wai Lam
cs.DBcs.CLarXiv:2607.00394v12026Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
Mingzhe Du, Luu Anh Tuan, Tianyi Wu +4
cs.AIarXiv:2607.01764v12026Rank-Then-Act: Reward-Free Control from Frame-Order Progress
Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1
cs.LGcs.AIarXiv:2607.01897v12026Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment
Anisha Pattanayak, Hanie Kang, Huang-Cheng Chou +2
eess.ASarXiv:2607.02920v12026Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
Xinyin Ma, Julius Berner, Chao Liu +3
cs.CVarXiv:2607.03509v12026Spectral Rewiring for Exploration, Purification, and Model Merging
Zhilong Zhang, Hongli Yu, Huan-ang Gao +5
cs.LGcs.AIarXiv:2607.03065v12026