Every paper with a summary
Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
50,941 to 51,000 of 61,116
Riemannian Motion Generation: A Unified Framework for Human Motion Representation and Generation via Riemannian Flow Matching
Fangran Miao, Jian Huang, Ting Li
cs.CVstat.MLarXiv:2603.15016v12026ByT5: Towards a token-free future with pre-trained byte-to-byte models
Linting Xue, Aditya Barua, Noah Constant +5
cs.CLarXiv:2105.13626v32021SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
Shufan Li, Jiuxiang Gu, Kangning Liu +3
cs.CVarXiv:2603.15150v12026Macro-Action Topological Navigation under Noisy Localization using Reinforcement Learning
Simon Hakenes, Tobias Glasmachers
cs.LGcs.ROarXiv:2608.23055v12026Efficient Document Parsing via Parallel Token Prediction
Lei Li, Ze Zhao, Meng Li +6
cs.CLcs.CVarXiv:2603.15206v12026Blockchained On-Device Federated Learning
Hyesung Kim, Jihong Park, Mehdi Bennis +1
cs.ITcs.NIarXiv:1808.03949v22018Bayesian Computing with INLA: A Review
Håvard Rue, Andrea Riebler, Sigrunn H. Sørbye +3
stat.MEarXiv:1604.00860v22016Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models
Lexiang Xiong, Qi Li, Jingwen Ye +1
cs.CVarXiv:2603.15557v12026Hierarchy-Aware Semantic Losses for Knowledge Graph Link Prediction
Filip Kronström, Ross D. King
cs.LGarXiv:2608.22981v12026ViT-AdaLA: Adapting Vision Transformers with Linear Attention
Yifan Li, Seunghyun Yoon, Viet Dac Lai +4
cs.CVarXiv:2603.16063v12026One-Shot Imitation Learning
Yan Duan, Marcin Andrychowicz, Bradly C. Stadie +5
cs.AIcs.LGcs.NEarXiv:1703.07326v32017SAGE: Stability-Aware Graph-Based Ensemble Feature Selection for Explainable Postpartum Depression Risk Prediction
Md. Rokon Islam Emon, Syed Shariar Alam Shuvo, Shahriar Siddique Ayon +2
cs.LGarXiv:2608.22809v12026Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
Peng Sun, Jun Xie, Tao Lin
cs.CVarXiv:2603.16139v12026Debiased Contrastive Learning
Ching-Yao Chuang, Joshua Robinson, Lin Yen-Chen +2
cs.LGstat.MLarXiv:2007.00224v32020Mixture of Style Experts for Diverse Image Stylization
Shihao Zhu, Ziheng Ouyang, Yijia Kang +5
cs.CVarXiv:2603.16649v32026ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models
M. Arda Aydın, Melih B. Yilmaz, Aykut Koç +1
cs.CVarXiv:2603.17079v12026Neural Variational Inference and Learning in Belief Networks
Andriy Mnih, Karol Gregor
cs.LGstat.MLarXiv:1402.0030v22014Emergent Compositional Communication for Latent World Properties
Tomek Kaszyński
cs.MAcs.LGarXiv:2604.03266v12026A Comprehensive Analysis of Arabic Natural Language Processing Research: Trends, Topic Evolution, and Research Gaps -- A Bibliometric and Topic-Based Study
Mullosharaf K. Arabov
cs.CLarXiv:2608.23421v22026AlphaPose: Whole-Body Regional Multi-Person Pose Estimation and Tracking in Real-Time
Hao-Shu Fang, Jiefeng Li, Hongyang Tang +5
cs.CVarXiv:2211.03375v12022FormuEvo: LLM-Guided Evolution for Discovering Solver-Efficient Mixed-Integer Programming Formulations
Haofeng Yuan, Jianing Peng, Jieyi Bi +3
cs.CLcs.NEarXiv:2608.23353v12026Multi-Task Feature Learning Via Efficient l2,1-Norm Minimization
Jun Liu, Shuiwang Ji, Jieping Ye
cs.LGcs.CVstat.MLarXiv:1205.2631v12012Towards the Systematic Reporting of the Energy and Carbon Footprints of Machine Learning
Peter Henderson, Jieru Hu, Joshua Romoff +3
cs.CYcs.LGarXiv:2002.05651v22020Render for CNN: Viewpoint Estimation in Images Using CNNs Trained with Rendered 3D Model Views
Hao Su, Charles R. Qi, Yangyan Li +1
cs.CVarXiv:1505.05641v12015ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2
cs.CVarXiv:2603.19466v22026EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
cs.CVcs.AIarXiv:2608.23563v12026FSD50K: An Open Dataset of Human-Labeled Sound Events
Eduardo Fonseca, Xavier Favory, Jordi Pons +2
cs.SDcs.LGeess.ASarXiv:2010.00475v22020AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent Forecasting
Ye Yuan, Xinshuo Weng, Yanglan Ou +1
cs.AIcs.CVcs.LGarXiv:2103.14023v32021From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering
Xinyi Shang, Yi Tang, Jiacheng Cui +9
cs.CVcs.AIcs.LGarXiv:2603.20193v12026What's the Catch? Evaluating Temporal Consistency in Vision-Language Models
Marek Hradil, Danae Sánchez Villegas
cs.CLcs.AIcs.CVarXiv:2608.23474v220262Xplat: Decoupling Geometry and Appearance Modeling for Feed-Forward 3D Gaussian Splatting
Hwasik Jeong, Seungryong Lee, Gyeongjin Kang +4
cs.CVarXiv:2603.21064v32026Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
Jianrui Zhang, Yue Yang, Rohun Tripathi +5
cs.CVcs.AIcs.LGarXiv:2603.18004v12026Synthesized Classifiers for Zero-Shot Learning
Soravit Changpinyo, Wei-Lun Chao, Boqing Gong +1
cs.CVarXiv:1603.00550v32016Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models
Aryan Kasat, Smriti Singh, Aman Chadha +1
cs.AIarXiv:2603.21854v12026LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans
Parisa Ghanad Torshizi, Stacy Marsella
cs.AIcs.HCcs.ROarXiv:2608.22731v12026Multi-User Large Language Model Agents
Shu Yang, Shenzhe Zhu, Hao Zhu +5
cs.CLcs.MAarXiv:2604.08567v22026HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1
cs.CVcs.AIarXiv:2603.18558v22026Modularity and community detection in bipartite networks
Michael J. Barber
physics.data-ancond-mat.stat-mechphysics.soc-pharXiv:0707.1616v32007DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation
Guhan Chen, Songtao Tian, Bohan Li +3
cs.CLarXiv:2608.22806v12026Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
Yuqing Wang, Chuofan Ma, Zhijie Lin +7
cs.CVarXiv:2603.19232v12026Conditional Convolutions for Instance Segmentation
Zhi Tian, Chunhua Shen, Hao Chen
cs.CVarXiv:2003.05664v42020Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction
Jeremy Reizenstein, Roman Shapovalov, Philipp Henzler +3
cs.CVarXiv:2109.00512v12021SPOC-SQL: Stage-wise Preference Optimization for Controllable Text-to-SQL
Yingnan Chen, Chun Ding, Tianshi Xu +2
cs.CLarXiv:2608.22772v12026Matryoshka Gaussian Splatting
Zhilin Guo, Boqiao Zhang, Hakan Aktas +11
cs.CVcs.GRarXiv:2603.19234v22026Autonomous Vehicles that Interact with Pedestrians: A Survey of Theory and Practice
Amir Rasouli, John K. Tsotsos
cs.ROcs.CVcs.HCarXiv:1805.11773v12018GPflow: A Gaussian process library using TensorFlow
Alexander G. de G. Matthews, Mark van der Wilk, Tom Nickson +5
stat.MLarXiv:1610.08733v12016Cost-Effective Active Learning for Deep Image Classification
Keze Wang, Dongyu Zhang, Ya Li +2
cs.CVarXiv:1701.03551v12017Gated-SCNN: Gated Shape CNNs for Semantic Segmentation
Towaki Takikawa, David Acuna, Varun Jampani +1
cs.CVcs.LGarXiv:1907.05740v12019Compositional Visual Generation with Composable Diffusion Models
Nan Liu, Shuang Li, Yilun Du +2
cs.CVcs.AIcs.LGarXiv:2206.01714v62022Retentive Network: A Successor to Transformer for Large Language Models
Yutao Sun, Li Dong, Shaohan Huang +5
cs.CLcs.LGarXiv:2307.08621v42023Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition
Kyle Stein, Guillermo Francia, III Eman El-Sheikh +1
cs.CRcs.AIarXiv:2608.23536v12026Semantic Audio-Visual Navigation in Continuous Environments
Yichen Zeng, Hebaixu Wang, Meng Liu +4
cs.CVcs.SDarXiv:2603.19660v12026WorldAgents: Can Foundation Image Models be Agents for 3D World Models?
Ziya Erkoç, Angela Dai, Matthias Nießner
cs.CVarXiv:2603.19708v12026Learning-Based View Synthesis for Light Field Cameras
Nima Khademi Kalantari, Ting-Chun Wang, Ravi Ramamoorthi
cs.CVcs.GRarXiv:1609.02974v12016Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
Sangoh Lee, Sangwoo Mo, Wook-Shin Han
cs.ROcs.AIcs.CVarXiv:2608.23478v12026ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled Illumination
Jan-Niklas Dihlmann, Mark Boss, Simon Donne +3
cs.CVcs.GRarXiv:2603.19753v12026On instabilities of deep learning in image reconstruction - Does AI come at a cost?
Vegard Antun, Francesco Renna, Clarice Poon +2
cs.CVarXiv:1902.05300v12019Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews
Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo +13
cs.IRcs.AIcs.DLarXiv:2603.22327v22026RetinaFace: Single-stage Dense Face Localisation in the Wild
Jiankang Deng, Jia Guo, Yuxiang Zhou +3
cs.CVarXiv:1905.00641v22019Fair splits flip the leaderboard: CHANRG reveals limited generalization in RNA secondary-structure prediction
Zhiyuan Chen, Zhenfeng Deng, Pan Deng +4
q-bio.BMcs.LGarXiv:2603.22330v12026