Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

50,941 to 51,000 of 61,116

  1. Riemannian Motion Generation: A Unified Framework for Human Motion Representation and Generation via Riemannian Flow Matching

    Fangran Miao, Jian Huang, Ting Li

    cs.CVstat.MLarXiv:2603.15016v12026
  2. ByT5: Towards a token-free future with pre-trained byte-to-byte models

    Linting Xue, Aditya Barua, Noah Constant +5

    cs.CLarXiv:2105.13626v32021
  3. SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation

    Shufan Li, Jiuxiang Gu, Kangning Liu +3

    cs.CVarXiv:2603.15150v12026
  4. Macro-Action Topological Navigation under Noisy Localization using Reinforcement Learning

    Simon Hakenes, Tobias Glasmachers

    cs.LGcs.ROarXiv:2608.23055v12026
  5. Efficient Document Parsing via Parallel Token Prediction

    Lei Li, Ze Zhao, Meng Li +6

    cs.CLcs.CVarXiv:2603.15206v12026
  6. Blockchained On-Device Federated Learning

    Hyesung Kim, Jihong Park, Mehdi Bennis +1

    cs.ITcs.NIarXiv:1808.03949v22018
  7. Bayesian Computing with INLA: A Review

    Håvard Rue, Andrea Riebler, Sigrunn H. Sørbye +3

    stat.MEarXiv:1604.00860v22016
  8. Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

    Lexiang Xiong, Qi Li, Jingwen Ye +1

    cs.CVarXiv:2603.15557v12026
  9. Hierarchy-Aware Semantic Losses for Knowledge Graph Link Prediction

    Filip Kronström, Ross D. King

    cs.LGarXiv:2608.22981v12026
  10. ViT-AdaLA: Adapting Vision Transformers with Linear Attention

    Yifan Li, Seunghyun Yoon, Viet Dac Lai +4

    cs.CVarXiv:2603.16063v12026
  11. One-Shot Imitation Learning

    Yan Duan, Marcin Andrychowicz, Bradly C. Stadie +5

    cs.AIcs.LGcs.NEarXiv:1703.07326v32017
  12. SAGE: Stability-Aware Graph-Based Ensemble Feature Selection for Explainable Postpartum Depression Risk Prediction

    Md. Rokon Islam Emon, Syed Shariar Alam Shuvo, Shahriar Siddique Ayon +2

    cs.LGarXiv:2608.22809v12026
  13. Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

    Peng Sun, Jun Xie, Tao Lin

    cs.CVarXiv:2603.16139v12026
  14. Debiased Contrastive Learning

    Ching-Yao Chuang, Joshua Robinson, Lin Yen-Chen +2

    cs.LGstat.MLarXiv:2007.00224v32020
  15. Mixture of Style Experts for Diverse Image Stylization

    Shihao Zhu, Ziheng Ouyang, Yijia Kang +5

    cs.CVarXiv:2603.16649v32026
  16. ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

    M. Arda Aydın, Melih B. Yilmaz, Aykut Koç +1

    cs.CVarXiv:2603.17079v12026
  17. Neural Variational Inference and Learning in Belief Networks

    Andriy Mnih, Karol Gregor

    cs.LGstat.MLarXiv:1402.0030v22014
  18. Emergent Compositional Communication for Latent World Properties

    Tomek Kaszyński

    cs.MAcs.LGarXiv:2604.03266v12026
  19. A Comprehensive Analysis of Arabic Natural Language Processing Research: Trends, Topic Evolution, and Research Gaps -- A Bibliometric and Topic-Based Study

    Mullosharaf K. Arabov

    cs.CLarXiv:2608.23421v22026
  20. AlphaPose: Whole-Body Regional Multi-Person Pose Estimation and Tracking in Real-Time

    Hao-Shu Fang, Jiefeng Li, Hongyang Tang +5

    cs.CVarXiv:2211.03375v12022
  21. FormuEvo: LLM-Guided Evolution for Discovering Solver-Efficient Mixed-Integer Programming Formulations

    Haofeng Yuan, Jianing Peng, Jieyi Bi +3

    cs.CLcs.NEarXiv:2608.23353v12026
  22. Multi-Task Feature Learning Via Efficient l2,1-Norm Minimization

    Jun Liu, Shuiwang Ji, Jieping Ye

    cs.LGcs.CVstat.MLarXiv:1205.2631v12012
  23. Towards the Systematic Reporting of the Energy and Carbon Footprints of Machine Learning

    Peter Henderson, Jieru Hu, Joshua Romoff +3

    cs.CYcs.LGarXiv:2002.05651v22020
  24. Render for CNN: Viewpoint Estimation in Images Using CNNs Trained with Rendered 3D Model Views

    Hao Su, Charles R. Qi, Yangyan Li +1

    cs.CVarXiv:1505.05641v12015
  25. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2

    cs.CVarXiv:2603.19466v22026
  26. EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

    Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

    cs.CVcs.AIarXiv:2608.23563v12026
  27. FSD50K: An Open Dataset of Human-Labeled Sound Events

    Eduardo Fonseca, Xavier Favory, Jordi Pons +2

    cs.SDcs.LGeess.ASarXiv:2010.00475v22020
  28. AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent Forecasting

    Ye Yuan, Xinshuo Weng, Yanglan Ou +1

    cs.AIcs.CVcs.LGarXiv:2103.14023v32021
  29. From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering

    Xinyi Shang, Yi Tang, Jiacheng Cui +9

    cs.CVcs.AIcs.LGarXiv:2603.20193v12026
  30. What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

    Marek Hradil, Danae Sánchez Villegas

    cs.CLcs.AIcs.CVarXiv:2608.23474v22026
  31. 2Xplat: Decoupling Geometry and Appearance Modeling for Feed-Forward 3D Gaussian Splatting

    Hwasik Jeong, Seungryong Lee, Gyeongjin Kang +4

    cs.CVarXiv:2603.21064v32026
  32. Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

    Jianrui Zhang, Yue Yang, Rohun Tripathi +5

    cs.CVcs.AIcs.LGarXiv:2603.18004v12026
  33. Synthesized Classifiers for Zero-Shot Learning

    Soravit Changpinyo, Wei-Lun Chao, Boqing Gong +1

    cs.CVarXiv:1603.00550v32016
  34. Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

    Aryan Kasat, Smriti Singh, Aman Chadha +1

    cs.AIarXiv:2603.21854v12026
  35. LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans

    Parisa Ghanad Torshizi, Stacy Marsella

    cs.AIcs.HCcs.ROarXiv:2608.22731v12026
  36. Multi-User Large Language Model Agents

    Shu Yang, Shenzhe Zhu, Hao Zhu +5

    cs.CLcs.MAarXiv:2604.08567v22026
  37. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1

    cs.CVcs.AIarXiv:2603.18558v22026
  38. Modularity and community detection in bipartite networks

    Michael J. Barber

    physics.data-ancond-mat.stat-mechphysics.soc-pharXiv:0707.1616v32007
  39. DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation

    Guhan Chen, Songtao Tian, Bohan Li +3

    cs.CLarXiv:2608.22806v12026
  40. Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

    Yuqing Wang, Chuofan Ma, Zhijie Lin +7

    cs.CVarXiv:2603.19232v12026
  41. Conditional Convolutions for Instance Segmentation

    Zhi Tian, Chunhua Shen, Hao Chen

    cs.CVarXiv:2003.05664v42020
  42. Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction

    Jeremy Reizenstein, Roman Shapovalov, Philipp Henzler +3

    cs.CVarXiv:2109.00512v12021
  43. SPOC-SQL: Stage-wise Preference Optimization for Controllable Text-to-SQL

    Yingnan Chen, Chun Ding, Tianshi Xu +2

    cs.CLarXiv:2608.22772v12026
  44. Matryoshka Gaussian Splatting

    Zhilin Guo, Boqiao Zhang, Hakan Aktas +11

    cs.CVcs.GRarXiv:2603.19234v22026
  45. Autonomous Vehicles that Interact with Pedestrians: A Survey of Theory and Practice

    Amir Rasouli, John K. Tsotsos

    cs.ROcs.CVcs.HCarXiv:1805.11773v12018
  46. GPflow: A Gaussian process library using TensorFlow

    Alexander G. de G. Matthews, Mark van der Wilk, Tom Nickson +5

    stat.MLarXiv:1610.08733v12016
  47. Cost-Effective Active Learning for Deep Image Classification

    Keze Wang, Dongyu Zhang, Ya Li +2

    cs.CVarXiv:1701.03551v12017
  48. Gated-SCNN: Gated Shape CNNs for Semantic Segmentation

    Towaki Takikawa, David Acuna, Varun Jampani +1

    cs.CVcs.LGarXiv:1907.05740v12019
  49. Compositional Visual Generation with Composable Diffusion Models

    Nan Liu, Shuang Li, Yilun Du +2

    cs.CVcs.AIcs.LGarXiv:2206.01714v62022
  50. Retentive Network: A Successor to Transformer for Large Language Models

    Yutao Sun, Li Dong, Shaohan Huang +5

    cs.CLcs.LGarXiv:2307.08621v42023
  51. Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition

    Kyle Stein, Guillermo Francia, III Eman El-Sheikh +1

    cs.CRcs.AIarXiv:2608.23536v12026
  52. Semantic Audio-Visual Navigation in Continuous Environments

    Yichen Zeng, Hebaixu Wang, Meng Liu +4

    cs.CVcs.SDarXiv:2603.19660v12026
  53. WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

    Ziya Erkoç, Angela Dai, Matthias Nießner

    cs.CVarXiv:2603.19708v12026
  54. Learning-Based View Synthesis for Light Field Cameras

    Nima Khademi Kalantari, Ting-Chun Wang, Ravi Ramamoorthi

    cs.CVcs.GRarXiv:1609.02974v12016
  55. Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

    Sangoh Lee, Sangwoo Mo, Wook-Shin Han

    cs.ROcs.AIcs.CVarXiv:2608.23478v12026
  56. ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled Illumination

    Jan-Niklas Dihlmann, Mark Boss, Simon Donne +3

    cs.CVcs.GRarXiv:2603.19753v12026
  57. On instabilities of deep learning in image reconstruction - Does AI come at a cost?

    Vegard Antun, Francesco Renna, Clarice Poon +2

    cs.CVarXiv:1902.05300v12019
  58. Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews

    Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo +13

    cs.IRcs.AIcs.DLarXiv:2603.22327v22026
  59. RetinaFace: Single-stage Dense Face Localisation in the Wild

    Jiankang Deng, Jia Guo, Yuxiang Zhou +3

    cs.CVarXiv:1905.00641v22019
  60. Fair splits flip the leaderboard: CHANRG reveals limited generalization in RNA secondary-structure prediction

    Zhiyuan Chen, Zhenfeng Deng, Pan Deng +4

    q-bio.BMcs.LGarXiv:2603.22330v12026