Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,201 to 16,260 of 18,855

  1. UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

    Jie Liu, Zilyu Ye, Linxiao Yuan +8

    cs.CVarXiv:2603.23500v12026
  2. GRAF: Generative Radiance Fields for 3D-Aware Image Synthesis

    Katja Schwarz, Yiyi Liao, Michael Niemeyer +1

    cs.CVarXiv:2007.02442v42020
  3. A Simple Pooling-Based Design for Real-Time Salient Object Detection

    Jiang-Jiang Liu, Qibin Hou, Ming-Ming Cheng +2

    cs.CVarXiv:1904.09569v12019
  4. Learning Deep Feature Representations with Domain Guided Dropout for Person Re-identification

    Tong Xiao, Hongsheng Li, Wanli Ouyang +1

    cs.CVarXiv:1604.07528v12016
  5. Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

    Zhongxing Xu, Zhonghua Wang, Zhe Qian +10

    cs.CVcs.AIarXiv:2603.13366v12026
  6. Contrastive Adaptation Network for Unsupervised Domain Adaptation

    Guoliang Kang, Lu Jiang, Yi Yang +1

    cs.CVarXiv:1901.00976v22019
  7. Character Region Awareness for Text Detection

    Youngmin Baek, Bado Lee, Dongyoon Han +2

    cs.CVarXiv:1904.01941v12019
  8. KiloNeRF: Speeding up Neural Radiance Fields with Thousands of Tiny MLPs

    Christian Reiser, Songyou Peng, Yiyi Liao +1

    cs.CVarXiv:2103.13744v22021
  9. Attentional Feature Fusion

    Yimian Dai, Fabian Gieseke, Stefan Oehmcke +2

    cs.CVarXiv:2009.14082v22020
  10. OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation

    Yuheng Liu, Xin Lin, Xinke Li +9

    cs.CVarXiv:2603.30045v12026
  11. AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents

    Yibo Shi, Jungang Li, Linghao Zhang +25

    cs.CVarXiv:2603.18429v12026
  12. Deep Modular Co-Attention Networks for Visual Question Answering

    Zhou Yu, Jun Yu, Yuhao Cui +2

    cs.CVarXiv:1906.10770v12019
  13. Fast Edge Detection Using Structured Forests

    Piotr Dollár, C. Lawrence Zitnick

    cs.CVarXiv:1406.5549v22014
  14. DoRA: Weight-Decomposed Low-Rank Adaptation

    Shih-Yang Liu, Chien-Yi Wang, Hongxu Yin +4

    cs.CLcs.CVarXiv:2402.09353v62024
  15. FLAVA: A Foundational Language And Vision Alignment Model

    Amanpreet Singh, Ronghang Hu, Vedanuj Goswami +4

    cs.CVcs.CLarXiv:2112.04482v32021
  16. Associative Embedding: End-to-End Learning for Joint Detection and Grouping

    Alejandro Newell, Zhiao Huang, Jia Deng

    cs.CVarXiv:1611.05424v22016
  17. UNeXt: MLP-based Rapid Medical Image Segmentation Network

    Jeya Maria Jose Valanarasu, Vishal M. Patel

    eess.IVcs.CVarXiv:2203.04967v12022
  18. The Little Engine that Could: Regularization by Denoising (RED)

    Yaniv Romano, Michael Elad, Peyman Milanfar

    cs.CVmath.NAarXiv:1611.02862v32016
  19. IBRNet: Learning Multi-View Image-Based Rendering

    Qianqian Wang, Zhicheng Wang, Kyle Genova +6

    cs.CVarXiv:2102.13090v22021
  20. Sparsity in Deep Learning: Pruning and growth for efficient inference and training in neural networks

    Torsten Hoefler, Dan Alistarh, Tal Ben-Nun +2

    cs.LGcs.AIcs.ARarXiv:2102.00554v12021
  21. Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention

    Chengtao Lv, Yumeng Shi, Yushi Huang +3

    cs.CVarXiv:2602.04789v42026
  22. Eye Tracking for Everyone

    Kyle Krafka, Aditya Khosla, Petr Kellnhofer +4

    cs.CVarXiv:1606.05814v12016
  23. Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions

    Yunheng Li, Hengrui Zhang, Meng-Hao Guo +5

    cs.CVarXiv:2602.13013v12026
  24. ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth

    Shariq Farooq Bhat, Reiner Birkl, Diana Wofk +2

    cs.CVarXiv:2302.12288v12023
  25. Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models

    Songchun Zhang, Zeyue Xue, Siming Fu +6

    cs.CVarXiv:2603.17051v12026
  26. Multimodal Few-Shot Learning with Frozen Language Models

    Maria Tsimpoukelli, Jacob Menick, Serkan Cabi +3

    cs.CVcs.CLcs.LGarXiv:2106.13884v22021
  27. MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

    Wei Yu, Runjia Qian, Yumeng Li +8

    cs.CVarXiv:2603.17117v12026
  28. Deep Learning for Identifying Metastatic Breast Cancer

    Dayong Wang, Aditya Khosla, Rishab Gargeya +2

    q-bio.QMcs.CVarXiv:1606.05718v12016
  29. Mode Seeking meets Mean Seeking for Fast Long Video Generation

    Shengqu Cai, Weili Nie, Chao Liu +8

    cs.CVcs.LGarXiv:2602.24289v12026
  30. EgoForge: Goal-Directed Egocentric World Simulator

    Yifan Shen, Jiateng Liu, Xinzhuo Li +9

    cs.CVcs.MMarXiv:2603.20169v12026
  31. Streaming Autoregressive Video Generation via Diagonal Distillation

    Jinxiu Liu, Xuanming Liu, Kangfu Mei +3

    cs.CVarXiv:2603.09488v22026
  32. LISA: Reasoning Segmentation via Large Language Model

    Xin Lai, Zhuotao Tian, Yukang Chen +4

    cs.CVarXiv:2308.00692v32023
  33. Rotate to Attend: Convolutional Triplet Attention Module

    Diganta Misra, Trikay Nalamada, Ajay Uppili Arasanipalai +1

    cs.CVarXiv:2010.03045v22020
  34. Training Diffusion Models with Reinforcement Learning

    Kevin Black, Michael Janner, Yilun Du +2

    cs.LGcs.AIcs.CVarXiv:2305.13301v42023
  35. BBN: Bilateral-Branch Network with Cumulative Learning for Long-Tailed Visual Recognition

    Boyan Zhou, Quan Cui, Xiu-Shen Wei +1

    cs.CVcs.LGarXiv:1912.02413v42019
  36. Deep Predictive Coding Networks for Video Prediction and Unsupervised Learning

    William Lotter, Gabriel Kreiman, David Cox

    cs.LGcs.AIcs.CVarXiv:1605.08104v52016
  37. Deep Learning-Based Human Pose Estimation: A Survey

    Ce Zheng, Wenhan Wu, Chen Chen +5

    cs.CVcs.GRcs.MMarXiv:2012.13392v52020
  38. Visual7W: Grounded Question Answering in Images

    Yuke Zhu, Oliver Groth, Michael Bernstein +1

    cs.CVcs.LGcs.NEarXiv:1511.03416v42015
  39. Extracting Training Data from Diffusion Models

    Nicholas Carlini, Jamie Hayes, Milad Nasr +6

    cs.CRcs.CVcs.LGarXiv:2301.13188v12023
  40. Brain Intelligence: Go Beyond Artificial Intelligence

    Huimin Lu, Yujie Li, Min Chen +2

    cs.CVarXiv:1706.01040v12017
  41. FASTER: Rethinking Real-Time Flow VLAs

    Yuxiang Lu, Zhe Liu, Xianzhe Fan +5

    cs.ROcs.CVarXiv:2603.19199v32026
  42. SSD-6D: Making RGB-based 3D detection and 6D pose estimation great again

    Wadim Kehl, Fabian Manhardt, Federico Tombari +2

    cs.CVarXiv:1711.10006v12017
  43. According to Me: Long-Term Personalized Referential Memory QA

    Jingbiao Mei, Jinghong Chen, Guangyu Yang +3

    cs.AIcs.CLcs.CVarXiv:2603.01990v12026
  44. From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

    Ruilin Luo, Chufan Shi, Yizhen Zhang +10

    cs.CVcs.AIarXiv:2603.03825v12026
  45. Physical Simulator In-the-Loop Video Generation

    Lin Geng Foo, Mark He Huang, Alexandros Lattas +3

    cs.CVcs.AIcs.GRarXiv:2603.06408v12026
  46. Texture Networks: Feed-forward Synthesis of Textures and Stylized Images

    Dmitry Ulyanov, Vadim Lebedev, Andrea Vedaldi +1

    cs.CVarXiv:1603.03417v12016
  47. PromptRL: Prompt Matters in RL for Flow-Based Image Generation

    Fu-Yun Wang, Han Zhang, Michael Gharbi +2

    cs.CVcs.LGarXiv:2602.01382v12026
  48. Photographic Image Synthesis with Cascaded Refinement Networks

    Qifeng Chen, Vladlen Koltun

    cs.CVcs.AIcs.GRarXiv:1707.09405v12017
  49. Detecting Text in Natural Image with Connectionist Text Proposal Network

    Zhi Tian, Weilin Huang, Tong He +2

    cs.CVarXiv:1609.03605v12016
  50. Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation

    Zihan Su, Hongyang Wei, Kangrui Cen +4

    cs.CVcs.LGarXiv:2601.21406v32026
  51. Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation

    Junde Wu, Wei Ji, Yuanpei Liu +4

    cs.CVarXiv:2304.12620v72023
  52. HY3D-Bench: Generation of 3D Assets

    Team Hunyuan3D, :, Bowen Zhang +22

    cs.CVcs.AIarXiv:2602.03907v12026
  53. A Simple Baseline for Bayesian Uncertainty in Deep Learning

    Wesley Maddox, Timur Garipov, Pavel Izmailov +2

    cs.LGcs.AIcs.CVarXiv:1902.02476v22019
  54. SO-Net: Self-Organizing Network for Point Cloud Analysis

    Jiaxin Li, Ben M. Chen, Gim Hee Lee

    cs.CVarXiv:1803.04249v42018
  55. Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

    Linxi Xie, Lisong C. Sun, Ashley Neall +3

    cs.CVarXiv:2602.18422v12026
  56. Learning Enriched Features for Real Image Restoration and Enhancement

    Syed Waqas Zamir, Aditya Arora, Salman Khan +4

    cs.CVarXiv:2003.06792v22020
  57. GraphVAE: Towards Generation of Small Graphs Using Variational Autoencoders

    Martin Simonovsky, Nikos Komodakis

    cs.LGcs.CVcs.NEarXiv:1802.03480v12018
  58. The Unmanned Aerial Vehicle Benchmark: Object Detection and Tracking

    Dawei Du, Yuankai Qi, Hongyang Yu +6

    cs.CVarXiv:1804.00518v12018
  59. The History Began from AlexNet: A Comprehensive Survey on Deep Learning Approaches

    Md Zahangir Alom, Tarek M. Taha, Christopher Yakopcic +6

    cs.CVarXiv:1803.01164v22018
  60. RLBench: The Robot Learning Benchmark & Learning Environment

    Stephen James, Zicong Ma, David Rovick Arrojo +1

    cs.ROcs.AIcs.CVarXiv:1909.12271v12019