Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,541 to 12,600 of 18,866

  1. NeRV: Neural Representations for Videos

    Hao Chen, Bo He, Hanyu Wang +3

    cs.CVeess.IVarXiv:2110.13903v12021
  2. Unsupervised Learning of 3D Structure from Images

    Danilo Jimenez Rezende, S. M. Ali Eslami, Shakir Mohamed +3

    cs.CVcs.LGstat.MLarXiv:1607.00662v22016
  3. MMTM: Multimodal Transfer Module for CNN Fusion

    Hamid Reza Vaezi Joze, Amirreza Shaban, Michael L. Iuzzolino +1

    cs.CVcs.LGarXiv:1911.08670v22019
  4. Topology-Preserving Deep Image Segmentation

    Xiaoling Hu, Li Fuxin, Dimitris Samaras +1

    cs.CVcs.CGarXiv:1906.05404v12019
  5. Point-Based Multi-View Stereo Network

    Rui Chen, Songfang Han, Jing Xu +1

    cs.CVarXiv:1908.04422v12019
  6. Neural Unsigned Distance Fields for Implicit Function Learning

    Julian Chibane, Aymen Mir, Gerard Pons-Moll

    cs.CVcs.LGarXiv:2010.13938v12020
  7. RAVEN: A Dataset for Relational and Analogical Visual rEasoNing

    Chi Zhang, Feng Gao, Baoxiong Jia +2

    cs.CVcs.AIcs.LGarXiv:1903.02741v12019
  8. ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Network

    Yuliang Liu, Hao Chen, Chunhua Shen +3

    cs.CVarXiv:2002.10200v22020
  9. SpinNet: Learning a General Surface Descriptor for 3D Point Cloud Registration

    Sheng Ao, Qingyong Hu, Bo Yang +2

    cs.CVcs.AIcs.LGarXiv:2011.12149v22020
  10. Unsupervised Degradation Representation Learning for Blind Super-Resolution

    Longguang Wang, Yingqian Wang, Xiaoyu Dong +4

    cs.CVarXiv:2104.00416v12021
  11. GLAD: Global-Local-Alignment Descriptor for Pedestrian Retrieval

    Longhui Wei, Shiliang Zhang, Hantao Yao +2

    cs.CVarXiv:1709.04329v12017
  12. Ordinal Depth Supervision for 3D Human Pose Estimation

    Georgios Pavlakos, Xiaowei Zhou, Kostas Daniilidis

    cs.CVarXiv:1805.04095v12018
  13. Stratified Transformer for 3D Point Cloud Segmentation

    Xin Lai, Jianhui Liu, Li Jiang +5

    cs.CVcs.AIarXiv:2203.14508v12022
  14. Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos

    Baixuan Xu, Yinyui Xu, Tianshi Zheng +9

    cs.CVcs.LGarXiv:2608.26355v12026
  15. UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation

    Huaishao Luo, Lei Ji, Botian Shi +6

    cs.CVcs.CLcs.LGarXiv:2002.06353v32020
  16. IDD: A Dataset for Exploring Problems of Autonomous Navigation in Unconstrained Environments

    Girish Varma, Anbumani Subramanian, Anoop Namboodiri +2

    cs.CVcs.ROarXiv:1811.10200v12018
  17. Transformers in Medical Image Analysis: A Review

    Kelei He, Chen Gan, Zhuoyuan Li +7

    cs.CVarXiv:2202.12165v32022
  18. RankSRGAN: Generative Adversarial Networks with Ranker for Image Super-Resolution

    Wenlong Zhang, Yihao Liu, Chao Dong +1

    cs.CVarXiv:1908.06382v22019
  19. InterHand2.6M: A Dataset and Baseline for 3D Interacting Hand Pose Estimation from a Single RGB Image

    Gyeongsik Moon, Shoou-i Yu, He Wen +2

    cs.CVarXiv:2008.09309v12020
  20. DeepCut: Object Segmentation from Bounding Box Annotations using Convolutional Neural Networks

    Martin Rajchl, Matthew C. H. Lee, Ozan Oktay +8

    cs.CVarXiv:1605.07866v22016
  21. Light Field Networks: Neural Scene Representations with Single-Evaluation Rendering

    Vincent Sitzmann, Semon Rezchikov, William T. Freeman +2

    cs.CVcs.AIcs.GRarXiv:2106.02634v22021
  22. 3D Human Pose Estimation from a Single Image via Distance Matrix Regression

    Francesc Moreno-Noguer

    cs.CVarXiv:1611.09010v12016
  23. Boosting the accuracy of multi-spectral image pan-sharpening by learning a deep residual network

    Yancong Wei, Qiangqiang Yuan, Huanfeng Shen +1

    cs.CVarXiv:1705.07556v22017
  24. Coded aperture compressive temporal imaging

    Patrick Llull, Xuejun Liao, Xin Yuan +5

    cs.CVcs.ITarXiv:1302.2575v12013
  25. Siamese Cascaded Region Proposal Networks for Real-Time Visual Tracking

    Heng Fan, Haibin Ling

    cs.CVarXiv:1812.06148v12018
  26. PyramidBox: A Context-assisted Single Shot Face Detector

    Xu Tang, Daniel K. Du, Zeqiang He +1

    cs.CVarXiv:1803.07737v22018
  27. DIDFuse: Deep Image Decomposition for Infrared and Visible Image Fusion

    Zixiang Zhao, Shuang Xu, Chunxia Zhang +3

    eess.IVcs.CVarXiv:2003.09210v32020
  28. Fast Convergence of DETR with Spatially Modulated Co-Attention

    Peng Gao, Minghang Zheng, Xiaogang Wang +2

    cs.CVarXiv:2101.07448v12021
  29. A Comprehensive Review of Image Enhancement Techniques

    Raman Maini, Himanshu Aggarwal

    cs.CVarXiv:1003.4053v12010
  30. Improving Calibration for Long-Tailed Recognition

    Zhisheng Zhong, Jiequan Cui, Shu Liu +1

    cs.CVarXiv:2104.00466v12021
  31. A Hierarchical Approach for Generating Descriptive Image Paragraphs

    Jonathan Krause, Justin Johnson, Ranjay Krishna +1

    cs.CVcs.CLarXiv:1611.06607v22016
  32. Dataset Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses

    Micah Goldblum, Dimitris Tsipras, Chulin Xie +6

    cs.LGcs.AIcs.CRarXiv:2012.10544v42020
  33. Robust Motion In-betweening

    Félix G. Harvey, Mike Yurick, Derek Nowrouzezahrai +1

    cs.CVcs.GRcs.LGarXiv:2102.04942v12021
  34. Contrastive Test-Time Adaptation

    Dian Chen, Dequan Wang, Trevor Darrell +1

    cs.CVarXiv:2204.10377v12022
  35. Learning Deep Features for One-Class Classification

    Pramuditha Perera, Vishal M. Patel

    cs.CVarXiv:1801.05365v22018
  36. HAWQ-V2: Hessian Aware trace-Weighted Quantization of Neural Networks

    Zhen Dong, Zhewei Yao, Yaohui Cai +4

    cs.CVarXiv:1911.03852v12019
  37. Learning Attentive Pairwise Interaction for Fine-Grained Classification

    Peiqin Zhuang, Yali Wang, Yu Qiao

    cs.CVarXiv:2002.10191v12020
  38. Mask-guided Spectral-wise Transformer for Efficient Hyperspectral Image Reconstruction

    Yuanhao Cai, Jing Lin, Xiaowan Hu +5

    eess.IVcs.CVarXiv:2111.07910v22021
  39. RobustNet: Improving Domain Generalization in Urban-Scene Segmentation via Instance Selective Whitening

    Sungha Choi, Sanghun Jung, Huiwon Yun +3

    cs.CVarXiv:2103.15597v22021
  40. EmoNets: Multimodal deep learning approaches for emotion recognition in video

    Samira Ebrahimi Kahou, Xavier Bouthillier, Pascal Lamblin +15

    cs.LGcs.CVarXiv:1503.01800v22015
  41. Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling

    Sibo Dong, Sarah Adel Bargal

    cs.CVarXiv:2608.27280v12026
  42. SVDiff: Compact Parameter Space for Diffusion Fine-Tuning

    Ligong Han, Yinxiao Li, Han Zhang +3

    cs.CVarXiv:2303.11305v42023
  43. Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

    Ziyue Wang, Shiqi Huang, Weiwen Xu +2

    cs.CVarXiv:2608.27065v12026
  44. Continual Learning of Context-dependent Processing in Neural Networks

    Guanxiong Zeng, Yang Chen, Bo Cui +1

    cs.LGcs.AIcs.CVarXiv:1810.01256v32018
  45. Unsupervised Intra-domain Adaptation for Semantic Segmentation through Self-Supervision

    Fei Pan, Inkyu Shin, Francois Rameau +2

    cs.CVcs.LGcs.ROarXiv:2004.07703v42020
  46. RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

    Zijian Kan, Wei Wang, Long Luo +6

    cs.CVarXiv:2608.26956v12026
  47. Multi-Image Visual Token Pruning in Large Visual Language Models

    Rongyang Zhang, Chengqiang Lu, Cong Li +9

    cs.CVarXiv:2608.26806v12026
  48. Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification

    Zibo Zhou, Zongsen Qiu, Rui Chen +3

    cs.CVarXiv:2608.26771v12026
  49. DistancePPG: Robust non-contact vital signs monitoring using a camera

    Mayank Kumar, Ashok Veeraraghavan, Ashutosh Sabharval

    cs.CVarXiv:1502.08040v22015
  50. Part-aware Prototype Network for Few-shot Semantic Segmentation

    Yongfei Liu, Xiangyi Zhang, Songyang Zhang +1

    cs.CVarXiv:2007.06309v32020
  51. Dose-PlanNet: Physics Based Radiotherapy Dose Prediction with Deep Learning

    Ankit Bhattacharjee, Sougata Maity, Santam Chakraborty +1

    physics.med-phcs.CVcs.LGarXiv:2608.26901v12026
  52. VOLO: Vision Outlooker for Visual Recognition

    Li Yuan, Qibin Hou, Zihang Jiang +2

    cs.CVarXiv:2106.13112v22021
  53. Unbiased Mean Teacher for Cross-domain Object Detection

    Jinhong Deng, Wen Li, Yuhua Chen +1

    cs.CVarXiv:2003.00707v22020
  54. How Much Position Information Do Convolutional Neural Networks Encode?

    Md Amirul Islam, Sen Jia, Neil D. B. Bruce

    cs.CVcs.LGarXiv:2001.08248v12020
  55. MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model

    Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew +5

    cs.CVcs.GRarXiv:2311.16498v12023
  56. Understanding Human Hands in Contact at Internet Scale

    Dandan Shan, Jiaqi Geng, Michelle Shu +1

    cs.CVarXiv:2006.06669v12020
  57. Robust Face Recognition via Multimodal Deep Face Representation

    Changxing Ding, Dacheng Tao

    cs.CVarXiv:1509.00244v12015
  58. GeoMAD: Geometry-Aware Multi-View Anomaly Detection via Deformable Fusion and Distributional Alignment

    Shang-Fu Chen, Jhih-Ciang Wu, Kuan-Chuan Peng +2

    cs.CVarXiv:2608.26724v12026
  59. UniGeo: A Multi-modal Large Language Model for Text-Guided Cross-View Geo-Localization

    Jiahao Wen, Hang Yu, Zhedong Zheng

    cs.CVarXiv:2608.26722v12026
  60. Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion

    Tianpei Gu, Guangyi Chen, Junlong Li +4

    cs.CVcs.LGarXiv:2203.13777v12022