Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

1,381 to 1,440 of 18,840

  1. Multi-Task Curriculum Framework for Open-Set Semi-Supervised Learning

    Qing Yu, Daiki Ikami, Go Irie +1

    cs.CVarXiv:2007.11330v12020
  2. Consistency Models Made Easy

    Zhengyang Geng, Ashwini Pokle, William Luo +2

    cs.LGcs.CVarXiv:2406.14548v22024
  3. DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training

    Wei Li, Linchao Zhu, Longyin Wen +1

    cs.CVcs.AIcs.CLarXiv:2303.03032v12023
  4. Is Attention All That NeRF Needs?

    Mukund Varma T, Peihao Wang, Xuxi Chen +3

    cs.CVarXiv:2207.13298v32022
  5. Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs

    Zhiqi Li, Yuxuan Liao, Bo Zhu

    cs.CVarXiv:2609.11499v12026
  6. SenseNova-U1.5: Towards Native Unified Visual Intelligence

    Haiwen Diao, Jiahao Wang, Chenjing Ding +62

    cs.CVarXiv:2609.11929v12026
  7. Supervised Raw Video Denoising with a Benchmark Dataset on Dynamic Scenes

    Huanjing Yue, Cong Cao, Lei Liao +2

    eess.IVcs.CVcs.LGarXiv:2003.14013v12020
  8. Distribution-sensitive Information Retention for Accurate Binary Neural Network

    Haotong Qin, Xiangguo Zhang, Ruihao Gong +3

    cs.CVarXiv:2109.12338v22021
  9. EfficientNeRF: Efficient Neural Radiance Fields

    Tao Hu, Shu Liu, Yilun Chen +2

    cs.CVarXiv:2206.00878v12022
  10. Buried object detection from B-scan ground penetrating radar data using Faster-RCNN

    Minh-Tan Pham, Sébastien Lefèvre

    cs.CVarXiv:1803.08414v12018
  11. Fine Perceptive GANs for Brain MR Image Super-Resolution in Wavelet Domain

    Senrong You, Yong Liu, Baiying Lei +1

    eess.IVcs.CVcs.LGarXiv:2011.04145v12020
  12. DenserNet: Weakly Supervised Visual Localization Using Multi-scale Feature Aggregation

    Dongfang Liu, Yiming Cui, Liqi Yan +3

    cs.CVarXiv:2012.02366v42020
  13. A critical analysis of self-supervision, or what we can learn from a single image

    Yuki M. Asano, Christian Rupprecht, Andrea Vedaldi

    cs.CVarXiv:1904.13132v32019
  14. Remote Sensing Object Detection Meets Deep Learning: A Meta-review of Challenges and Advances

    Xiangrong Zhang, Tianyang Zhang, Guanchun Wang +4

    cs.CVarXiv:2309.06751v12023
  15. A survey on efficient vision transformers: algorithms, techniques, and performance benchmarking

    Lorenzo Papa, Paolo Russo, Irene Amerini +1

    cs.CVarXiv:2309.02031v22023
  16. Semi-Supervised and Task-Driven Data Augmentation

    Krishna Chaitanya, Neerav Karani, Christian Baumgartner +3

    cs.CVcs.LGstat.MLarXiv:1902.05396v22019
  17. Dynamic Multimodal Fusion

    Zihui Xue, Radu Marculescu

    cs.CVcs.AIcs.MMarXiv:2204.00102v22022
  18. SceneGen: Learning to Generate Realistic Traffic Scenes

    Shuhan Tan, Kelvin Wong, Shenlong Wang +3

    cs.CVcs.AIcs.LGarXiv:2101.06541v12021
  19. OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

    Hanrong Ye, Chao-Han Huck Yang, Arushi Goel +29

    cs.CVcs.AIcs.CLarXiv:2510.15870v22025
  20. Weakly Supervised 3D Human Pose and Shape Reconstruction with Normalizing Flows

    Andrei Zanfir, Eduard Gabriel Bazavan, Hongyi Xu +3

    cs.CVarXiv:2003.10350v22020
  21. LiDAR-based Online 3D Video Object Detection with Graph-based Message Passing and Spatiotemporal Transformer Attention

    Junbo Yin, Jianbing Shen, Chenye Guan +2

    cs.CVarXiv:2004.01389v12020
  22. A Fast and Accurate System for Face Detection, Identification, and Verification

    Rajeev Ranjan, Ankan Bansal, Jingxiao Zheng +7

    cs.CVarXiv:1809.07586v12018
  23. Prototype Completion with Primitive Knowledge for Few-Shot Learning

    Baoquan Zhang, Xutao Li, Yunming Ye +2

    cs.CVarXiv:2009.04960v62020
  24. Deep Learning for Free-Hand Sketch: A Survey

    Peng Xu, Timothy M. Hospedales, Qiyue Yin +3

    cs.CVcs.GRcs.LGarXiv:2001.02600v32020
  25. Complete Dictionary Recovery over the Sphere II: Recovery by Riemannian Trust-region Method

    Ju Sun, Qing Qu, John Wright

    cs.ITcs.CVmath.OCarXiv:1511.04777v32015
  26. MR image reconstruction using deep density priors

    Kerem C. Tezcan, Christian F. Baumgartner, Roger Luechinger +2

    cs.CVeess.IVstat.MLarXiv:1711.11386v42017
  27. Sparse Autoencoder for Unsupervised Nucleus Detection and Representation in Histopathology Images

    Le Hou, Vu Nguyen, Dimitris Samaras +4

    cs.CVarXiv:1704.00406v22017
  28. Spatio-spectral classification of hyperspectral images for brain cancer detection during surgical operations

    H. Fabelo, S. Ortega, D. Ravi +19

    eess.IVcs.CVarXiv:2402.07192v12024
  29. Bayesian Fusion for Infrared and Visible Images

    Zixiang Zhao, Shuang Xu, Chunxia Zhang +2

    cs.CVarXiv:2005.05839v12020
  30. NeSF: Neural Semantic Fields for Generalizable Semantic Segmentation of 3D Scenes

    Suhani Vora, Noha Radwan, Klaus Greff +6

    cs.CVcs.ROarXiv:2111.13260v32021
  31. RAUNet: Residual Attention U-Net for Semantic Segmentation of Cataract Surgical Instruments

    Zhen-Liang Ni, Gui-Bin Bian, Xiao-Hu Zhou +6

    cs.CVarXiv:1909.10360v32019
  32. 3D Face Reconstruction with Geometry Details from a Single Image

    Luo Jiang, Juyong Zhang, Bailin Deng +2

    cs.CVarXiv:1702.05619v22017
  33. GreedyNAS: Towards Fast One-Shot NAS with Greedy Supernet

    Shan You, Tao Huang, Mingmin Yang +3

    cs.CVcs.NEarXiv:2003.11236v12020
  34. Slow and steady feature analysis: higher order temporal coherence in video

    Dinesh Jayaraman, Kristen Grauman

    cs.CVarXiv:1506.04714v22015
  35. Leveraging Auxiliary Tasks with Affinity Learning for Weakly Supervised Semantic Segmentation

    Lian Xu, Wanli Ouyang, Mohammed Bennamoun +3

    cs.CVarXiv:2107.11787v22021
  36. Understanding Optical Music Recognition

    Jorge Calvo-Zaragoza, Jan Hajič, Alexander Pacha

    cs.CVcs.AIcs.IRarXiv:1908.03608v32019
  37. Dense Depth Posterior (DDP) from Single Image and Sparse Range

    Yanchao Yang, Alex Wong, Stefano Soatto

    cs.CVarXiv:1901.10034v22019
  38. Perturbation Resilience and Superiorization of Iterative Algorithms

    Y. Censor, R. Davidi, G. T. Herman

    math.OCcs.CVphysics.med-pharXiv:1005.0069v12010
  39. Deep Learning to Segment Pelvic Bones: Large-scale CT Datasets and Baseline Models

    Pengbo Liu, Hu Han, Yuanqi Du +9

    cs.CVarXiv:2012.08721v22020
  40. PIXART-δ: Fast and Controllable Image Generation with Latent Consistency Models

    Junsong Chen, Yue Wu, Simian Luo +5

    cs.CVarXiv:2401.05252v12024
  41. Image Segmentation Algorithms Overview

    Song Yuheng, Yan Hao

    cs.CVarXiv:1707.02051v12017
  42. Learning Video Object Segmentation from Unlabeled Videos

    Xiankai Lu, Wenguan Wang, Jianbing Shen +3

    cs.CVarXiv:2003.05020v12020
  43. Incorporating Copying Mechanism in Image Captioning for Learning Novel Objects

    Ting Yao, Yingwei Pan, Yehao Li +1

    cs.CVcs.CLarXiv:1708.05271v12017
  44. Fast and Robust Small Infrared Target Detection Using Absolute Directional Mean Difference Algorithm

    Saed Moradi, Payman Moallem, Mohamad Farzan Sabahi

    cs.CVarXiv:1810.03173v42018
  45. Zero-Shot Learning via Class-Conditioned Deep Generative Models

    Wenlin Wang, Yunchen Pu, Vinay Kumar Verma +5

    cs.LGcs.CVarXiv:1711.05820v22017
  46. HMS-Net: Hierarchical Multi-scale Sparsity-invariant Network for Sparse Depth Completion

    Zixuan Huang, Junming Fan, Shenggan Cheng +3

    cs.CVarXiv:1808.08685v22018
  47. S-NeRF: Neural Radiance Fields for Street Views

    Ziyang Xie, Junge Zhang, Wenye Li +2

    cs.CVarXiv:2303.00749v12023
  48. Transfer Learning with intelligent training data selection for prediction of Alzheimer's Disease

    Naimul Mefraz Khan, Marcia Hon, Nabila Abraham

    cs.CVcs.LGarXiv:1906.01160v12019
  49. Auxiliary Tasks and Exploration Enable ObjectNav

    Joel Ye, Dhruv Batra, Abhishek Das +1

    cs.CVcs.ROarXiv:2104.04112v22021
  50. Counterfactual Generative Networks

    Axel Sauer, Andreas Geiger

    cs.LGcs.CVarXiv:2101.06046v12021
  51. 3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive Selection

    Junyu Luo, Jiahui Fu, Xianghao Kong +5

    cs.CVarXiv:2204.06272v12022
  52. Automated Surgical Skill Assessment in RMIS Training

    Aneeq Zia, Irfan Essa

    cs.CVarXiv:1712.08604v12017
  53. Procedural Generation of Videos to Train Deep Action Recognition Networks

    César Roberto de Souza, Adrien Gaidon, Yohann Cabon +1

    cs.CVarXiv:1612.00881v22016
  54. COVID-19 CT Image Synthesis with a Conditional Generative Adversarial Network

    Yifan Jiang, Han Chen, Murray Loew +1

    eess.IVcs.CVcs.LGarXiv:2007.14638v22020
  55. Translation, Scale and Rotation: Cross-Modal Alignment Meets RGB-Infrared Vehicle Detection

    Maoxun Yuan, Yinyan Wang, Xingxing Wei

    cs.CVarXiv:2209.13801v12022
  56. Cheap and Quick: Efficient Vision-Language Instruction Tuning for Large Language Models

    Gen Luo, Yiyi Zhou, Tianhe Ren +3

    cs.CVarXiv:2305.15023v32023
  57. Infrared and visible image fusion using Latent Low-Rank Representation

    Hui Li, Xiao-Jun Wu

    cs.CVarXiv:1804.08992v52018
  58. Classification with Scattering Operators

    Joan Bruna, Stéphane Mallat

    cs.CVarXiv:1011.3023v42010
  59. Universal representations:The missing link between faces, text, planktons, and cat breeds

    Hakan Bilen, Andrea Vedaldi

    cs.CVstat.MLarXiv:1701.07275v12017
  60. Segmenting Objects in Day and Night:Edge-Conditioned CNN for Thermal Image Semantic Segmentation

    Chenglong Li, Wei Xia, Yan Yan +2

    cs.CVarXiv:1907.10303v12019