Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

11,221 to 11,280 of 18,829

  1. EVA-CLIP: Improved Training Techniques for CLIP at Scale

    Quan Sun, Yuxin Fang, Ledell Wu +2

    cs.CVarXiv:2303.15389v12023
  2. Tri-Perspective View for Vision-Based 3D Semantic Occupancy Prediction

    Yuanhui Huang, Wenzhao Zheng, Yunpeng Zhang +2

    cs.CVcs.AIcs.LGarXiv:2302.07817v22023
  3. RTMDet: An Empirical Study of Designing Real-Time Object Detectors

    Chengqi Lyu, Wenwei Zhang, Haian Huang +5

    cs.CVarXiv:2212.07784v22022
  4. Magic3D: High-Resolution Text-to-3D Content Creation

    Chen-Hsuan Lin, Jun Gao, Luming Tang +7

    cs.CVcs.GRcs.LGarXiv:2211.10440v22022
  5. ViM: Out-Of-Distribution with Virtual-logit Matching

    Haoqi Wang, Zhizhong Li, Litong Feng +1

    cs.CVarXiv:2203.10807v12022
  6. Point-NeRF: Point-based Neural Radiance Fields

    Qiangeng Xu, Zexiang Xu, Julien Philip +4

    cs.CVarXiv:2201.08845v72022
  7. Vision Transformer with Deformable Attention

    Zhuofan Xia, Xuran Pan, Shiji Song +2

    cs.CVarXiv:2201.00520v32022
  8. DyTox: Transformers for Continual Learning with DYnamic TOken eXpansion

    Arthur Douillard, Alexandre Ramé, Guillaume Couairon +1

    cs.CVcs.LGarXiv:2111.11326v32021
  9. Pivotal Tuning for Latent-based Editing of Real Images

    Daniel Roich, Ron Mokady, Amit H. Bermano +1

    cs.CVarXiv:2106.05744v12021
  10. Semi-Supervised Semantic Segmentation with Cross Pseudo Supervision

    Xiaokang Chen, Yuhui Yuan, Gang Zeng +1

    cs.CVarXiv:2106.01226v22021
  11. Non-Rigid Neural Radiance Fields: Reconstruction and Novel View Synthesis of a Dynamic Scene From Monocular Video

    Edgar Tretschk, Ayush Tewari, Vladislav Golyanik +3

    cs.CVcs.GRarXiv:2012.12247v42020
  12. TDN: Temporal Difference Networks for Efficient Action Recognition

    Limin Wang, Zhan Tong, Bin Ji +1

    cs.CVarXiv:2012.10071v22020
  13. NeRD: Neural Reflectance Decomposition from Image Collections

    Mark Boss, Raphael Braun, Varun Jampani +3

    cs.CVcs.GRcs.LGarXiv:2012.03918v42020
  14. Align Deep Features for Oriented Object Detection

    Jiaming Han, Jian Ding, Jie Li +1

    cs.CVarXiv:2008.09397v32020
  15. MediaPipe Hands: On-device Real-time Hand Tracking

    Fan Zhang, Valentin Bazarevsky, Andrey Vakunov +4

    cs.CVarXiv:2006.10214v12020
  16. X3D: Expanding Architectures for Efficient Video Recognition

    Christoph Feichtenhofer

    cs.CVarXiv:2004.04730v12020
  17. BlendMask: Top-Down Meets Bottom-Up for Instance Segmentation

    Hao Chen, Kunyang Sun, Zhi Tian +3

    cs.CVarXiv:2001.00309v32020
  18. PVN3D: A Deep Point-wise 3D Keypoints Voting Network for 6DoF Pose Estimation

    Yisheng He, Wei Sun, Haibin Huang +3

    cs.CVcs.ROarXiv:1911.04231v22019
  19. FSGAN: Subject Agnostic Face Swapping and Reenactment

    Yuval Nirkin, Yosi Keller, Tal Hassner

    cs.CVcs.GRcs.LGarXiv:1908.05932v12019
  20. R3Det: Refined Single-Stage Detector with Feature Refinement for Rotating Object

    Xue Yang, Junchi Yan, Ziming Feng +1

    cs.CVcs.LGeess.IVarXiv:1908.05612v62019
  21. Learning Lightweight Lane Detection CNNs by Self Attention Distillation

    Yuenan Hou, Zheng Ma, Chunxiao Liu +1

    cs.CVarXiv:1908.00821v12019
  22. 3D Packing for Self-Supervised Monocular Depth Estimation

    Vitor Guizilini, Rares Ambrus, Sudeep Pillai +2

    cs.CVcs.LGcs.ROarXiv:1905.02693v42019
  23. GA-Net: Guided Aggregation Net for End-to-end Stereo Matching

    Feihu Zhang, Victor Prisacariu, Ruigang Yang +1

    cs.CVarXiv:1904.06587v12019
  24. Progressive Image Deraining Networks: A Better and Simpler Baseline

    Dongwei Ren, Wangmeng Zuo, Qinghua Hu +2

    cs.CVarXiv:1901.09221v32019
  25. DeepSDF: Learning Continuous Signed Distance Functions for Shape Representation

    Jeong Joon Park, Peter Florence, Julian Straub +2

    cs.CVarXiv:1901.05103v12019
  26. Normalized Object Coordinate Space for Category-Level 6D Object Pose and Size Estimation

    He Wang, Srinath Sridhar, Jingwei Huang +3

    cs.CVarXiv:1901.02970v22019
  27. High Quality Monocular Depth Estimation via Transfer Learning

    Ibraheem Alhashim, Peter Wonka

    cs.CVarXiv:1812.11941v22018
  28. Strike (with) a Pose: Neural Networks Are Easily Fooled by Strange Poses of Familiar Objects

    Michael A. Alcorn, Qi Li, Zhitao Gong +4

    cs.CVcs.LGarXiv:1811.11553v32018
  29. Benchmark Analysis of Representative Deep Neural Network Architectures

    Simone Bianco, Remi Cadene, Luigi Celona +1

    cs.CVarXiv:1810.00736v22018
  30. DEIM: DETR with Improved Matching for Fast Convergence

    Shihua Huang, Zhichao Lu, Xiaodong Cun +3

    cs.CVcs.AIarXiv:2412.04234v32024
  31. Decoupling Direction and Norm for Efficient Gradient-Based L2 Adversarial Attacks and Defenses

    Jérôme Rony, Luiz G. Hafemann, Luiz S. Oliveira +3

    cs.CVcs.CRcs.LGarXiv:1811.09600v32018
  32. Vision Meets Drones: A Challenge

    Pengfei Zhu, Longyin Wen, Xiao Bian +2

    cs.CVarXiv:1804.07437v22018
  33. Point Convolutional Neural Networks by Extension Operators

    Matan Atzmon, Haggai Maron, Yaron Lipman

    cs.CVarXiv:1803.10091v12018
  34. Learning Spectral-Spatial-Temporal Features via a Recurrent Convolutional Neural Network for Change Detection in Multispectral Imagery

    Lichao Mou, Lorenzo Bruzzone, Xiao Xiang Zhu

    cs.CVarXiv:1803.02642v12018
  35. Recurrent Slice Networks for 3D Segmentation of Point Clouds

    Qiangui Huang, Weiyue Wang, Ulrich Neumann

    cs.CVarXiv:1802.04402v22018
  36. DensePose: Dense Human Pose Estimation In The Wild

    Rıza Alp Güler, Natalia Neverova, Iasonas Kokkinos

    cs.CVarXiv:1802.00434v12018
  37. FSSD: Feature Fusion Single Shot Multibox Detector

    Zuoxin Li, Lu Yang, Fuqiang Zhou

    cs.CVarXiv:1712.00960v42017
  38. SGPN: Similarity Group Proposal Network for 3D Point Cloud Instance Segmentation

    Weiyue Wang, Ronald Yu, Qiangui Huang +1

    cs.CVarXiv:1711.08588v22017
  39. Inpaint Anything: Segment Anything Meets Image Inpainting

    Tao Yu, Runseng Feng, Ruoyu Feng +4

    cs.CVarXiv:2304.06790v12023
  40. NIMA: Neural Image Assessment

    Hossein Talebi, Peyman Milanfar

    cs.CVarXiv:1709.05424v22017
  41. Multimodal End-to-End Autonomous Driving

    Yi Xiao, Felipe Codevilla, Akhil Gurram +2

    cs.CVarXiv:1906.03199v22019
  42. Deep Metric Learning with Angular Loss

    Jian Wang, Feng Zhou, Shilei Wen +2

    cs.CVarXiv:1708.01682v12017
  43. The "something something" video database for learning and evaluating visual common sense

    Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski +11

    cs.CVarXiv:1706.04261v22017
  44. The Kinetics Human Action Video Dataset

    Will Kay, Joao Carreira, Karen Simonyan +9

    cs.CVarXiv:1705.06950v12017
  45. Soft-NMS -- Improving Object Detection With One Line of Code

    Navaneeth Bodla, Bharat Singh, Rama Chellappa +1

    cs.CVarXiv:1704.04503v22017
  46. MoFA: Model-based Deep Convolutional Face Autoencoder for Unsupervised Monocular Reconstruction

    Ayush Tewari, Michael Zollhöfer, Hyeongwoo Kim +4

    cs.CVarXiv:1703.10580v22017
  47. Flow-Guided Feature Aggregation for Video Object Detection

    Xizhou Zhu, Yujie Wang, Jifeng Dai +2

    cs.CVarXiv:1703.10025v22017
  48. MambaOut: Do We Really Need Mamba for Vision?

    Weihao Yu, Xinchao Wang

    cs.CVcs.AIcs.LGarXiv:2405.07992v32024
  49. Richer Convolutional Features for Edge Detection

    Yun Liu, Ming-Ming Cheng, Xiaowei Hu +2

    cs.CVarXiv:1612.02103v32016
  50. Speed/accuracy trade-offs for modern convolutional object detectors

    Jonathan Huang, Vivek Rathod, Chen Sun +8

    cs.CVarXiv:1611.10012v32016
  51. Clean-Label Backdoor Attacks on Video Recognition Models

    Shihao Zhao, Xingjun Ma, Xiang Zheng +3

    cs.CVarXiv:2003.03030v22020
  52. Visual Dialog

    Abhishek Das, Satwik Kottur, Khushi Gupta +5

    cs.CVcs.AIcs.CLarXiv:1611.08669v52016
  53. Fully Convolutional Instance-aware Semantic Segmentation

    Yi Li, Haozhi Qi, Jifeng Dai +2

    cs.CVarXiv:1611.07709v22016
  54. DexPilot: Vision Based Teleoperation of Dexterous Robotic Hand-Arm System

    Ankur Handa, Karl Van Wyk, Wei Yang +6

    cs.CVcs.LGcs.ROarXiv:1910.03135v22019
  55. Driving in the Matrix: Can Virtual Worlds Replace Human-Generated Annotations for Real World Tasks?

    Matthew Johnson-Roberson, Charles Barto, Rounak Mehta +3

    cs.CVcs.ROarXiv:1610.01983v22016
  56. Full Resolution Image Compression with Recurrent Neural Networks

    George Toderici, Damien Vincent, Nick Johnston +4

    cs.CVarXiv:1608.05148v22016
  57. Beyond a Gaussian Denoiser: Residual Learning of Deep CNN for Image Denoising

    Kai Zhang, Wangmeng Zuo, Yunjin Chen +2

    cs.CVarXiv:1608.03981v12016
  58. R-FCN: Object Detection via Region-based Fully Convolutional Networks

    Jifeng Dai, Yi Li, Kaiming He +1

    cs.CVarXiv:1605.06409v32016
  59. A Haar Wavelet-Based Perceptual Similarity Index for Image Quality Assessment

    Rafael Reisenhofer, Sebastian Bosse, Gitta Kutyniok +1

    cs.CVarXiv:1607.06140v42016
  60. FD-GAN: Generative Adversarial Networks with Fusion-discriminator for Single Image Dehazing

    Yu Dong, Yihao Liu, He Zhang +2

    cs.CVarXiv:2001.06968v22020