Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
11,221 to 11,280 of 18,829
EVA-CLIP: Improved Training Techniques for CLIP at Scale
Quan Sun, Yuxin Fang, Ledell Wu +2
cs.CVarXiv:2303.15389v12023Tri-Perspective View for Vision-Based 3D Semantic Occupancy Prediction
Yuanhui Huang, Wenzhao Zheng, Yunpeng Zhang +2
cs.CVcs.AIcs.LGarXiv:2302.07817v22023RTMDet: An Empirical Study of Designing Real-Time Object Detectors
Chengqi Lyu, Wenwei Zhang, Haian Huang +5
cs.CVarXiv:2212.07784v22022Magic3D: High-Resolution Text-to-3D Content Creation
Chen-Hsuan Lin, Jun Gao, Luming Tang +7
cs.CVcs.GRcs.LGarXiv:2211.10440v22022ViM: Out-Of-Distribution with Virtual-logit Matching
Haoqi Wang, Zhizhong Li, Litong Feng +1
cs.CVarXiv:2203.10807v12022Point-NeRF: Point-based Neural Radiance Fields
Qiangeng Xu, Zexiang Xu, Julien Philip +4
cs.CVarXiv:2201.08845v72022Vision Transformer with Deformable Attention
Zhuofan Xia, Xuran Pan, Shiji Song +2
cs.CVarXiv:2201.00520v32022DyTox: Transformers for Continual Learning with DYnamic TOken eXpansion
Arthur Douillard, Alexandre Ramé, Guillaume Couairon +1
cs.CVcs.LGarXiv:2111.11326v32021Pivotal Tuning for Latent-based Editing of Real Images
Daniel Roich, Ron Mokady, Amit H. Bermano +1
cs.CVarXiv:2106.05744v12021Semi-Supervised Semantic Segmentation with Cross Pseudo Supervision
Xiaokang Chen, Yuhui Yuan, Gang Zeng +1
cs.CVarXiv:2106.01226v22021Non-Rigid Neural Radiance Fields: Reconstruction and Novel View Synthesis of a Dynamic Scene From Monocular Video
Edgar Tretschk, Ayush Tewari, Vladislav Golyanik +3
cs.CVcs.GRarXiv:2012.12247v42020TDN: Temporal Difference Networks for Efficient Action Recognition
Limin Wang, Zhan Tong, Bin Ji +1
cs.CVarXiv:2012.10071v22020NeRD: Neural Reflectance Decomposition from Image Collections
Mark Boss, Raphael Braun, Varun Jampani +3
cs.CVcs.GRcs.LGarXiv:2012.03918v42020Align Deep Features for Oriented Object Detection
Jiaming Han, Jian Ding, Jie Li +1
cs.CVarXiv:2008.09397v32020MediaPipe Hands: On-device Real-time Hand Tracking
Fan Zhang, Valentin Bazarevsky, Andrey Vakunov +4
cs.CVarXiv:2006.10214v12020X3D: Expanding Architectures for Efficient Video Recognition
Christoph Feichtenhofer
cs.CVarXiv:2004.04730v12020BlendMask: Top-Down Meets Bottom-Up for Instance Segmentation
Hao Chen, Kunyang Sun, Zhi Tian +3
cs.CVarXiv:2001.00309v32020PVN3D: A Deep Point-wise 3D Keypoints Voting Network for 6DoF Pose Estimation
Yisheng He, Wei Sun, Haibin Huang +3
cs.CVcs.ROarXiv:1911.04231v22019FSGAN: Subject Agnostic Face Swapping and Reenactment
Yuval Nirkin, Yosi Keller, Tal Hassner
cs.CVcs.GRcs.LGarXiv:1908.05932v12019R3Det: Refined Single-Stage Detector with Feature Refinement for Rotating Object
Xue Yang, Junchi Yan, Ziming Feng +1
cs.CVcs.LGeess.IVarXiv:1908.05612v62019Learning Lightweight Lane Detection CNNs by Self Attention Distillation
Yuenan Hou, Zheng Ma, Chunxiao Liu +1
cs.CVarXiv:1908.00821v120193D Packing for Self-Supervised Monocular Depth Estimation
Vitor Guizilini, Rares Ambrus, Sudeep Pillai +2
cs.CVcs.LGcs.ROarXiv:1905.02693v42019GA-Net: Guided Aggregation Net for End-to-end Stereo Matching
Feihu Zhang, Victor Prisacariu, Ruigang Yang +1
cs.CVarXiv:1904.06587v12019Progressive Image Deraining Networks: A Better and Simpler Baseline
Dongwei Ren, Wangmeng Zuo, Qinghua Hu +2
cs.CVarXiv:1901.09221v32019DeepSDF: Learning Continuous Signed Distance Functions for Shape Representation
Jeong Joon Park, Peter Florence, Julian Straub +2
cs.CVarXiv:1901.05103v12019Normalized Object Coordinate Space for Category-Level 6D Object Pose and Size Estimation
He Wang, Srinath Sridhar, Jingwei Huang +3
cs.CVarXiv:1901.02970v22019High Quality Monocular Depth Estimation via Transfer Learning
Ibraheem Alhashim, Peter Wonka
cs.CVarXiv:1812.11941v22018Strike (with) a Pose: Neural Networks Are Easily Fooled by Strange Poses of Familiar Objects
Michael A. Alcorn, Qi Li, Zhitao Gong +4
cs.CVcs.LGarXiv:1811.11553v32018Benchmark Analysis of Representative Deep Neural Network Architectures
Simone Bianco, Remi Cadene, Luigi Celona +1
cs.CVarXiv:1810.00736v22018DEIM: DETR with Improved Matching for Fast Convergence
Shihua Huang, Zhichao Lu, Xiaodong Cun +3
cs.CVcs.AIarXiv:2412.04234v32024Decoupling Direction and Norm for Efficient Gradient-Based L2 Adversarial Attacks and Defenses
Jérôme Rony, Luiz G. Hafemann, Luiz S. Oliveira +3
cs.CVcs.CRcs.LGarXiv:1811.09600v32018Vision Meets Drones: A Challenge
Pengfei Zhu, Longyin Wen, Xiao Bian +2
cs.CVarXiv:1804.07437v22018Point Convolutional Neural Networks by Extension Operators
Matan Atzmon, Haggai Maron, Yaron Lipman
cs.CVarXiv:1803.10091v12018Learning Spectral-Spatial-Temporal Features via a Recurrent Convolutional Neural Network for Change Detection in Multispectral Imagery
Lichao Mou, Lorenzo Bruzzone, Xiao Xiang Zhu
cs.CVarXiv:1803.02642v12018Recurrent Slice Networks for 3D Segmentation of Point Clouds
Qiangui Huang, Weiyue Wang, Ulrich Neumann
cs.CVarXiv:1802.04402v22018DensePose: Dense Human Pose Estimation In The Wild
Rıza Alp Güler, Natalia Neverova, Iasonas Kokkinos
cs.CVarXiv:1802.00434v12018FSSD: Feature Fusion Single Shot Multibox Detector
Zuoxin Li, Lu Yang, Fuqiang Zhou
cs.CVarXiv:1712.00960v42017SGPN: Similarity Group Proposal Network for 3D Point Cloud Instance Segmentation
Weiyue Wang, Ronald Yu, Qiangui Huang +1
cs.CVarXiv:1711.08588v22017Inpaint Anything: Segment Anything Meets Image Inpainting
Tao Yu, Runseng Feng, Ruoyu Feng +4
cs.CVarXiv:2304.06790v12023NIMA: Neural Image Assessment
Hossein Talebi, Peyman Milanfar
cs.CVarXiv:1709.05424v22017Multimodal End-to-End Autonomous Driving
Yi Xiao, Felipe Codevilla, Akhil Gurram +2
cs.CVarXiv:1906.03199v22019Deep Metric Learning with Angular Loss
Jian Wang, Feng Zhou, Shilei Wen +2
cs.CVarXiv:1708.01682v12017The "something something" video database for learning and evaluating visual common sense
Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski +11
cs.CVarXiv:1706.04261v22017The Kinetics Human Action Video Dataset
Will Kay, Joao Carreira, Karen Simonyan +9
cs.CVarXiv:1705.06950v12017Soft-NMS -- Improving Object Detection With One Line of Code
Navaneeth Bodla, Bharat Singh, Rama Chellappa +1
cs.CVarXiv:1704.04503v22017MoFA: Model-based Deep Convolutional Face Autoencoder for Unsupervised Monocular Reconstruction
Ayush Tewari, Michael Zollhöfer, Hyeongwoo Kim +4
cs.CVarXiv:1703.10580v22017Flow-Guided Feature Aggregation for Video Object Detection
Xizhou Zhu, Yujie Wang, Jifeng Dai +2
cs.CVarXiv:1703.10025v22017MambaOut: Do We Really Need Mamba for Vision?
Weihao Yu, Xinchao Wang
cs.CVcs.AIcs.LGarXiv:2405.07992v32024Richer Convolutional Features for Edge Detection
Yun Liu, Ming-Ming Cheng, Xiaowei Hu +2
cs.CVarXiv:1612.02103v32016Speed/accuracy trade-offs for modern convolutional object detectors
Jonathan Huang, Vivek Rathod, Chen Sun +8
cs.CVarXiv:1611.10012v32016Clean-Label Backdoor Attacks on Video Recognition Models
Shihao Zhao, Xingjun Ma, Xiang Zheng +3
cs.CVarXiv:2003.03030v22020Visual Dialog
Abhishek Das, Satwik Kottur, Khushi Gupta +5
cs.CVcs.AIcs.CLarXiv:1611.08669v52016Fully Convolutional Instance-aware Semantic Segmentation
Yi Li, Haozhi Qi, Jifeng Dai +2
cs.CVarXiv:1611.07709v22016DexPilot: Vision Based Teleoperation of Dexterous Robotic Hand-Arm System
Ankur Handa, Karl Van Wyk, Wei Yang +6
cs.CVcs.LGcs.ROarXiv:1910.03135v22019Driving in the Matrix: Can Virtual Worlds Replace Human-Generated Annotations for Real World Tasks?
Matthew Johnson-Roberson, Charles Barto, Rounak Mehta +3
cs.CVcs.ROarXiv:1610.01983v22016Full Resolution Image Compression with Recurrent Neural Networks
George Toderici, Damien Vincent, Nick Johnston +4
cs.CVarXiv:1608.05148v22016Beyond a Gaussian Denoiser: Residual Learning of Deep CNN for Image Denoising
Kai Zhang, Wangmeng Zuo, Yunjin Chen +2
cs.CVarXiv:1608.03981v12016R-FCN: Object Detection via Region-based Fully Convolutional Networks
Jifeng Dai, Yi Li, Kaiming He +1
cs.CVarXiv:1605.06409v32016A Haar Wavelet-Based Perceptual Similarity Index for Image Quality Assessment
Rafael Reisenhofer, Sebastian Bosse, Gitta Kutyniok +1
cs.CVarXiv:1607.06140v42016FD-GAN: Generative Adversarial Networks with Fusion-discriminator for Single Image Dehazing
Yu Dong, Yihao Liu, He Zhang +2
cs.CVarXiv:2001.06968v22020