Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
9,361 to 9,420 of 18,811
3D-USE: From Image-Level to Scene-Level Underwater Enhancement
Jieyu Yuan, Yuanlin Zhang, Jihong Li +3
cs.CVarXiv:2608.28020v12026CycleMLP: A MLP-like Architecture for Dense Prediction
Shoufa Chen, Enze Xie, Chongjian Ge +3
cs.CVarXiv:2107.10224v42021DeepPrior++: Improving Fast and Accurate 3D Hand Pose Estimation
Markus Oberweger, Vincent Lepetit
cs.CVarXiv:1708.08325v12017Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models
Xiaoyang Guo, Guoping Luo, Jusheng Zhang +2
cs.CVarXiv:2608.28138v12026Identity-Aware Textual-Visual Matching with Latent Co-attention
Shuang Li, Tong Xiao, Hongsheng Li +2
cs.CVarXiv:1708.01988v12017CMS-RCNN: Contextual Multi-Scale Region-based CNN for Unconstrained Face Detection
Chenchen Zhu, Yutong Zheng, Khoa Luu +1
cs.CVarXiv:1606.05413v12016Multiview Hessian Regularization for Image Annotation
Weifeng Liu, Dacheng Tao
cs.LGcs.CVstat.MLarXiv:1904.10100v12019DU-GAN: Generative Adversarial Networks with Dual-Domain U-Net Based Discriminators for Low-Dose CT Denoising
Zhizhong Huang, Junping Zhang, Yi Zhang +1
eess.IVcs.CVphysics.med-pharXiv:2108.10772v22021DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation
Zhenyu Li, Zehui Chen, Xianming Liu +1
cs.CVarXiv:2203.14211v12022PlaneRCNN: 3D Plane Detection and Reconstruction from a Single Image
Chen Liu, Kihwan Kim, Jinwei Gu +2
cs.CVarXiv:1812.04072v22018End-to-End Dense Video Captioning with Parallel Decoding
Teng Wang, Ruimao Zhang, Zhichao Lu +3
cs.CVarXiv:2108.07781v22021Empowering Local Agriculture: A Deep Learning-Powered Web System for Identifying Bangladeshi Mango Varieties
Monowar Islam, Safaruzzaman Shovo
cs.CVcs.LGarXiv:2608.28161v12026Stochastic seismic waveform inversion using generative adversarial networks as a geological prior
Lukas Mosser, Olivier Dubrule, Martin J. Blunt
physics.geo-phcs.CVstat.MLarXiv:1806.03720v12018What Do Interaction Representations Actually Measure? Pre-Event Separability in Weakly-Supervised Violence Detection
Parishruthi Ganesh
cs.CVcs.LGarXiv:2608.27879v12026Lung and Pancreatic Tumor Characterization in the Deep Learning Era: Novel Supervised and Unsupervised Learning Approaches
Sarfaraz Hussein, Pujan Kandel, Candice W. Bolan +2
cs.CVcs.AIcs.LGarXiv:1801.03230v32018Deep Learning with Convolutional Neural Network for Objective Skill Evaluation in Robot-assisted Surgery
Ziheng Wang, Ann Majewicz Fey
cs.CVcs.ROarXiv:1806.05796v22018Monitoring COVID-19 social distancing with person detection and tracking via fine-tuned YOLO v3 and Deepsort techniques
Narinder Singh Punn, Sanjay Kumar Sonbhadra, Sonali Agarwal +1
cs.CVarXiv:2005.01385v42020Error Compensated Quantized SGD and its Applications to Large-scale Distributed Optimization
Jiaxiang Wu, Weidong Huang, Junzhou Huang +1
cs.CVcs.DCarXiv:1806.08054v12018DiffRF: Rendering-Guided 3D Radiance Field Diffusion
Norman Müller, Yawar Siddiqui, Lorenzo Porzi +3
cs.CVarXiv:2212.01206v22022SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision Applications
Abdelrahman Shaker, Muhammad Maaz, Hanoona Rasheed +3
cs.CVarXiv:2303.15446v22023End-to-end Hand Mesh Recovery from a Monocular RGB Image
Xiong Zhang, Qiang Li, Hong Mo +2
cs.CVarXiv:1902.09305v32019Crowd Counting with Deep Structured Scale Integration Network
Lingbo Liu, Zhilin Qiu, Guanbin Li +3
cs.CVarXiv:1908.08692v12019RegionViT: Regional-to-Local Attention for Vision Transformers
Chun-Fu Chen, Rameswar Panda, Quanfu Fan
cs.CVarXiv:2106.02689v32021Connectionist Temporal Modeling for Weakly Supervised Action Labeling
De-An Huang, Li Fei-Fei, Juan Carlos Niebles
cs.CVarXiv:1607.08584v12016Direction-aware Spatial Context Features for Shadow Detection and Removal
Xiaowei Hu, Chi-Wing Fu, Lei Zhu +2
cs.CVarXiv:1805.04635v220183D Gaussian as a New Era: A Survey
Ben Fei, Jingyi Xu, Rui Zhang +3
cs.CVcs.GRarXiv:2402.07181v22024UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection
Ye Liu, Siyuan Li, Yang Wu +3
cs.CVarXiv:2203.12745v22022Sequence Level Semantics Aggregation for Video Object Detection
Haiping Wu, Yuntao Chen, Naiyan Wang +1
cs.CVarXiv:1907.06390v22019Visual Geometry Grounded Deep Structure From Motion
Jianyuan Wang, Nikita Karaev, Christian Rupprecht +1
cs.CVcs.ROarXiv:2312.04563v12023Scaling Autoregressive Video Models
Dirk Weissenborn, Oscar Täckström, Jakob Uszkoreit
cs.CVcs.AIcs.LGarXiv:1906.02634v32019PoseRBPF: A Rao-Blackwellized Particle Filter for 6D Object Pose Tracking
Xinke Deng, Arsalan Mousavian, Yu Xiang +3
cs.CVcs.ROarXiv:1905.09304v12019DPSNet: End-to-end Deep Plane Sweep Stereo
Sunghoon Im, Hae-Gon Jeon, Stephen Lin +1
cs.CVcs.ROarXiv:1905.00538v12019Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular, Stereo, and RGB-D Cameras
Huajian Huang, Longwei Li, Hui Cheng +1
cs.CVarXiv:2311.16728v22023MS$^2$L: Multi-Task Self-Supervised Learning for Skeleton Based Action Recognition
Lilang Lin, Sijie Song, Wenhan Yan +1
cs.CVcs.AIarXiv:2010.05599v22020Bridging the Gap to Real-World Object-Centric Learning
Maximilian Seitzer, Max Horn, Andrii Zadaianchuk +8
cs.CVcs.LGarXiv:2209.14860v22022CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models
Yuan Yao, Ao Zhang, Zhengyan Zhang +3
cs.CVcs.CLarXiv:2109.11797v32021S2Looking: A Satellite Side-Looking Dataset for Building Change Detection
Li Shen, Yao Lu, Hao Chen +6
cs.CVcs.AIeess.IVarXiv:2107.09244v32021Dynamic Graph Attention for Referring Expression Comprehension
Sibei Yang, Guanbin Li, Yizhou Yu
cs.CVarXiv:1909.08164v12019Rethinking Mobile Block for Efficient Attention-based Models
Jiangning Zhang, Xiangtai Li, Jian Li +7
cs.CVarXiv:2301.01146v42023Iterative fully convolutional neural networks for automatic vertebra segmentation and identification
Nikolas Lessmann, Bram van Ginneken, Pim A. de Jong +1
cs.CVarXiv:1804.04383v32018Recurrent Fusion Network for Image Captioning
Wenhao Jiang, Lin Ma, Yu-Gang Jiang +2
cs.CVarXiv:1807.09986v32018Neural Sign Language Translation based on Human Keypoint Estimation
Sang-Ki Ko, Chang Jo Kim, Hyedong Jung +1
cs.CVarXiv:1811.11436v22018Group DETR: Fast DETR Training with Group-Wise One-to-Many Assignment
Qiang Chen, Xiaokang Chen, Jian Wang +7
cs.CVarXiv:2207.13085v32022Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification
Ali Diba, Mohsen Fayyaz, Vivek Sharma +4
cs.CVarXiv:1711.08200v12017Online Temporal Calibration for Monocular Visual-Inertial Systems
Tong Qin, Shaojie Shen
cs.CVarXiv:1808.00692v12018HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding
Xiaosong Jia, Penghao Wu, Li Chen +3
cs.AIcs.CVcs.LGarXiv:2205.09753v22022Hallucinated-IQA: No-Reference Image Quality Assessment via Adversarial Learning
Kwan-Yee Lin, Guanxiang Wang
cs.CVarXiv:1804.01681v12018NICER-SLAM: Neural Implicit Scene Encoding for RGB SLAM
Zihan Zhu, Songyou Peng, Viktor Larsson +4
cs.CVarXiv:2302.03594v12023Skeleton based action recognition using translation-scale invariant image mapping and multi-scale deep cnn
Bo Li, Mingyi He, Xuelian Cheng +2
cs.CVarXiv:1704.05645v22017AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning
Wonjun Lee, Jaehyuk Jang, Kangwook Ko +2
cs.CVcs.CLarXiv:2608.28312v12026Cross Aggregation Transformer for Image Restoration
Zheng Chen, Yulun Zhang, Jinjin Gu +3
cs.CVarXiv:2211.13654v22022Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images
Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara
cs.CVcs.CLarXiv:2608.28248v12026C-MIL: Continuation Multiple Instance Learning for Weakly Supervised Object Detection
Fang Wan, Chang Liu, Wei Ke +3
cs.CVarXiv:1904.05647v12019DiT: Self-supervised Pre-training for Document Image Transformer
Junlong Li, Yiheng Xu, Tengchao Lv +3
cs.CVarXiv:2203.02378v32022SimMatch: Semi-supervised Learning with Similarity Matching
Mingkai Zheng, Shan You, Lang Huang +3
cs.CVarXiv:2203.06915v22022EmerNeRF: Emergent Spatial-Temporal Scene Decomposition via Self-Supervision
Jiawei Yang, Boris Ivanovic, Or Litany +8
cs.CVarXiv:2311.02077v12023Mutual Graph Learning for Camouflaged Object Detection
Qiang Zhai, Xin Li, Fan Yang +3
cs.CVarXiv:2104.02613v12021Cylinder3D: An Effective 3D Framework for Driving-scene LiDAR Semantic Segmentation
Hui Zhou, Xinge Zhu, Xiao Song +4
cs.CVarXiv:2008.01550v12020Uni3D: Exploring Unified 3D Representation at Scale
Junsheng Zhou, Jinsheng Wang, Baorui Ma +3
cs.CVcs.CLarXiv:2310.06773v12023Fast and Accurate Online Video Object Segmentation via Tracking Parts
Jingchun Cheng, Yi-Hsuan Tsai, Wei-Chih Hung +2
cs.CVarXiv:1806.02323v12018