Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,361 to 9,420 of 18,811

  1. 3D-USE: From Image-Level to Scene-Level Underwater Enhancement

    Jieyu Yuan, Yuanlin Zhang, Jihong Li +3

    cs.CVarXiv:2608.28020v12026
  2. CycleMLP: A MLP-like Architecture for Dense Prediction

    Shoufa Chen, Enze Xie, Chongjian Ge +3

    cs.CVarXiv:2107.10224v42021
  3. DeepPrior++: Improving Fast and Accurate 3D Hand Pose Estimation

    Markus Oberweger, Vincent Lepetit

    cs.CVarXiv:1708.08325v12017
  4. Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

    Xiaoyang Guo, Guoping Luo, Jusheng Zhang +2

    cs.CVarXiv:2608.28138v12026
  5. Identity-Aware Textual-Visual Matching with Latent Co-attention

    Shuang Li, Tong Xiao, Hongsheng Li +2

    cs.CVarXiv:1708.01988v12017
  6. CMS-RCNN: Contextual Multi-Scale Region-based CNN for Unconstrained Face Detection

    Chenchen Zhu, Yutong Zheng, Khoa Luu +1

    cs.CVarXiv:1606.05413v12016
  7. Multiview Hessian Regularization for Image Annotation

    Weifeng Liu, Dacheng Tao

    cs.LGcs.CVstat.MLarXiv:1904.10100v12019
  8. DU-GAN: Generative Adversarial Networks with Dual-Domain U-Net Based Discriminators for Low-Dose CT Denoising

    Zhizhong Huang, Junping Zhang, Yi Zhang +1

    eess.IVcs.CVphysics.med-pharXiv:2108.10772v22021
  9. DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation

    Zhenyu Li, Zehui Chen, Xianming Liu +1

    cs.CVarXiv:2203.14211v12022
  10. PlaneRCNN: 3D Plane Detection and Reconstruction from a Single Image

    Chen Liu, Kihwan Kim, Jinwei Gu +2

    cs.CVarXiv:1812.04072v22018
  11. End-to-End Dense Video Captioning with Parallel Decoding

    Teng Wang, Ruimao Zhang, Zhichao Lu +3

    cs.CVarXiv:2108.07781v22021
  12. Empowering Local Agriculture: A Deep Learning-Powered Web System for Identifying Bangladeshi Mango Varieties

    Monowar Islam, Safaruzzaman Shovo

    cs.CVcs.LGarXiv:2608.28161v12026
  13. Stochastic seismic waveform inversion using generative adversarial networks as a geological prior

    Lukas Mosser, Olivier Dubrule, Martin J. Blunt

    physics.geo-phcs.CVstat.MLarXiv:1806.03720v12018
  14. What Do Interaction Representations Actually Measure? Pre-Event Separability in Weakly-Supervised Violence Detection

    Parishruthi Ganesh

    cs.CVcs.LGarXiv:2608.27879v12026
  15. Lung and Pancreatic Tumor Characterization in the Deep Learning Era: Novel Supervised and Unsupervised Learning Approaches

    Sarfaraz Hussein, Pujan Kandel, Candice W. Bolan +2

    cs.CVcs.AIcs.LGarXiv:1801.03230v32018
  16. Deep Learning with Convolutional Neural Network for Objective Skill Evaluation in Robot-assisted Surgery

    Ziheng Wang, Ann Majewicz Fey

    cs.CVcs.ROarXiv:1806.05796v22018
  17. Monitoring COVID-19 social distancing with person detection and tracking via fine-tuned YOLO v3 and Deepsort techniques

    Narinder Singh Punn, Sanjay Kumar Sonbhadra, Sonali Agarwal +1

    cs.CVarXiv:2005.01385v42020
  18. Error Compensated Quantized SGD and its Applications to Large-scale Distributed Optimization

    Jiaxiang Wu, Weidong Huang, Junzhou Huang +1

    cs.CVcs.DCarXiv:1806.08054v12018
  19. DiffRF: Rendering-Guided 3D Radiance Field Diffusion

    Norman Müller, Yawar Siddiqui, Lorenzo Porzi +3

    cs.CVarXiv:2212.01206v22022
  20. SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision Applications

    Abdelrahman Shaker, Muhammad Maaz, Hanoona Rasheed +3

    cs.CVarXiv:2303.15446v22023
  21. End-to-end Hand Mesh Recovery from a Monocular RGB Image

    Xiong Zhang, Qiang Li, Hong Mo +2

    cs.CVarXiv:1902.09305v32019
  22. Crowd Counting with Deep Structured Scale Integration Network

    Lingbo Liu, Zhilin Qiu, Guanbin Li +3

    cs.CVarXiv:1908.08692v12019
  23. RegionViT: Regional-to-Local Attention for Vision Transformers

    Chun-Fu Chen, Rameswar Panda, Quanfu Fan

    cs.CVarXiv:2106.02689v32021
  24. Connectionist Temporal Modeling for Weakly Supervised Action Labeling

    De-An Huang, Li Fei-Fei, Juan Carlos Niebles

    cs.CVarXiv:1607.08584v12016
  25. Direction-aware Spatial Context Features for Shadow Detection and Removal

    Xiaowei Hu, Chi-Wing Fu, Lei Zhu +2

    cs.CVarXiv:1805.04635v22018
  26. 3D Gaussian as a New Era: A Survey

    Ben Fei, Jingyi Xu, Rui Zhang +3

    cs.CVcs.GRarXiv:2402.07181v22024
  27. UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection

    Ye Liu, Siyuan Li, Yang Wu +3

    cs.CVarXiv:2203.12745v22022
  28. Sequence Level Semantics Aggregation for Video Object Detection

    Haiping Wu, Yuntao Chen, Naiyan Wang +1

    cs.CVarXiv:1907.06390v22019
  29. Visual Geometry Grounded Deep Structure From Motion

    Jianyuan Wang, Nikita Karaev, Christian Rupprecht +1

    cs.CVcs.ROarXiv:2312.04563v12023
  30. Scaling Autoregressive Video Models

    Dirk Weissenborn, Oscar Täckström, Jakob Uszkoreit

    cs.CVcs.AIcs.LGarXiv:1906.02634v32019
  31. PoseRBPF: A Rao-Blackwellized Particle Filter for 6D Object Pose Tracking

    Xinke Deng, Arsalan Mousavian, Yu Xiang +3

    cs.CVcs.ROarXiv:1905.09304v12019
  32. DPSNet: End-to-end Deep Plane Sweep Stereo

    Sunghoon Im, Hae-Gon Jeon, Stephen Lin +1

    cs.CVcs.ROarXiv:1905.00538v12019
  33. Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular, Stereo, and RGB-D Cameras

    Huajian Huang, Longwei Li, Hui Cheng +1

    cs.CVarXiv:2311.16728v22023
  34. MS$^2$L: Multi-Task Self-Supervised Learning for Skeleton Based Action Recognition

    Lilang Lin, Sijie Song, Wenhan Yan +1

    cs.CVcs.AIarXiv:2010.05599v22020
  35. Bridging the Gap to Real-World Object-Centric Learning

    Maximilian Seitzer, Max Horn, Andrii Zadaianchuk +8

    cs.CVcs.LGarXiv:2209.14860v22022
  36. CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models

    Yuan Yao, Ao Zhang, Zhengyan Zhang +3

    cs.CVcs.CLarXiv:2109.11797v32021
  37. S2Looking: A Satellite Side-Looking Dataset for Building Change Detection

    Li Shen, Yao Lu, Hao Chen +6

    cs.CVcs.AIeess.IVarXiv:2107.09244v32021
  38. Dynamic Graph Attention for Referring Expression Comprehension

    Sibei Yang, Guanbin Li, Yizhou Yu

    cs.CVarXiv:1909.08164v12019
  39. Rethinking Mobile Block for Efficient Attention-based Models

    Jiangning Zhang, Xiangtai Li, Jian Li +7

    cs.CVarXiv:2301.01146v42023
  40. Iterative fully convolutional neural networks for automatic vertebra segmentation and identification

    Nikolas Lessmann, Bram van Ginneken, Pim A. de Jong +1

    cs.CVarXiv:1804.04383v32018
  41. Recurrent Fusion Network for Image Captioning

    Wenhao Jiang, Lin Ma, Yu-Gang Jiang +2

    cs.CVarXiv:1807.09986v32018
  42. Neural Sign Language Translation based on Human Keypoint Estimation

    Sang-Ki Ko, Chang Jo Kim, Hyedong Jung +1

    cs.CVarXiv:1811.11436v22018
  43. Group DETR: Fast DETR Training with Group-Wise One-to-Many Assignment

    Qiang Chen, Xiaokang Chen, Jian Wang +7

    cs.CVarXiv:2207.13085v32022
  44. Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification

    Ali Diba, Mohsen Fayyaz, Vivek Sharma +4

    cs.CVarXiv:1711.08200v12017
  45. Online Temporal Calibration for Monocular Visual-Inertial Systems

    Tong Qin, Shaojie Shen

    cs.CVarXiv:1808.00692v12018
  46. HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding

    Xiaosong Jia, Penghao Wu, Li Chen +3

    cs.AIcs.CVcs.LGarXiv:2205.09753v22022
  47. Hallucinated-IQA: No-Reference Image Quality Assessment via Adversarial Learning

    Kwan-Yee Lin, Guanxiang Wang

    cs.CVarXiv:1804.01681v12018
  48. NICER-SLAM: Neural Implicit Scene Encoding for RGB SLAM

    Zihan Zhu, Songyou Peng, Viktor Larsson +4

    cs.CVarXiv:2302.03594v12023
  49. Skeleton based action recognition using translation-scale invariant image mapping and multi-scale deep cnn

    Bo Li, Mingyi He, Xuelian Cheng +2

    cs.CVarXiv:1704.05645v22017
  50. AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning

    Wonjun Lee, Jaehyuk Jang, Kangwook Ko +2

    cs.CVcs.CLarXiv:2608.28312v12026
  51. Cross Aggregation Transformer for Image Restoration

    Zheng Chen, Yulun Zhang, Jinjin Gu +3

    cs.CVarXiv:2211.13654v22022
  52. Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

    Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

    cs.CVcs.CLarXiv:2608.28248v12026
  53. C-MIL: Continuation Multiple Instance Learning for Weakly Supervised Object Detection

    Fang Wan, Chang Liu, Wei Ke +3

    cs.CVarXiv:1904.05647v12019
  54. DiT: Self-supervised Pre-training for Document Image Transformer

    Junlong Li, Yiheng Xu, Tengchao Lv +3

    cs.CVarXiv:2203.02378v32022
  55. SimMatch: Semi-supervised Learning with Similarity Matching

    Mingkai Zheng, Shan You, Lang Huang +3

    cs.CVarXiv:2203.06915v22022
  56. EmerNeRF: Emergent Spatial-Temporal Scene Decomposition via Self-Supervision

    Jiawei Yang, Boris Ivanovic, Or Litany +8

    cs.CVarXiv:2311.02077v12023
  57. Mutual Graph Learning for Camouflaged Object Detection

    Qiang Zhai, Xin Li, Fan Yang +3

    cs.CVarXiv:2104.02613v12021
  58. Cylinder3D: An Effective 3D Framework for Driving-scene LiDAR Semantic Segmentation

    Hui Zhou, Xinge Zhu, Xiao Song +4

    cs.CVarXiv:2008.01550v12020
  59. Uni3D: Exploring Unified 3D Representation at Scale

    Junsheng Zhou, Jinsheng Wang, Baorui Ma +3

    cs.CVcs.CLarXiv:2310.06773v12023
  60. Fast and Accurate Online Video Object Segmentation via Tracking Parts

    Jingchun Cheng, Yi-Hsuan Tsai, Wei-Chih Hung +2

    cs.CVarXiv:1806.02323v12018