Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,421 to 12,480 of 18,839

  1. Learning Individual Styles of Conversational Gesture

    Shiry Ginosar, Amir Bar, Gefen Kohavi +3

    cs.CVcs.LGeess.ASarXiv:1906.04160v12019
  2. Medical Image Retrieval using Deep Convolutional Neural Network

    Adnan Qayyum, Syed Muhammad Anwar, Muhammad Awais +1

    cs.CVarXiv:1703.08472v12017
  3. Improved Lossy Image Compression with Priming and Spatially Adaptive Bit Rates for Recurrent Networks

    Nick Johnston, Damien Vincent, David Minnen +6

    cs.CVarXiv:1703.10114v12017
  4. End-to-End Multi-View Fusion for 3D Object Detection in LiDAR Point Clouds

    Yin Zhou, Pei Sun, Yu Zhang +6

    cs.CVarXiv:1910.06528v22019
  5. Webly Supervised Learning of Convolutional Networks

    Xinlei Chen, Abhinav Gupta

    cs.CVarXiv:1505.01554v22015
  6. EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition

    Evangelos Kazakos, Arsha Nagrani, Andrew Zisserman +1

    cs.CVarXiv:1908.08498v12019
  7. MAGVIT: Masked Generative Video Transformer

    Lijun Yu, Yong Cheng, Kihyuk Sohn +8

    cs.CVarXiv:2212.05199v22022
  8. Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines

    Yen-Chang Hsu, Yen-Cheng Liu, Anita Ramasamy +1

    cs.LGcs.AIcs.CVarXiv:1810.12488v42018
  9. The Fast Bilateral Solver

    Jonathan T. Barron, Ben Poole

    cs.CVarXiv:1511.03296v22015
  10. Long-CLIP: Unlocking the Long-Text Capability of CLIP

    Beichen Zhang, Pan Zhang, Xiaoyi Dong +2

    cs.CVarXiv:2403.15378v32024
  11. Prediction of Sea Surface Temperature using Long Short-Term Memory

    Qin Zhang, Hui Wang, Junyu Dong +2

    cs.CVarXiv:1705.06861v12017
  12. Text2LIVE: Text-Driven Layered Image and Video Editing

    Omer Bar-Tal, Dolev Ofri-Amar, Rafail Fridman +2

    cs.CVarXiv:2204.02491v22022
  13. Deep Plug-and-Play Super-Resolution for Arbitrary Blur Kernels

    Kai Zhang, Wangmeng Zuo, Lei Zhang

    cs.CVarXiv:1903.12529v12019
  14. Deep Cosine Metric Learning for Person Re-Identification

    Nicolai Wojke, Alex Bewley

    cs.CVcs.LGarXiv:1812.00442v12018
  15. Learning to Predict 3D Objects with an Interpolation-based Differentiable Renderer

    Wenzheng Chen, Jun Gao, Huan Ling +4

    cs.CVarXiv:1908.01210v22019
  16. To learn image super-resolution, use a GAN to learn how to do image degradation first

    Adrian Bulat, Jing Yang, Georgios Tzimiropoulos

    cs.CVarXiv:1807.11458v12018
  17. Few-shot Video-to-Video Synthesis

    Ting-Chun Wang, Ming-Yu Liu, Andrew Tao +3

    cs.CVcs.GRcs.LGarXiv:1910.12713v12019
  18. Adaptive Decontamination of the Training Set: A Unified Formulation for Discriminative Visual Tracking

    Martin Danelljan, Gustav Häger, Fahad Shahbaz Khan +1

    cs.CVarXiv:1609.06118v12016
  19. Surgical Video Generation From Diffusion to World Models: A Survey

    Fuxiang Huang, Chenxu Zhang, Liang Han +1

    cs.CVarXiv:2608.26214v12026
  20. FSGS: Real-Time Few-shot View Synthesis using Gaussian Splatting

    Zehao Zhu, Zhiwen Fan, Yifan Jiang +1

    cs.CVarXiv:2312.00451v22023
  21. Do GANs leave artificial fingerprints?

    Francesco Marra, Diego Gragnaniello, Luisa Verdoliva +1

    cs.CVarXiv:1812.11842v12018
  22. Decoupling Representation Learning from Reinforcement Learning

    Adam Stooke, Kimin Lee, Pieter Abbeel +1

    cs.LGcs.AIcs.CVarXiv:2009.08319v32020
  23. Self-supervised Co-training for Video Representation Learning

    Tengda Han, Weidi Xie, Andrew Zisserman

    cs.CVarXiv:2010.09709v22020
  24. Very fast watermarking by reversible contrast mapping

    Dinu Coltuc, Jean-Marc Chassery

    cs.MMcs.CRcs.CVarXiv:0707.0802v12007
  25. Shift: A Zero FLOP, Zero Parameter Alternative to Spatial Convolutions

    Bichen Wu, Alvin Wan, Xiangyu Yue +6

    cs.CVarXiv:1711.08141v22017
  26. Mapping Woody Vegetation from Multi-Source Imagery and Prediction Fusion for Enhanced Data Efficiency and Accuracy

    Kal Backman, Jared Wood, Adam Roff

    cs.CVarXiv:2608.26471v12026
  27. Viewpoints and Keypoints

    Shubham Tulsiani, Jitendra Malik

    cs.CVarXiv:1411.6067v22014
  28. Unsupervised Bidirectional Cross-Modality Adaptation via Deeply Synergistic Image and Feature Alignment for Medical Image Segmentation

    Cheng Chen, Qi Dou, Hao Chen +2

    eess.IVcs.CVarXiv:2002.02255v12020
  29. Antipodal Robotic Grasping using Generative Residual Convolutional Neural Network

    Sulabh Kumra, Shirin Joshi, Ferat Sahin

    cs.ROcs.CVarXiv:1909.04810v42019
  30. StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

    Kaiqi Liu, Haoxuan Zeng, Jingqi Liu +7

    cs.SDcs.CVcs.MMarXiv:2608.26336v12026
  31. Adaptive Fourier Neural Operators: Efficient Token Mixers for Transformers

    John Guibas, Morteza Mardani, Zongyi Li +3

    cs.CVcs.LGarXiv:2111.13587v22021
  32. Self-Supervised Learning with Data Augmentations Provably Isolates Content from Style

    Julius von Kügelgen, Yash Sharma, Luigi Gresele +4

    stat.MLcs.AIcs.CVarXiv:2106.04619v42021
  33. OmniGen: Unified Image Generation

    Shitao Xiao, Yueze Wang, Junjie Zhou +7

    cs.CVcs.AIarXiv:2409.11340v22024
  34. SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution

    Rongyuan Wu, Tao Yang, Lingchen Sun +3

    cs.CVarXiv:2311.16518v22023
  35. Robustness of classifiers: from adversarial to random noise

    Alhussein Fawzi, Seyed-Mohsen Moosavi-Dezfooli, Pascal Frossard

    cs.LGcs.CVstat.MLarXiv:1608.08967v12016
  36. Learning Dense Correspondence via 3D-guided Cycle Consistency

    Tinghui Zhou, Philipp Krähenbühl, Mathieu Aubry +2

    cs.CVarXiv:1604.05383v12016
  37. A Cookbook of Self-Supervised Learning

    Randall Balestriero, Mark Ibrahim, Vlad Sobal +16

    cs.LGcs.CVarXiv:2304.12210v22023
  38. Learning Modulated Loss for Rotated Object Detection

    Wen Qian, Xue Yang, Silong Peng +2

    cs.CVarXiv:1911.08299v32019
  39. Explain Images with Multimodal Recurrent Neural Networks

    Junhua Mao, Wei Xu, Yi Yang +2

    cs.CVcs.CLcs.LGarXiv:1410.1090v12014
  40. Intel RealSense Stereoscopic Depth Cameras

    Leonid Keselman, John Iselin Woodfill, Anders Grunnet-Jepsen +1

    cs.CVarXiv:1705.05548v22017
  41. Learning a No-Reference Quality Assessment Model of Enhanced Images With Big Data

    Ke Gu, Dacheng Tao, Junfei Qiao +1

    cs.CVarXiv:1904.08632v12019
  42. Whitening for Self-Supervised Representation Learning

    Aleksandr Ermolov, Aliaksandr Siarohin, Enver Sangineto +1

    cs.LGcs.CVstat.MLarXiv:2007.06346v52020
  43. Graph Attention Tracking

    Dongyan Guo, Yanyan Shao, Ying Cui +3

    cs.CVarXiv:2011.11204v12020
  44. Very Deep VAEs Generalize Autoregressive Models and Can Outperform Them on Images

    Rewon Child

    cs.LGcs.CVarXiv:2011.10650v22020
  45. VINet: Visual-Inertial Odometry as a Sequence-to-Sequence Learning Problem

    Ronald Clark, Sen Wang, Hongkai Wen +2

    cs.CVarXiv:1701.08376v22017
  46. Perception Prioritized Training of Diffusion Models

    Jooyoung Choi, Jungbeom Lee, Chaehun Shin +3

    cs.CVcs.LGarXiv:2204.00227v12022
  47. Diffusion Self-Guidance for Controllable Image Generation

    Dave Epstein, Allan Jabri, Ben Poole +2

    cs.CVcs.LGstat.MLarXiv:2306.00986v32023
  48. Disc-aware Ensemble Network for Glaucoma Screening from Fundus Image

    Huazhu Fu, Jun Cheng, Yanwu Xu +4

    cs.CVarXiv:1805.07549v12018
  49. LMDrive: Closed-Loop End-to-End Driving with Large Language Models

    Hao Shao, Yuxuan Hu, Letian Wang +3

    cs.CVcs.AIcs.ROarXiv:2312.07488v22023
  50. Diverse Part Discovery: Occluded Person Re-identification with Part-Aware Transformer

    Yulin Li, Jianfeng He, Tianzhu Zhang +3

    cs.CVarXiv:2106.04095v12021
  51. Exploring and Distilling Posterior and Prior Knowledge for Radiology Report Generation

    Fenglin Liu, Xian Wu, Shen Ge +2

    cs.CVcs.CLarXiv:2106.06963v22021
  52. Fast Patch-based Style Transfer of Arbitrary Style

    Tian Qi Chen, Mark Schmidt

    cs.CVcs.GRcs.LGarXiv:1612.04337v12016
  53. Style Normalization and Restitution for Generalizable Person Re-identification

    Xin Jin, Cuiling Lan, Wenjun Zeng +2

    cs.CVarXiv:2005.11037v12020
  54. RSVQA: Visual Question Answering for Remote Sensing Data

    Sylvain Lobry, Diego Marcos, Jesse Murray +1

    cs.CVarXiv:2003.07333v22020
  55. Forward and Backward Information Retention for Accurate Binary Neural Networks

    Haotong Qin, Ruihao Gong, Xianglong Liu +4

    cs.CVarXiv:1909.10788v42019
  56. RTNav: Towards Real-Time Zero-Shot Object Navigation

    Easop Lee, Lingyu Zhang, Boyuan Chen

    cs.ROcs.AIcs.CVarXiv:2608.26496v12026
  57. PCL: Proposal Cluster Learning for Weakly Supervised Object Detection

    Peng Tang, Xinggang Wang, Song Bai +4

    cs.CVarXiv:1807.03342v22018
  58. Data Augmentation using Random Image Cropping and Patching for Deep CNNs

    Ryo Takahashi, Takashi Matsubara, Kuniaki Uehara

    cs.CVcs.LGarXiv:1811.09030v22018
  59. A Review Paper: Noise Models in Digital Image Processing

    Ajay Kumar Boyat, Brijendra Kumar Joshi

    cs.CVarXiv:1505.03489v12015
  60. SE-SSD: Self-Ensembling Single-Stage Object Detector From Point Cloud

    Wu Zheng, Weiliang Tang, Li Jiang +1

    cs.CVarXiv:2104.09804v12021