Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

13,621 to 13,680 of 18,866

  1. Deep Local Shapes: Learning Local SDF Priors for Detailed 3D Reconstruction

    Rohan Chabra, Jan Eric Lenssen, Eddy Ilg +4

    cs.CVcs.CGcs.LGarXiv:2003.10983v32020
  2. Diffusion Art or Digital Forgery? Investigating Data Replication in Diffusion Models

    Gowthami Somepalli, Vasu Singla, Micah Goldblum +2

    cs.LGcs.CVcs.CYarXiv:2212.03860v32022
  3. Hierarchical Deep Temporal Models for Group Activity Recognition

    Mostafa S. Ibrahim, Srikanth Muralidharan, Zhiwei Deng +2

    cs.CVarXiv:1607.02643v12016
  4. UntrimmedNets for Weakly Supervised Action Recognition and Detection

    Limin Wang, Yuanjun Xiong, Dahua Lin +1

    cs.CVarXiv:1703.03329v22017
  5. Cross-City Matters: A Multimodal Remote Sensing Benchmark Dataset for Cross-City Semantic Segmentation using High-Resolution Domain Adaptation Networks

    Danfeng Hong, Bing Zhang, Hao Li +7

    cs.CVeess.IVarXiv:2309.16499v22023
  6. Emerging from Water: Underwater Image Color Correction Based on Weakly Supervised Color Transfer

    Chongyi Li, Jichang Guo, Chunle Guo

    cs.CVarXiv:1710.07084v32017
  7. FearNet: Brain-Inspired Model for Incremental Learning

    Ronald Kemker, Christopher Kanan

    cs.LGcs.AIcs.CVarXiv:1711.10563v22017
  8. DeepEdge: A Multi-Scale Bifurcated Deep Network for Top-Down Contour Detection

    Gedas Bertasius, Jianbo Shi, Lorenzo Torresani

    cs.CVarXiv:1412.1123v32014
  9. A Pose-Sensitive Embedding for Person Re-Identification with Expanded Cross Neighborhood Re-Ranking

    M. Saquib Sarfraz, Arne Schumann, Andreas Eberle +1

    cs.CVarXiv:1711.10378v22017
  10. Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-Labels

    Yuchao Wang, Haochen Wang, Yujun Shen +6

    cs.CVarXiv:2203.03884v22022
  11. GeoChat: Grounded Large Vision-Language Model for Remote Sensing

    Kartik Kuckreja, Muhammad Sohail Danish, Muzammal Naseer +3

    cs.CVcs.AIarXiv:2311.15826v12023
  12. How Much Can CLIP Benefit Vision-and-Language Tasks?

    Sheng Shen, Liunian Harold Li, Hao Tan +5

    cs.CVcs.AIcs.CLarXiv:2107.06383v12021
  13. GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting

    Chi Yan, Delin Qu, Dan Xu +4

    cs.CVarXiv:2311.11700v42023
  14. Women also Snowboard: Overcoming Bias in Captioning Models

    Kaylee Burns, Lisa Anne Hendricks, Kate Saenko +2

    cs.CVarXiv:1803.09797v42018
  15. CLAY: A Controllable Large-scale Generative Model for Creating High-quality 3D Assets

    Longwen Zhang, Ziyu Wang, Qixuan Zhang +6

    cs.CVarXiv:2406.13897v12024
  16. Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates

    Leslie N. Smith, Nicholay Topin

    cs.LGcs.CVcs.NEarXiv:1708.07120v32017
  17. Emergent Correspondence from Image Diffusion

    Luming Tang, Menglin Jia, Qianqian Wang +2

    cs.CVarXiv:2306.03881v22023
  18. HybrIK: A Hybrid Analytical-Neural Inverse Kinematics Solution for 3D Human Pose and Shape Estimation

    Jiefeng Li, Chao Xu, Zhicun Chen +3

    cs.CVarXiv:2011.14672v42020
  19. Prompt-aligned Gradient for Prompt Tuning

    Beier Zhu, Yulei Niu, Yucheng Han +2

    cs.CVarXiv:2205.14865v42022
  20. T-CNN: Tubelets with Convolutional Neural Networks for Object Detection from Videos

    Kai Kang, Hongsheng Li, Junjie Yan +8

    cs.CVarXiv:1604.02532v42016
  21. Beyond Bilinear: Generalized Multimodal Factorized High-order Pooling for Visual Question Answering

    Zhou Yu, Jun Yu, Chenchao Xiang +2

    cs.CVarXiv:1708.03619v22017
  22. Learning Feature Pyramids for Human Pose Estimation

    Wei Yang, Shuang Li, Wanli Ouyang +2

    cs.CVarXiv:1708.01101v12017
    Summaries:한국어
  23. ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning

    Shengchao Hu, Li Chen, Penghao Wu +3

    cs.CVarXiv:2207.07601v22022
  24. Meta-SR: A Magnification-Arbitrary Network for Super-Resolution

    Xuecai Hu, Haoyuan Mu, Xiangyu Zhang +3

    cs.CVarXiv:1903.00875v42019
  25. Multi-Level Factorisation Net for Person Re-Identification

    Xiaobin Chang, Timothy M. Hospedales, Tao Xiang

    cs.CVarXiv:1803.09132v22018
  26. Detecting Visual Relationships with Deep Relational Networks

    Bo Dai, Yuqi Zhang, Dahua Lin

    cs.CVarXiv:1704.03114v22017
  27. Patch SVDD: Patch-level SVDD for Anomaly Detection and Segmentation

    Jihun Yi, Sungroh Yoon

    cs.CVarXiv:2006.16067v22020
  28. Grounding of Textual Phrases in Images by Reconstruction

    Anna Rohrbach, Marcus Rohrbach, Ronghang Hu +2

    cs.CVcs.CLcs.LGarXiv:1511.03745v42015
  29. An Uncertain Future: Forecasting from Static Images using Variational Autoencoders

    Jacob Walker, Carl Doersch, Abhinav Gupta +1

    cs.CVarXiv:1606.07873v12016
  30. A probabilistic atlas of the human thalamic nuclei combining ex vivo MRI and histology

    Juan Eugenio Iglesias, Ricardo Insausti, Garikoitz Lerma-Usabiaga +7

    q-bio.NCcs.CVphysics.med-pharXiv:1806.08634v12018
  31. WaveletKernelNet: An Interpretable Deep Neural Network for Industrial Intelligent Diagnosis

    Tianfu Li, Zhibin Zhao, Chuang Sun +4

    cs.CVcs.LGcs.NEarXiv:1911.07925v32019
  32. Fast inference of deep neural networks in FPGAs for particle physics

    Javier Duarte, Song Han, Philip Harris +8

    physics.ins-detcs.CVhep-exarXiv:1804.06913v32018
  33. ActionCLIP: A New Paradigm for Video Action Recognition

    Mengmeng Wang, Jiazheng Xing, Yong Liu

    cs.CVarXiv:2109.08472v12021
  34. Multimodal Motion Prediction with Stacked Transformers

    Yicheng Liu, Jinghuai Zhang, Liangji Fang +2

    cs.CVcs.AIarXiv:2103.11624v22021
  35. Star-convex Polyhedra for 3D Object Detection and Segmentation in Microscopy

    Martin Weigert, Uwe Schmidt, Robert Haase +2

    cs.CVarXiv:1908.03636v22019
  36. Evaluating Text-to-Visual Generation with Image-to-Text Generation

    Zhiqiu Lin, Deepak Pathak, Baiqi Li +5

    cs.CVcs.AIcs.CLarXiv:2404.01291v22024
  37. RankIQA: Learning from Rankings for No-reference Image Quality Assessment

    Xialei Liu, Joost van de Weijer, Andrew D. Bagdanov

    cs.CVarXiv:1707.08347v12017
  38. FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents

    Guillaume Jaume, Hazim Kemal Ekenel, Jean-Philippe Thiran

    cs.IRcs.CVcs.LGarXiv:1905.13538v22019
  39. Rewrite the Stars

    Xu Ma, Xiyang Dai, Yue Bai +2

    cs.CVarXiv:2403.19967v12024
  40. Neural Body Fitting: Unifying Deep Learning and Model-Based Human Pose and Shape Estimation

    Mohamed Omran, Christoph Lassner, Gerard Pons-Moll +2

    cs.CVarXiv:1808.05942v12018
  41. Long-Term Feature Banks for Detailed Video Understanding

    Chao-Yuan Wu, Christoph Feichtenhofer, Haoqi Fan +3

    cs.CVarXiv:1812.05038v22018
  42. Edge-labeling Graph Neural Network for Few-shot Learning

    Jongmin Kim, Taesup Kim, Sungwoong Kim +1

    cs.LGcs.CVarXiv:1905.01436v12019
  43. The Curse of Recursion: Training on Generated Data Makes Models Forget

    Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao +3

    cs.LGcs.AIcs.CLarXiv:2305.17493v32023
  44. Articulated Pose Estimation by a Graphical Model with Image Dependent Pairwise Relations

    Xianjie Chen, Alan Yuille

    cs.CVarXiv:1407.3399v22014
  45. Long-Tailed Classification by Keeping the Good and Removing the Bad Momentum Causal Effect

    Kaihua Tang, Jianqiang Huang, Hanwang Zhang

    cs.CVcs.LGstat.MLarXiv:2009.12991v52020
  46. Unsupervised Medical Image Translation with Adversarial Diffusion Models

    Muzaffer Özbey, Onat Dalmaz, Salman UH Dar +4

    eess.IVcs.CVarXiv:2207.08208v32022
  47. Understanding and Improving Convolutional Neural Networks via Concatenated Rectified Linear Units

    Wenling Shang, Kihyuk Sohn, Diogo Almeida +1

    cs.LGcs.CVarXiv:1603.05201v22016
  48. Learning to Find Good Correspondences

    Kwang Moo Yi, Eduard Trulls, Yuki Ono +3

    cs.CVarXiv:1711.05971v22017
  49. Tensor Robust Principal Component Analysis: Exact Recovery of Corrupted Low-Rank Tensors via Convex Optimization

    Canyi Lu, Jiashi Feng, Yudong Chen +3

    cs.CVarXiv:1708.04181v32017
  50. Fractional Max-Pooling

    Benjamin Graham

    cs.CVarXiv:1412.6071v42014
  51. A Survey on Instance Segmentation: State of the art

    Abdul Mueed Hafiz, Ghulam Mohiuddin Bhat

    cs.CVcs.LGeess.IVarXiv:2007.00047v12020
  52. F-Cooper: Feature based Cooperative Perception for Autonomous Vehicle Edge Computing System Using 3D Point Clouds

    Qi Chen

    cs.CVarXiv:1909.06459v12019
  53. Restoring Vision in Adverse Weather Conditions with Patch-Based Denoising Diffusion Models

    Ozan Özdenizci, Robert Legenstein

    cs.CVcs.LGarXiv:2207.14626v22022
  54. Cross-Age LFW: A Database for Studying Cross-Age Face Recognition in Unconstrained Environments

    Tianyue Zheng, Weihong Deng, Jiani Hu

    cs.CVcs.DBarXiv:1708.08197v12017
  55. MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark

    Xiang Yue, Tianyu Zheng, Yuansheng Ni +10

    cs.CLcs.CVarXiv:2409.02813v32024
  56. NWPU-Crowd: A Large-Scale Benchmark for Crowd Counting and Localization

    Qi Wang, Junyu Gao, Wei Lin +1

    cs.CVarXiv:2001.03360v42020
  57. ECO: Efficient Convolutional Network for Online Video Understanding

    Mohammadreza Zolfaghari, Kamaljeet Singh, Thomas Brox

    cs.CVcs.AIcs.IRarXiv:1804.09066v22018
  58. DesnowNet: Context-Aware Deep Network for Snow Removal

    Yun-Fu Liu, Da-Wei Jaw, Shih-Chia Huang +1

    cs.CVarXiv:1708.04512v12017
  59. 3D Morphable Face Models -- Past, Present and Future

    Bernhard Egger, William A. P. Smith, Ayush Tewari +10

    cs.CVcs.GRcs.LGarXiv:1909.01815v22019
  60. Scribbler: Controlling Deep Image Synthesis with Sketch and Color

    Patsorn Sangkloy, Jingwan Lu, Chen Fang +2

    cs.CVcs.LGarXiv:1612.00835v22016