Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,721 to 9,780 of 18,780

  1. Continual Prototype Evolution: Learning Online from Non-Stationary Data Streams

    Matthias De Lange, Tinne Tuytelaars

    cs.CVcs.AIarXiv:2009.00919v42020
  2. SPARF: Neural Radiance Fields from Sparse and Noisy Poses

    Prune Truong, Marie-Julie Rakotosaona, Fabian Manhardt +1

    cs.CVarXiv:2211.11738v32022
  3. An Exploration of 2D and 3D Deep Learning Techniques for Cardiac MR Image Segmentation

    Christian F. Baumgartner, Lisa M. Koch, Marc Pollefeys +1

    cs.CVarXiv:1709.04496v22017
  4. Targeted Supervised Contrastive Learning for Long-Tailed Recognition

    Tianhong Li, Peng Cao, Yuan Yuan +5

    cs.CVarXiv:2111.13998v22021
  5. A Physics-based Noise Formation Model for Extreme Low-light Raw Denoising

    Kaixuan Wei, Ying Fu, Jiaolong Yang +1

    eess.IVcs.CVarXiv:2003.12751v22020
  6. Probabilistic two-stage detection

    Xingyi Zhou, Vladlen Koltun, Philipp Krähenbühl

    cs.CVarXiv:2103.07461v12021
  7. InfoNeRF: Ray Entropy Minimization for Few-Shot Neural Volume Rendering

    Mijeong Kim, Seonguk Seo, Bohyung Han

    cs.CVcs.GReess.IVarXiv:2112.15399v22021
  8. Spatial Group-wise Enhance: Improving Semantic Feature Learning in Convolutional Networks

    Xiang Li, Xiaolin Hu, Jian Yang

    cs.CVarXiv:1905.09646v22019
  9. Training-Free Temporal Abstraction for General Video Understanding

    Etienne Casanova, Sevan Brodjian, Pietro Perona

    cs.CVarXiv:2608.27929v12026
  10. Learning Placeholders for Open-Set Recognition

    Da-Wei Zhou, Han-Jia Ye, De-Chuan Zhan

    cs.CVarXiv:2103.15086v12021
  11. RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation

    Yufei Wang, Zhou Xian, Feng Chen +6

    cs.ROcs.AIcs.CVarXiv:2311.01455v32023
  12. A Survey on Deep Hashing Methods

    Xiao Luo, Haixin Wang, Daqing Wu +4

    cs.CVarXiv:2003.03369v52020
  13. CoupleNet: Coupling Global Structure with Local Parts for Object Detection

    Yousong Zhu, Chaoyang Zhao, Jinqiao Wang +3

    cs.CVarXiv:1708.02863v12017
  14. Hyperspectral Image Classification with Attention Aided CNNs

    Renlong Hang, Zhu Li, Qingshan Liu +2

    eess.IVcs.CVarXiv:2005.11977v22020
  15. Relational Knowledge Distillation Brings DNN Representations Close Enough to Humans to Be Aligned Without Supervision

    Yuria Shimizu, Soh Takahashi, Takato Horii +1

    cs.CVq-bio.NCarXiv:2608.27877v12026
  16. Medical SAM 2: Segment medical images as video via Segment Anything Model 2

    Jiayuan Zhu, Abdullah Hamdi, Yunli Qi +2

    cs.CVarXiv:2408.00874v22024
  17. Category-Level Articulated Object Pose Estimation

    Xiaolong Li, He Wang, Li Yi +3

    cs.CVcs.AIcs.ROarXiv:1912.11913v22019
  18. SceneGraphFusion: Incremental 3D Scene Graph Prediction from RGB-D Sequences

    Shun-Cheng Wu, Johanna Wald, Keisuke Tateno +2

    cs.CVcs.LGarXiv:2103.14898v32021
  19. Pushing the Limits of Simple Pipelines for Few-Shot Learning: External Data and Fine-Tuning Make a Difference

    Shell Xu Hu, Da Li, Jan Stühmer +2

    cs.CVcs.LGarXiv:2204.07305v12022
  20. Contrastive Semi-supervised Learning for Underwater Image Restoration via Reliable Bank

    Shirui Huang, Keyan Wang, Huan Liu +2

    cs.CVarXiv:2303.09101v42023
  21. Network Pruning via Transformable Architecture Search

    Xuanyi Dong, Yi Yang

    cs.CVarXiv:1905.09717v52019
  22. MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors

    Riku Murai, Eric Dexheimer, Andrew J. Davison

    cs.CVcs.ROarXiv:2412.12392v22024
  23. Every Pixel Matters: Center-aware Feature Alignment for Domain Adaptive Object Detector

    Cheng-Chun Hsu, Yi-Hsuan Tsai, Yen-Yu Lin +1

    cs.CVarXiv:2008.08574v12020
  24. PU-GCN: Point Cloud Upsampling using Graph Convolutional Networks

    Guocheng Qian, Abdulellah Abualshour, Guohao Li +2

    cs.CVcs.CGcs.LGarXiv:1912.03264v32019
  25. Quadratic video interpolation

    Xiangyu Xu, Li Siyao, Wenxiu Sun +2

    cs.CVarXiv:1911.00627v12019
  26. Part-based Pseudo Label Refinement for Unsupervised Person Re-identification

    Yoonki Cho, Woo Jae Kim, Seunghoon Hong +1

    cs.CVarXiv:2203.14675v12022
  27. A soft thumb-sized vision-based sensor with accurate all-round force perception

    Huanbo Sun, Katherine J. Kuchenbecker, Georg Martius

    cs.ROcs.CVcs.LGarXiv:2111.05934v12021
  28. Ada-TokenCom: Rate-Adaptive Token Communications via Large-Model-Driven Token Compression and Generation

    Zijun Zhang, Li Qiao, Mahdi Boloursaz Mashhadi +3

    cs.ITcs.CVeess.IVarXiv:2608.28086v12026
  29. Gaussian-Flow: 4D Reconstruction with Dynamic 3D Gaussian Particle

    Youtian Lin, Zuozhuo Dai, Siyu Zhu +1

    cs.CVarXiv:2312.03431v12023
  30. Deep-neural-network based sinogram synthesis for sparse-view CT image reconstruction

    Hoyeon Lee, Jongha Lee, Hyeongseok Kim +2

    physics.med-phcs.CVeess.IVarXiv:1803.00694v22018
  31. EXPOSE: Explainable and Domain-Robust Embeddings from Pathology Vision Foundation Models using Sparse Autoencoders

    Anja Witte, Maximilian Lennartz, Jan Baumbach +4

    cs.CVcs.LGarXiv:2608.28191v12026
  32. LiDAR R-CNN: An Efficient and Universal 3D Object Detector

    Zhichao Li, Feng Wang, Naiyan Wang

    cs.CVarXiv:2103.15297v12021
  33. Backdoor Defense via Decoupling the Training Process

    Kunzhe Huang, Yiming Li, Baoyuan Wu +2

    cs.CRcs.CVcs.LGarXiv:2202.03423v12022
  34. TEINet: Towards an Efficient Architecture for Video Recognition

    Zhaoyang Liu, Donghao Luo, Yabiao Wang +6

    cs.CVarXiv:1911.09435v12019
  35. Skeleton-Aware Networks for Deep Motion Retargeting

    Kfir Aberman, Peizhuo Li, Dani Lischinski +3

    cs.CVcs.GRcs.LGarXiv:2005.05732v12020
  36. Dual Student: Breaking the Limits of the Teacher in Semi-supervised Learning

    Zhanghan Ke, Daoye Wang, Qiong Yan +2

    cs.LGcs.CVstat.MLarXiv:1909.01804v12019
  37. Convolutional Recurrent Neural Networks for Glucose Prediction

    Kezhi Li, John Daniels, Chengyuan Liu +2

    cs.CVarXiv:1807.03043v52018
  38. Deep Learning for Tactile Understanding From Visual and Haptic Data

    Yang Gao, Lisa Anne Hendricks, Katherine J. Kuchenbecker +1

    cs.ROcs.CVcs.LGarXiv:1511.06065v22015
  39. Turning a Blind Eye: Explicit Removal of Biases and Variation from Deep Neural Network Embeddings

    Mohsan Alvi, Andrew Zisserman, Christoffer Nellaker

    cs.CVarXiv:1809.02169v22018
  40. BEVT: BERT Pretraining of Video Transformers

    Rui Wang, Dongdong Chen, Zuxuan Wu +6

    cs.CVcs.LGarXiv:2112.01529v32021
  41. Semantically-Guided Representation Learning for Self-Supervised Monocular Depth

    Vitor Guizilini, Rui Hou, Jie Li +2

    cs.CVcs.LGarXiv:2002.12319v12020
  42. CARS: Continuous Evolution for Efficient Neural Architecture Search

    Zhaohui Yang, Yunhe Wang, Xinghao Chen +5

    cs.CVarXiv:1909.04977v62019
  43. Splicing ViT Features for Semantic Appearance Transfer

    Narek Tumanyan, Omer Bar-Tal, Shai Bagon +1

    cs.CVarXiv:2201.00424v12022
  44. SAM-Med2D

    Junlong Cheng, Jin Ye, Zhongying Deng +12

    cs.CVarXiv:2308.16184v12023
  45. Project Aria: A New Tool for Egocentric Multi-Modal AI Research

    Jakob Engel, Kiran Somasundaram, Michael Goesele +71

    cs.HCcs.CVarXiv:2308.13561v32023
  46. Blazingly Fast Video Object Segmentation with Pixel-Wise Metric Learning

    Yuhua Chen, Jordi Pont-Tuset, Alberto Montes +1

    cs.CVarXiv:1804.03131v12018
  47. LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models

    Long Lian, Boyi Li, Adam Yala +1

    cs.CVarXiv:2305.13655v32023
  48. StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation

    Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng +2

    cs.CVarXiv:2405.01434v12024
  49. Reconstructing the Mind's Eye: fMRI-to-Image with Contrastive Learning and Diffusion Priors

    Paul S. Scotti, Atmadeep Banerjee, Jimmie Goode +9

    cs.CVcs.AIq-bio.NCarXiv:2305.18274v22023
  50. Semantically Self-Aligned Network for Text-to-Image Part-aware Person Re-identification

    Zefeng Ding, Changxing Ding, Zhiyin Shao +1

    cs.CVarXiv:2107.12666v22021
  51. Multi-Representation Adaptation Network for Cross-domain Image Classification

    Yongchun Zhu, Fuzhen Zhuang, Jindong Wang +4

    cs.CVcs.AIcs.LGarXiv:2201.01002v12022
  52. Automatic Classification of Cancerous Tissue in Laserendomicroscopy Images of the Oral Cavity using Deep Learning

    Marc Aubreville, Christian Knipfer, Nicolai Oetter +7

    cs.CVarXiv:1703.01622v22017
  53. Adversarial vulnerability for any classifier

    Alhussein Fawzi, Hamza Fawzi, Omar Fawzi

    cs.LGcs.CRcs.CVarXiv:1802.08686v22018
  54. Visual Object Networks: Image Generation with Disentangled 3D Representation

    Jun-Yan Zhu, Zhoutong Zhang, Chengkai Zhang +4

    cs.CVcs.GRstat.MLarXiv:1812.02725v12018
  55. GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D Gaussians

    Liangxiao Hu, Hongwen Zhang, Yuxiang Zhang +4

    cs.CVarXiv:2312.02134v32023
  56. Spatio-temporal Self-Supervised Representation Learning for 3D Point Clouds

    Siyuan Huang, Yichen Xie, Song-Chun Zhu +1

    cs.CVarXiv:2109.00179v12021
  57. Language as Queries for Referring Video Object Segmentation

    Jiannan Wu, Yi Jiang, Peize Sun +2

    cs.CVarXiv:2201.00487v22022
  58. A Survey of Semantic Segmentation

    Martin Thoma

    cs.CVarXiv:1602.06541v22016
  59. TubeTK: Adopting Tubes to Track Multi-Object in a One-Step Training Model

    Bo Pang, Yizhuo Li, Yifan Zhang +2

    cs.CVarXiv:2006.05683v12020
  60. RangeDet:In Defense of Range View for LiDAR-based 3D Object Detection

    Lue Fan, Xuan Xiong, Feng Wang +2

    cs.CVcs.ROarXiv:2103.10039v12021