Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

11,881 to 11,940 of 18,817

  1. CLIP2Video: Mastering Video-Text Retrieval via Image CLIP

    Han Fang, Pengfei Xiong, Luhui Xu +1

    cs.CVarXiv:2106.11097v12021
  2. CLIP-Driven Universal Model for Organ Segmentation and Tumor Detection

    Jie Liu, Yixiao Zhang, Jie-Neng Chen +7

    eess.IVcs.CVcs.LGarXiv:2301.00785v52023
  3. Deep Learning for Visual Tracking: A Comprehensive Survey

    Seyed Mojtaba Marvasti-Zadeh, Li Cheng, Hossein Ghanei-Yakhdan +1

    cs.CVcs.LGeess.IVarXiv:1912.00535v22019
  4. One Step Diffusion via Shortcut Models

    Kevin Frans, Danijar Hafner, Sergey Levine +1

    cs.LGcs.CVarXiv:2410.12557v32024
  5. Learning to Compose Domain-Specific Transformations for Data Augmentation

    Alexander J. Ratner, Henry R. Ehrenberg, Zeshan Hussain +2

    stat.MLcs.CVcs.LGarXiv:1709.01643v32017
  6. MaskLab: Instance Segmentation by Refining Object Detection with Semantic and Direction Features

    Liang-Chieh Chen, Alexander Hermans, George Papandreou +3

    cs.CVarXiv:1712.04837v12017
  7. HeMIS: Hetero-Modal Image Segmentation

    Mohammad Havaei, Nicolas Guizard, Nicolas Chapados +1

    cs.CVarXiv:1607.05194v12016
  8. MVSS-Net: Multi-View Multi-Scale Supervised Networks for Image Manipulation Detection

    Chengbo Dong, Xinru Chen, Ruohan Hu +2

    cs.CVcs.AIarXiv:2112.08935v32021
  9. Segment Anything Model for Medical Image Segmentation: Current Applications and Future Directions

    Yichi Zhang, Zhenrong Shen, Rushi Jiao

    eess.IVcs.CVarXiv:2401.03495v12024
  10. Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action

    Jiasen Lu, Christopher Clark, Sangho Lee +5

    cs.CVcs.AIcs.CLarXiv:2312.17172v12023
  11. GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest

    Shilong Zhang, Peize Sun, Shoufa Chen +6

    cs.CVarXiv:2307.03601v52023
  12. MedSegDiff-V2: Diffusion based Medical Image Segmentation with Transformer

    Junde Wu, Wei Ji, Huazhu Fu +3

    eess.IVcs.CVarXiv:2301.11798v22023
  13. Face Expression Recognition and Analysis: The State of the Art

    Vinay Bettadapura

    cs.CVarXiv:1203.6722v12012
  14. Learning Adaptive Discriminative Correlation Filters via Temporal Consistency Preserving Spatial Feature Selection for Robust Visual Tracking

    Tianyang Xu, Zhen-Hua Feng, Xiao-Jun Wu +1

    cs.CVarXiv:1807.11348v32018
  15. Deep Affinity Network for Multiple Object Tracking

    ShiJie Sun, Naveed Akhtar, HuanSheng Song +2

    cs.CVarXiv:1810.11780v22018
  16. PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

    Lin Xu, Yilin Zhao, Daquan Zhou +3

    cs.CVarXiv:2404.16994v22024
  17. Visual Spatial Reasoning

    Fangyu Liu, Guy Emerson, Nigel Collier

    cs.CLcs.AIcs.CVarXiv:2205.00363v32022
  18. Thoracic Disease Identification and Localization with Limited Supervision

    Zhe Li, Chong Wang, Mei Han +4

    cs.CVstat.MLarXiv:1711.06373v62017
  19. MeshNet: Mesh Neural Network for 3D Shape Representation

    Yutong Feng, Yifan Feng, Haoxuan You +2

    cs.CVarXiv:1811.11424v12018
  20. AdvHat: Real-world adversarial attack on ArcFace Face ID system

    Stepan Komkov, Aleksandr Petiushko

    cs.CVarXiv:1908.08705v12019
  21. Action2Activity: Recognizing Complex Activities from Sensor Data

    Ye Liu, Liqiang Nie, Lei Han +2

    cs.CVarXiv:1611.01872v12016
  22. Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation

    Ziyang Wang, Jian-Qing Zheng, Yichi Zhang +2

    eess.IVcs.CVarXiv:2402.05079v22024
  23. Exploiting temporal information for 3D pose estimation

    Mir Rayat Imtiaz Hossain, James J. Little

    cs.CVarXiv:1711.08585v42017
  24. Learning Graph Convolutional Network for Skeleton-based Human Action Recognition by Neural Searching

    Wei Peng, Xiaopeng Hong, Haoyu Chen +1

    cs.CVarXiv:1911.04131v12019
  25. Visual Entailment: A Novel Task for Fine-Grained Image Understanding

    Ning Xie, Farley Lai, Derek Doran +1

    cs.CVarXiv:1901.06706v12019
  26. DeepFaceLab: Integrated, flexible and extensible face-swapping framework

    Ivan Perov, Daiheng Gao, Nikolay Chervoniy +11

    cs.CVcs.LGcs.MMarXiv:2005.05535v52020
  27. Deformable Siamese Attention Networks for Visual Object Tracking

    Yuechen Yu, Yilei Xiong, Weilin Huang +1

    cs.CVarXiv:2004.06711v22020
  28. Distribution Alignment: A Unified Framework for Long-tail Visual Recognition

    Songyang Zhang, Zeming Li, Shipeng Yan +2

    cs.CVcs.AIcs.LGarXiv:2103.16370v12021
  29. BSP-Net: Generating Compact Meshes via Binary Space Partitioning

    Zhiqin Chen, Andrea Tagliasacchi, Hao Zhang

    cs.CVcs.GRcs.LGarXiv:1911.06971v62019
  30. Multilevel Language and Vision Integration for Text-to-Clip Retrieval

    Huijuan Xu, Kun He, Bryan A. Plummer +3

    cs.CVarXiv:1804.05113v32018
  31. Pyramidal Flow Matching for Efficient Video Generative Modeling

    Yang Jin, Zhicheng Sun, Ningyuan Li +8

    cs.CVcs.LGarXiv:2410.05954v22024
  32. GANFIT: Generative Adversarial Network Fitting for High Fidelity 3D Face Reconstruction

    Baris Gecer, Stylianos Ploumpis, Irene Kotsia +1

    cs.CVarXiv:1902.05978v22019
  33. Learning Deep Embeddings with Histogram Loss

    Evgeniya Ustinova, Victor Lempitsky

    cs.CVarXiv:1611.00822v12016
  34. Deep Snake for Real-Time Instance Segmentation

    Sida Peng, Wen Jiang, Huaijin Pi +3

    cs.CVarXiv:2001.01629v32020
  35. Semantic Photo Manipulation with a Generative Image Prior

    David Bau, Hendrik Strobelt, William Peebles +4

    cs.CVcs.GRcs.LGarXiv:2005.07727v22020
  36. Domain Adaptive Ensemble Learning

    Kaiyang Zhou, Yongxin Yang, Yu Qiao +1

    cs.CVarXiv:2003.07325v32020
  37. Recasting Residual-based Local Descriptors as Convolutional Neural Networks: an Application to Image Forgery Detection

    Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva

    cs.CVarXiv:1703.04615v12017
  38. Semantic Object Parsing with Graph LSTM

    Xiaodan Liang, Xiaohui Shen, Jiashi Feng +2

    cs.CVarXiv:1603.07063v12016
  39. A Survey on Generative Adversarial Networks: Variants, Applications, and Training

    Abdul Jabbar, Xi Li, Bourahla Omar

    cs.CVcs.LGeess.IVarXiv:2006.05132v12020
  40. MAGSAC++, a fast, reliable and accurate robust estimator

    Daniel Barath, Jana Noskova, Maksym Ivashechkin +1

    cs.CVarXiv:1912.05909v12019
  41. Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles

    Dahun Kim, Donghyeon Cho, In So Kweon

    cs.CVarXiv:1811.09795v12018
  42. Ablating Concepts in Text-to-Image Diffusion Models

    Nupur Kumari, Bingliang Zhang, Sheng-Yu Wang +3

    cs.CVcs.GRcs.LGarXiv:2303.13516v32023
  43. SQA3D: Situated Question Answering in 3D Scenes

    Xiaojian Ma, Silong Yong, Zilong Zheng +4

    cs.CVcs.AIcs.CLarXiv:2210.07474v52022
  44. 3D-CODED : 3D Correspondences by Deep Deformation

    Thibault Groueix, Matthew Fisher, Vladimir G. Kim +2

    cs.CVarXiv:1806.05228v22018
  45. Hi-Net: Hybrid-fusion Network for Multi-modal MR Image Synthesis

    Tao Zhou, Huazhu Fu, Geng Chen +2

    cs.CVeess.IVarXiv:2002.05000v12020
  46. Semantic Segmentation of Underwater Imagery: Dataset and Benchmark

    Md Jahidul Islam, Chelsey Edge, Yuyang Xiao +5

    cs.CVeess.IVarXiv:2004.01241v32020
  47. Scale Match for Tiny Person Detection

    Xuehui Yu, Yuqi Gong, Nan Jiang +2

    cs.CVarXiv:1912.10664v12019
  48. "Double-DIP": Unsupervised Image Decomposition via Coupled Deep-Image-Priors

    Yossi Gandelsman, Assaf Shocher, Michal Irani

    cs.CVcs.LGarXiv:1812.00467v22018
  49. Large Deformation Diffeomorphic Image Registration with Laplacian Pyramid Networks

    Tony C. W. Mok, Albert C. S. Chung

    eess.IVcs.CVarXiv:2006.16148v22020
  50. FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture Search

    Xiangxiang Chu, Bo Zhang, Ruijun Xu

    cs.LGcs.AIcs.CVarXiv:1907.01845v52019
  51. History Repeats Itself: Human Motion Prediction via Motion Attention

    Wei Mao, Miaomiao Liu, Mathieu Salzmann

    cs.CVcs.LGeess.IVarXiv:2007.11755v12020
  52. HiFuse: Hierarchical Multi-Scale Feature Fusion Network for Medical Image Classification

    Xiangzuo Huo, Gang Sun, Shengwei Tian +5

    eess.IVcs.CVarXiv:2209.10218v12022
  53. 3D Deeply Supervised Network for Automatic Liver Segmentation from CT Volumes

    Qi Dou, Hao Chen, Yueming Jin +3

    cs.CVarXiv:1607.00582v12016
  54. Hyper-YOLO: When Visual Object Detection Meets Hypergraph Computation

    Yifan Feng, Jiangang Huang, Shaoyi Du +6

    cs.CVarXiv:2408.04804v22024
  55. Fully Convolutional Adaptation Networks for Semantic Segmentation

    Yiheng Zhang, Zhaofan Qiu, Ting Yao +2

    cs.CVarXiv:1804.08286v12018
  56. Mixture of Volumetric Primitives for Efficient Neural Rendering

    Stephen Lombardi, Tomas Simon, Gabriel Schwartz +3

    cs.GRcs.CVarXiv:2103.01954v22021
  57. NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion

    Chenfei Wu, Jian Liang, Lei Ji +4

    cs.CVcs.AIarXiv:2111.12417v12021
  58. AI Benchmark: Running Deep Neural Networks on Android Smartphones

    Andrey Ignatov, Radu Timofte, William Chou +4

    cs.AIcs.CVarXiv:1810.01109v22018
  59. Revisiting ResNets: Improved Training and Scaling Strategies

    Irwan Bello, William Fedus, Xianzhi Du +5

    cs.CVarXiv:2103.07579v12021
  60. RPVNet: A Deep and Efficient Range-Point-Voxel Fusion Network for LiDAR Point Cloud Segmentation

    Jianyun Xu, Ruixiang Zhang, Jian Dou +3

    cs.CVarXiv:2103.12978v12021