Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
11,881 to 11,940 of 18,817
CLIP2Video: Mastering Video-Text Retrieval via Image CLIP
Han Fang, Pengfei Xiong, Luhui Xu +1
cs.CVarXiv:2106.11097v12021CLIP-Driven Universal Model for Organ Segmentation and Tumor Detection
Jie Liu, Yixiao Zhang, Jie-Neng Chen +7
eess.IVcs.CVcs.LGarXiv:2301.00785v52023Deep Learning for Visual Tracking: A Comprehensive Survey
Seyed Mojtaba Marvasti-Zadeh, Li Cheng, Hossein Ghanei-Yakhdan +1
cs.CVcs.LGeess.IVarXiv:1912.00535v22019One Step Diffusion via Shortcut Models
Kevin Frans, Danijar Hafner, Sergey Levine +1
cs.LGcs.CVarXiv:2410.12557v32024Learning to Compose Domain-Specific Transformations for Data Augmentation
Alexander J. Ratner, Henry R. Ehrenberg, Zeshan Hussain +2
stat.MLcs.CVcs.LGarXiv:1709.01643v32017MaskLab: Instance Segmentation by Refining Object Detection with Semantic and Direction Features
Liang-Chieh Chen, Alexander Hermans, George Papandreou +3
cs.CVarXiv:1712.04837v12017HeMIS: Hetero-Modal Image Segmentation
Mohammad Havaei, Nicolas Guizard, Nicolas Chapados +1
cs.CVarXiv:1607.05194v12016MVSS-Net: Multi-View Multi-Scale Supervised Networks for Image Manipulation Detection
Chengbo Dong, Xinru Chen, Ruohan Hu +2
cs.CVcs.AIarXiv:2112.08935v32021Segment Anything Model for Medical Image Segmentation: Current Applications and Future Directions
Yichi Zhang, Zhenrong Shen, Rushi Jiao
eess.IVcs.CVarXiv:2401.03495v12024Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action
Jiasen Lu, Christopher Clark, Sangho Lee +5
cs.CVcs.AIcs.CLarXiv:2312.17172v12023GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
Shilong Zhang, Peize Sun, Shoufa Chen +6
cs.CVarXiv:2307.03601v52023MedSegDiff-V2: Diffusion based Medical Image Segmentation with Transformer
Junde Wu, Wei Ji, Huazhu Fu +3
eess.IVcs.CVarXiv:2301.11798v22023Face Expression Recognition and Analysis: The State of the Art
Vinay Bettadapura
cs.CVarXiv:1203.6722v12012Learning Adaptive Discriminative Correlation Filters via Temporal Consistency Preserving Spatial Feature Selection for Robust Visual Tracking
Tianyang Xu, Zhen-Hua Feng, Xiao-Jun Wu +1
cs.CVarXiv:1807.11348v32018Deep Affinity Network for Multiple Object Tracking
ShiJie Sun, Naveed Akhtar, HuanSheng Song +2
cs.CVarXiv:1810.11780v22018PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
Lin Xu, Yilin Zhao, Daquan Zhou +3
cs.CVarXiv:2404.16994v22024Visual Spatial Reasoning
Fangyu Liu, Guy Emerson, Nigel Collier
cs.CLcs.AIcs.CVarXiv:2205.00363v32022Thoracic Disease Identification and Localization with Limited Supervision
Zhe Li, Chong Wang, Mei Han +4
cs.CVstat.MLarXiv:1711.06373v62017MeshNet: Mesh Neural Network for 3D Shape Representation
Yutong Feng, Yifan Feng, Haoxuan You +2
cs.CVarXiv:1811.11424v12018AdvHat: Real-world adversarial attack on ArcFace Face ID system
Stepan Komkov, Aleksandr Petiushko
cs.CVarXiv:1908.08705v12019Action2Activity: Recognizing Complex Activities from Sensor Data
Ye Liu, Liqiang Nie, Lei Han +2
cs.CVarXiv:1611.01872v12016Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation
Ziyang Wang, Jian-Qing Zheng, Yichi Zhang +2
eess.IVcs.CVarXiv:2402.05079v22024Exploiting temporal information for 3D pose estimation
Mir Rayat Imtiaz Hossain, James J. Little
cs.CVarXiv:1711.08585v42017Learning Graph Convolutional Network for Skeleton-based Human Action Recognition by Neural Searching
Wei Peng, Xiaopeng Hong, Haoyu Chen +1
cs.CVarXiv:1911.04131v12019Visual Entailment: A Novel Task for Fine-Grained Image Understanding
Ning Xie, Farley Lai, Derek Doran +1
cs.CVarXiv:1901.06706v12019DeepFaceLab: Integrated, flexible and extensible face-swapping framework
Ivan Perov, Daiheng Gao, Nikolay Chervoniy +11
cs.CVcs.LGcs.MMarXiv:2005.05535v52020Deformable Siamese Attention Networks for Visual Object Tracking
Yuechen Yu, Yilei Xiong, Weilin Huang +1
cs.CVarXiv:2004.06711v22020Distribution Alignment: A Unified Framework for Long-tail Visual Recognition
Songyang Zhang, Zeming Li, Shipeng Yan +2
cs.CVcs.AIcs.LGarXiv:2103.16370v12021BSP-Net: Generating Compact Meshes via Binary Space Partitioning
Zhiqin Chen, Andrea Tagliasacchi, Hao Zhang
cs.CVcs.GRcs.LGarXiv:1911.06971v62019Multilevel Language and Vision Integration for Text-to-Clip Retrieval
Huijuan Xu, Kun He, Bryan A. Plummer +3
cs.CVarXiv:1804.05113v32018Pyramidal Flow Matching for Efficient Video Generative Modeling
Yang Jin, Zhicheng Sun, Ningyuan Li +8
cs.CVcs.LGarXiv:2410.05954v22024GANFIT: Generative Adversarial Network Fitting for High Fidelity 3D Face Reconstruction
Baris Gecer, Stylianos Ploumpis, Irene Kotsia +1
cs.CVarXiv:1902.05978v22019Learning Deep Embeddings with Histogram Loss
Evgeniya Ustinova, Victor Lempitsky
cs.CVarXiv:1611.00822v12016Deep Snake for Real-Time Instance Segmentation
Sida Peng, Wen Jiang, Huaijin Pi +3
cs.CVarXiv:2001.01629v32020Semantic Photo Manipulation with a Generative Image Prior
David Bau, Hendrik Strobelt, William Peebles +4
cs.CVcs.GRcs.LGarXiv:2005.07727v22020Domain Adaptive Ensemble Learning
Kaiyang Zhou, Yongxin Yang, Yu Qiao +1
cs.CVarXiv:2003.07325v32020Recasting Residual-based Local Descriptors as Convolutional Neural Networks: an Application to Image Forgery Detection
Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva
cs.CVarXiv:1703.04615v12017Semantic Object Parsing with Graph LSTM
Xiaodan Liang, Xiaohui Shen, Jiashi Feng +2
cs.CVarXiv:1603.07063v12016A Survey on Generative Adversarial Networks: Variants, Applications, and Training
Abdul Jabbar, Xi Li, Bourahla Omar
cs.CVcs.LGeess.IVarXiv:2006.05132v12020MAGSAC++, a fast, reliable and accurate robust estimator
Daniel Barath, Jana Noskova, Maksym Ivashechkin +1
cs.CVarXiv:1912.05909v12019Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles
Dahun Kim, Donghyeon Cho, In So Kweon
cs.CVarXiv:1811.09795v12018Ablating Concepts in Text-to-Image Diffusion Models
Nupur Kumari, Bingliang Zhang, Sheng-Yu Wang +3
cs.CVcs.GRcs.LGarXiv:2303.13516v32023SQA3D: Situated Question Answering in 3D Scenes
Xiaojian Ma, Silong Yong, Zilong Zheng +4
cs.CVcs.AIcs.CLarXiv:2210.07474v520223D-CODED : 3D Correspondences by Deep Deformation
Thibault Groueix, Matthew Fisher, Vladimir G. Kim +2
cs.CVarXiv:1806.05228v22018Hi-Net: Hybrid-fusion Network for Multi-modal MR Image Synthesis
Tao Zhou, Huazhu Fu, Geng Chen +2
cs.CVeess.IVarXiv:2002.05000v12020Semantic Segmentation of Underwater Imagery: Dataset and Benchmark
Md Jahidul Islam, Chelsey Edge, Yuyang Xiao +5
cs.CVeess.IVarXiv:2004.01241v32020Scale Match for Tiny Person Detection
Xuehui Yu, Yuqi Gong, Nan Jiang +2
cs.CVarXiv:1912.10664v12019"Double-DIP": Unsupervised Image Decomposition via Coupled Deep-Image-Priors
Yossi Gandelsman, Assaf Shocher, Michal Irani
cs.CVcs.LGarXiv:1812.00467v22018Large Deformation Diffeomorphic Image Registration with Laplacian Pyramid Networks
Tony C. W. Mok, Albert C. S. Chung
eess.IVcs.CVarXiv:2006.16148v22020FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture Search
Xiangxiang Chu, Bo Zhang, Ruijun Xu
cs.LGcs.AIcs.CVarXiv:1907.01845v52019History Repeats Itself: Human Motion Prediction via Motion Attention
Wei Mao, Miaomiao Liu, Mathieu Salzmann
cs.CVcs.LGeess.IVarXiv:2007.11755v12020HiFuse: Hierarchical Multi-Scale Feature Fusion Network for Medical Image Classification
Xiangzuo Huo, Gang Sun, Shengwei Tian +5
eess.IVcs.CVarXiv:2209.10218v120223D Deeply Supervised Network for Automatic Liver Segmentation from CT Volumes
Qi Dou, Hao Chen, Yueming Jin +3
cs.CVarXiv:1607.00582v12016Hyper-YOLO: When Visual Object Detection Meets Hypergraph Computation
Yifan Feng, Jiangang Huang, Shaoyi Du +6
cs.CVarXiv:2408.04804v22024Fully Convolutional Adaptation Networks for Semantic Segmentation
Yiheng Zhang, Zhaofan Qiu, Ting Yao +2
cs.CVarXiv:1804.08286v12018Mixture of Volumetric Primitives for Efficient Neural Rendering
Stephen Lombardi, Tomas Simon, Gabriel Schwartz +3
cs.GRcs.CVarXiv:2103.01954v22021NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion
Chenfei Wu, Jian Liang, Lei Ji +4
cs.CVcs.AIarXiv:2111.12417v12021AI Benchmark: Running Deep Neural Networks on Android Smartphones
Andrey Ignatov, Radu Timofte, William Chou +4
cs.AIcs.CVarXiv:1810.01109v22018Revisiting ResNets: Improved Training and Scaling Strategies
Irwan Bello, William Fedus, Xianzhi Du +5
cs.CVarXiv:2103.07579v12021RPVNet: A Deep and Efficient Range-Point-Voxel Fusion Network for LiDAR Point Cloud Segmentation
Jianyun Xu, Ruixiang Zhang, Jian Dou +3
cs.CVarXiv:2103.12978v12021