Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
9,781 to 9,840 of 18,781
Multi-Representation Adaptation Network for Cross-domain Image Classification
Yongchun Zhu, Fuzhen Zhuang, Jindong Wang +4
cs.CVcs.AIcs.LGarXiv:2201.01002v12022Automatic Classification of Cancerous Tissue in Laserendomicroscopy Images of the Oral Cavity using Deep Learning
Marc Aubreville, Christian Knipfer, Nicolai Oetter +7
cs.CVarXiv:1703.01622v22017Adversarial vulnerability for any classifier
Alhussein Fawzi, Hamza Fawzi, Omar Fawzi
cs.LGcs.CRcs.CVarXiv:1802.08686v22018Visual Object Networks: Image Generation with Disentangled 3D Representation
Jun-Yan Zhu, Zhoutong Zhang, Chengkai Zhang +4
cs.CVcs.GRstat.MLarXiv:1812.02725v12018GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D Gaussians
Liangxiao Hu, Hongwen Zhang, Yuxiang Zhang +4
cs.CVarXiv:2312.02134v32023Spatio-temporal Self-Supervised Representation Learning for 3D Point Clouds
Siyuan Huang, Yichen Xie, Song-Chun Zhu +1
cs.CVarXiv:2109.00179v12021Language as Queries for Referring Video Object Segmentation
Jiannan Wu, Yi Jiang, Peize Sun +2
cs.CVarXiv:2201.00487v22022A Survey of Semantic Segmentation
Martin Thoma
cs.CVarXiv:1602.06541v22016TubeTK: Adopting Tubes to Track Multi-Object in a One-Step Training Model
Bo Pang, Yizhuo Li, Yifan Zhang +2
cs.CVarXiv:2006.05683v12020RangeDet:In Defense of Range View for LiDAR-based 3D Object Detection
Lue Fan, Xuan Xiong, Feng Wang +2
cs.CVcs.ROarXiv:2103.10039v12021DCAN: Dual Channel-wise Alignment Networks for Unsupervised Scene Adaptation
Zuxuan Wu, Xintong Han, Yen-Liang Lin +4
cs.CVarXiv:1804.05827v12018Deep Gradient Learning for Efficient Camouflaged Object Detection
Ge-Peng Ji, Deng-Ping Fan, Yu-Cheng Chou +3
cs.CVarXiv:2205.12853v22022Demystify Mamba in Vision: A Linear Attention Perspective
Dongchen Han, Ziyi Wang, Zhuofan Xia +7
cs.CVarXiv:2405.16605v22024Rethinking Bottleneck Structure for Efficient Mobile Network Design
Zhou Daquan, Qibin Hou, Yunpeng Chen +2
cs.CVarXiv:2007.02269v42020Global Structure-from-Motion Revisited
Linfei Pan, Dániel Baráth, Marc Pollefeys +1
cs.CVarXiv:2407.20219v22024DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA
Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa +1
cs.ROcs.CVarXiv:2608.28108v12026TextDiffuser: Diffusion Models as Text Painters
Jingye Chen, Yupan Huang, Tengchao Lv +3
cs.CVarXiv:2305.10855v52023ABCD: Alpha-Composited Block Coordinate Descent: Constant-VRAM Training for Large Radiance Fields
Ka Heng Shiu, Kartic Subr
cs.CVcs.GRarXiv:2608.27735v12026Revisiting Class-Incremental Learning with Pre-Trained Models: Generalizability and Adaptivity are All You Need
Da-Wei Zhou, Zi-Wen Cai, Han-Jia Ye +2
cs.LGcs.CVarXiv:2303.07338v22023Computational Pathology: Challenges and Promises for Tissue Analysis
Thomas J. Fuchs, Joachim M. Buhmann
cs.CVcs.AIarXiv:1601.00027v12015Combining EfficientNet and Vision Transformers for Video Deepfake Detection
Davide Coccomini, Nicola Messina, Claudio Gennaro +1
cs.CVarXiv:2107.02612v22021Satellite Pose Estimation Challenge: Dataset, Competition Design and Results
Mate Kisantal, Sumant Sharma, Tae Ha Park +3
cs.CVarXiv:1911.02050v22019Evaluating Bayesian Deep Learning Methods for Semantic Segmentation
Jishnu Mukhoti, Yarin Gal
cs.CVarXiv:1811.12709v22018Total3DUnderstanding: Joint Layout, Object Pose and Mesh Reconstruction for Indoor Scenes from a Single Image
Yinyu Nie, Xiaoguang Han, Shihui Guo +3
cs.CVarXiv:2002.12212v12020Report Supervision
Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal +10
cs.CVarXiv:2608.27668v12026Oracle Based Active Set Algorithm for Scalable Elastic Net Subspace Clustering
Chong You, Chun-Guang Li, Daniel P. Robinson +1
cs.LGcs.CVstat.MLarXiv:1605.02633v12016Unsupervised Learning of Object Landmarks through Conditional Image Generation
Tomas Jakab, Ankush Gupta, Hakan Bilen +1
cs.CVarXiv:1806.07823v22018Video Summarization Using Fully Convolutional Sequence Networks
Mrigank Rochan, Linwei Ye, Yang Wang
cs.CVarXiv:1805.10538v22018AdaMerging: Adaptive Model Merging for Multi-Task Learning
Enneng Yang, Zhenyi Wang, Li Shen +4
cs.LGcs.CVarXiv:2310.02575v22023SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality
Cheng-Yu Hsieh, Jieyu Zhang, Zixian Ma +2
cs.CVcs.CLcs.LGarXiv:2306.14610v12023MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction
Bencheng Liao, Shaoyu Chen, Yunchi Zhang +5
cs.CVcs.ROarXiv:2308.05736v22023Working Memory Connections for LSTM
Federico Landi, Lorenzo Baraldi, Marcella Cornia +1
cs.LGcs.CLcs.CVarXiv:2109.00020v12021Change Detection Methods for Remote Sensing in the Last Decade: A Comprehensive Review
Guangliang Cheng, Yunmeng Huang, Xiangtai Li +4
cs.CVcs.LGeess.IVarXiv:2305.05813v12023Multi-Task Learning for Segmentation of Building Footprints with Deep Neural Networks
Benjamin Bischke, Patrick Helber, Joachim Folz +2
cs.CVarXiv:1709.05932v12017DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory
Shengming Yin, Chenfei Wu, Jian Liang +4
cs.CVarXiv:2308.08089v12023End-to-end 3D face reconstruction with deep neural networks
Pengfei Dou, Shishir K. Shah, Ioannis A. Kakadiaris
cs.CVarXiv:1704.05020v12017Trustworthy AI
Richa Singh, Mayank Vatsa, Nalini Ratha
cs.CYcs.CRcs.CVarXiv:2011.02272v12020How good are detection proposals, really?
Jan Hosang, Rodrigo Benenson, Bernt Schiele
cs.CVarXiv:1406.6962v22014Valley: Video Assistant with Large Language model Enhanced abilitY
Ruipu Luo, Ziwang Zhao, Min Yang +6
cs.CVcs.AIcs.CLarXiv:2306.07207v32023Semantic Labeling in Very High Resolution Images via a Self-Cascaded Convolutional Neural Network
Yongcheng Liu, Bin Fan, Lingfeng Wang +3
cs.CVcs.AIcs.LGarXiv:1807.11236v12018WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion
Soyong Shin, Juyong Kim, Eni Halilaj +1
cs.CVarXiv:2312.07531v22023Support-set bottlenecks for video-text representation learning
Mandela Patrick, Po-Yao Huang, Yuki Asano +4
cs.CVarXiv:2010.02824v22020Multi-Temporal Recurrent Neural Networks For Progressive Non-Uniform Single Image Deblurring With Incremental Temporal Training
Dongwon Park, Dong Un Kang, Jisoo Kim +1
eess.IVcs.CVarXiv:1911.07410v12019TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
Linli Yao, Yuancheng Wei, Yaojie Zhang +12
cs.CVarXiv:2602.08711v32026A Variational Perspective on Solving Inverse Problems with Diffusion Models
Morteza Mardani, Jiaming Song, Jan Kautz +1
cs.LGcs.CVmath.NAarXiv:2305.04391v22023Pathwise Test-Time Correction for Autoregressive Long Video Generation
Xunzhi Xiang, Zixuan Duan, Guiyu Zhang +7
cs.CVarXiv:2602.05871v22026PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards
Minh-Quan Le, Gaurav Mittal, Cheng Zhao +3
cs.CVarXiv:2602.01624v22026Towards Open Vocabulary Learning: A Survey
Jianzong Wu, Xiangtai Li, Shilin Xu +9
cs.CVcs.AIarXiv:2306.15880v42023PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers
Haopeng Li, Shitong Shao, Wenliang Zhong +4
cs.CVarXiv:2602.01077v22026PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction
Danpeng Chen, Hai Li, Weicai Ye +7
cs.CVarXiv:2406.06521v22024Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu +5
cs.CVarXiv:2309.15818v32023Imagic: Text-Based Real Image Editing with Diffusion Models
Bahjat Kawar, Shiran Zada, Oran Lang +5
cs.CVarXiv:2210.09276v32022More Diverse Means Better: Multimodal Deep Learning Meets Remote Sensing Imagery Classification
Danfeng Hong, Lianru Gao, Naoto Yokoya +4
cs.CVeess.IVarXiv:2008.05457v12020Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition
Qibin Hou, Cheng-Ze Lu, Ming-Ming Cheng +1
cs.CVarXiv:2211.11943v12022On Unifying Multi-View Self-Representations for Clustering by Tensor Multi-Rank Minimization
Yuan Xie, Dacheng Tao, Wensheng Zhang +3
cs.CVarXiv:1610.07126v32016Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
Ranjay Krishna, Yuke Zhu, Oliver Groth +9
cs.CVcs.AIarXiv:1602.07332v12016PTQ4ViT: Post-training quantization for vision transformers with twin uniform quantization
Zhihang Yuan, Chenhao Xue, Yiqi Chen +2
cs.CVarXiv:2111.12293v32021Dropout Sampling for Robust Object Detection in Open-Set Conditions
Dimity Miller, Lachlan Nicholson, Feras Dayoub +1
cs.CVarXiv:1710.06677v22017Improved Few-Shot Visual Classification
Peyman Bateni, Raghav Goyal, Vaden Masrani +2
cs.CVarXiv:1912.03432v32019Prioritized Training on Points that are Learnable, Worth Learning, and Not Yet Learnt
Sören Mindermann, Jan Brauner, Muhammed Razzak +8
cs.LGcs.AIcs.CLarXiv:2206.07137v32022