Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
9,841 to 9,900 of 18,817
Report Supervision
Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal +10
cs.CVarXiv:2608.27668v12026Oracle Based Active Set Algorithm for Scalable Elastic Net Subspace Clustering
Chong You, Chun-Guang Li, Daniel P. Robinson +1
cs.LGcs.CVstat.MLarXiv:1605.02633v12016Unsupervised Learning of Object Landmarks through Conditional Image Generation
Tomas Jakab, Ankush Gupta, Hakan Bilen +1
cs.CVarXiv:1806.07823v22018Video Summarization Using Fully Convolutional Sequence Networks
Mrigank Rochan, Linwei Ye, Yang Wang
cs.CVarXiv:1805.10538v22018AdaMerging: Adaptive Model Merging for Multi-Task Learning
Enneng Yang, Zhenyi Wang, Li Shen +4
cs.LGcs.CVarXiv:2310.02575v22023SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality
Cheng-Yu Hsieh, Jieyu Zhang, Zixian Ma +2
cs.CVcs.CLcs.LGarXiv:2306.14610v12023MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction
Bencheng Liao, Shaoyu Chen, Yunchi Zhang +5
cs.CVcs.ROarXiv:2308.05736v22023Working Memory Connections for LSTM
Federico Landi, Lorenzo Baraldi, Marcella Cornia +1
cs.LGcs.CLcs.CVarXiv:2109.00020v12021Change Detection Methods for Remote Sensing in the Last Decade: A Comprehensive Review
Guangliang Cheng, Yunmeng Huang, Xiangtai Li +4
cs.CVcs.LGeess.IVarXiv:2305.05813v12023Multi-Task Learning for Segmentation of Building Footprints with Deep Neural Networks
Benjamin Bischke, Patrick Helber, Joachim Folz +2
cs.CVarXiv:1709.05932v12017DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory
Shengming Yin, Chenfei Wu, Jian Liang +4
cs.CVarXiv:2308.08089v12023End-to-end 3D face reconstruction with deep neural networks
Pengfei Dou, Shishir K. Shah, Ioannis A. Kakadiaris
cs.CVarXiv:1704.05020v12017Trustworthy AI
Richa Singh, Mayank Vatsa, Nalini Ratha
cs.CYcs.CRcs.CVarXiv:2011.02272v12020How good are detection proposals, really?
Jan Hosang, Rodrigo Benenson, Bernt Schiele
cs.CVarXiv:1406.6962v22014Valley: Video Assistant with Large Language model Enhanced abilitY
Ruipu Luo, Ziwang Zhao, Min Yang +6
cs.CVcs.AIcs.CLarXiv:2306.07207v32023Semantic Labeling in Very High Resolution Images via a Self-Cascaded Convolutional Neural Network
Yongcheng Liu, Bin Fan, Lingfeng Wang +3
cs.CVcs.AIcs.LGarXiv:1807.11236v12018WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion
Soyong Shin, Juyong Kim, Eni Halilaj +1
cs.CVarXiv:2312.07531v22023Support-set bottlenecks for video-text representation learning
Mandela Patrick, Po-Yao Huang, Yuki Asano +4
cs.CVarXiv:2010.02824v22020Multi-Temporal Recurrent Neural Networks For Progressive Non-Uniform Single Image Deblurring With Incremental Temporal Training
Dongwon Park, Dong Un Kang, Jisoo Kim +1
eess.IVcs.CVarXiv:1911.07410v12019TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
Linli Yao, Yuancheng Wei, Yaojie Zhang +12
cs.CVarXiv:2602.08711v32026A Variational Perspective on Solving Inverse Problems with Diffusion Models
Morteza Mardani, Jiaming Song, Jan Kautz +1
cs.LGcs.CVmath.NAarXiv:2305.04391v22023Pathwise Test-Time Correction for Autoregressive Long Video Generation
Xunzhi Xiang, Zixuan Duan, Guiyu Zhang +7
cs.CVarXiv:2602.05871v22026PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards
Minh-Quan Le, Gaurav Mittal, Cheng Zhao +3
cs.CVarXiv:2602.01624v22026Towards Open Vocabulary Learning: A Survey
Jianzong Wu, Xiangtai Li, Shilin Xu +9
cs.CVcs.AIarXiv:2306.15880v42023PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers
Haopeng Li, Shitong Shao, Wenliang Zhong +4
cs.CVarXiv:2602.01077v22026PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction
Danpeng Chen, Hai Li, Weicai Ye +7
cs.CVarXiv:2406.06521v22024Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu +5
cs.CVarXiv:2309.15818v32023Imagic: Text-Based Real Image Editing with Diffusion Models
Bahjat Kawar, Shiran Zada, Oran Lang +5
cs.CVarXiv:2210.09276v32022More Diverse Means Better: Multimodal Deep Learning Meets Remote Sensing Imagery Classification
Danfeng Hong, Lianru Gao, Naoto Yokoya +4
cs.CVeess.IVarXiv:2008.05457v12020Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition
Qibin Hou, Cheng-Ze Lu, Ming-Ming Cheng +1
cs.CVarXiv:2211.11943v12022On Unifying Multi-View Self-Representations for Clustering by Tensor Multi-Rank Minimization
Yuan Xie, Dacheng Tao, Wensheng Zhang +3
cs.CVarXiv:1610.07126v32016Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
Ranjay Krishna, Yuke Zhu, Oliver Groth +9
cs.CVcs.AIarXiv:1602.07332v12016PTQ4ViT: Post-training quantization for vision transformers with twin uniform quantization
Zhihang Yuan, Chenhao Xue, Yiqi Chen +2
cs.CVarXiv:2111.12293v32021Dropout Sampling for Robust Object Detection in Open-Set Conditions
Dimity Miller, Lachlan Nicholson, Feras Dayoub +1
cs.CVarXiv:1710.06677v22017Improved Few-Shot Visual Classification
Peyman Bateni, Raghav Goyal, Vaden Masrani +2
cs.CVarXiv:1912.03432v32019Prioritized Training on Points that are Learnable, Worth Learning, and Not Yet Learnt
Sören Mindermann, Jan Brauner, Muhammed Razzak +8
cs.LGcs.AIcs.CLarXiv:2206.07137v32022Registration based Few-Shot Anomaly Detection
Chaoqin Huang, Haoyan Guan, Aofan Jiang +3
cs.CVarXiv:2207.07361v12022Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards
Alexandre Ramé, Guillaume Couairon, Mustafa Shukor +4
cs.LGcs.AIcs.CVarXiv:2306.04488v22023Asymmetric Student-Teacher Networks for Industrial Anomaly Detection
Marco Rudolph, Tom Wehrbein, Bodo Rosenhahn +1
cs.LGcs.AIcs.CVarXiv:2210.07829v22022Texture Image Classification Using DWT AlexNet Feature Fusion and Deep Neural Networks
Arun D. Kulkarni
cs.CVcs.AIarXiv:2608.28524v12026Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification
Sanath Narayan, Akshita Gupta, Fahad Shahbaz Khan +2
cs.CVarXiv:2003.07833v22020Learning Combinatorial Embedding Networks for Deep Graph Matching
Runzhong Wang, Junchi Yan, Xiaokang Yang
cs.CVarXiv:1904.00597v32019Learning to Answer Questions in Dynamic Audio-Visual Scenarios
Guangyao Li, Yake Wei, Yapeng Tian +3
cs.CVarXiv:2203.14072v22022ICE: Inter-instance Contrastive Encoding for Unsupervised Person Re-identification
Hao Chen, Benoit Lagadec, Francois Bremond
cs.CVarXiv:2103.16364v22021DeepTrack: Learning Discriminative Feature Representations Online for Robust Visual Tracking
Hanxi Li, Yi Li, Fatih Porikli
cs.CVarXiv:1503.00072v12015FusionNet: A deep fully residual convolutional neural network for image segmentation in connectomics
Tran Minh Quan, David G. C. Hildebrand, Won-Ki Jeong
cs.CVarXiv:1612.05360v22016Anatomy-Aware Promptable Segmentation with Online Interactive Training for AUTOPET V
Pablo Lozano-Jimenez, Sergio Romero-Tapiador, Ruben Tolosana
cs.CVcs.AIarXiv:2608.28461v12026Learning Likelihoods with Conditional Normalizing Flows
Christina Winkler, Daniel Worrall, Emiel Hoogeboom +1
cs.LGcs.CVstat.MLarXiv:1912.00042v22019SpaText: Spatio-Textual Representation for Controllable Image Generation
Omri Avrahami, Thomas Hayes, Oran Gafni +6
cs.CVcs.GRcs.LGarXiv:2211.14305v22022Cross-Scale Internal Graph Neural Network for Image Super-Resolution
Shangchen Zhou, Jiawei Zhang, Wangmeng Zuo +1
cs.CVarXiv:2006.16673v22020Learning the Depths of Moving People by Watching Frozen People
Zhengqi Li, Tali Dekel, Forrester Cole +4
cs.CVarXiv:1904.11111v12019Mixed Neural Network Approach for Temporal Sleep Stage Classification
Hao Dong, Akara Supratak, Wei Pan +3
q-bio.NCcs.CVcs.LGarXiv:1610.06421v32016EGSDE: Unpaired Image-to-Image Translation via Energy-Guided Stochastic Differential Equations
Min Zhao, Fan Bao, Chongxuan Li +1
cs.CVarXiv:2207.06635v52022Video Face Manipulation Detection Through Ensemble of CNNs
Nicolò Bonettini, Edoardo Daniele Cannas, Sara Mandelli +3
cs.CVcs.MMeess.IVarXiv:2004.07676v12020Real-Time Musculoskeletal Surrogates for Pediatric Cerebral Palsy: a Credibility Pilot
Mohammad Arif Ul Alam
cs.CVcs.AIarXiv:2608.28371v12026GeoNeRF: Generalizing NeRF with Geometry Priors
Mohammad Mahdi Johari, Yann Lepoittevin, François Fleuret
cs.CVarXiv:2111.13539v22021Joint Distribution Matters: Deep Brownian Distance Covariance for Few-Shot Classification
Jiangtao Xie, Fei Long, Jiaming Lv +2
cs.CVcs.LGstat.MLarXiv:2204.04567v12022Spatio-Temporal Graph for Video Captioning with Knowledge Distillation
Boxiao Pan, Haoye Cai, De-An Huang +4
cs.CVarXiv:2003.13942v12020RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
Wentao Yuan, Jiafei Duan, Valts Blukis +5
cs.ROcs.AIcs.CVarXiv:2406.10721v12024ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT
Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol +1
cs.CVcs.AIarXiv:2608.28455v12026