Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,781 to 9,840 of 18,781

  1. Multi-Representation Adaptation Network for Cross-domain Image Classification

    Yongchun Zhu, Fuzhen Zhuang, Jindong Wang +4

    cs.CVcs.AIcs.LGarXiv:2201.01002v12022
  2. Automatic Classification of Cancerous Tissue in Laserendomicroscopy Images of the Oral Cavity using Deep Learning

    Marc Aubreville, Christian Knipfer, Nicolai Oetter +7

    cs.CVarXiv:1703.01622v22017
  3. Adversarial vulnerability for any classifier

    Alhussein Fawzi, Hamza Fawzi, Omar Fawzi

    cs.LGcs.CRcs.CVarXiv:1802.08686v22018
  4. Visual Object Networks: Image Generation with Disentangled 3D Representation

    Jun-Yan Zhu, Zhoutong Zhang, Chengkai Zhang +4

    cs.CVcs.GRstat.MLarXiv:1812.02725v12018
  5. GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D Gaussians

    Liangxiao Hu, Hongwen Zhang, Yuxiang Zhang +4

    cs.CVarXiv:2312.02134v32023
  6. Spatio-temporal Self-Supervised Representation Learning for 3D Point Clouds

    Siyuan Huang, Yichen Xie, Song-Chun Zhu +1

    cs.CVarXiv:2109.00179v12021
  7. Language as Queries for Referring Video Object Segmentation

    Jiannan Wu, Yi Jiang, Peize Sun +2

    cs.CVarXiv:2201.00487v22022
  8. A Survey of Semantic Segmentation

    Martin Thoma

    cs.CVarXiv:1602.06541v22016
  9. TubeTK: Adopting Tubes to Track Multi-Object in a One-Step Training Model

    Bo Pang, Yizhuo Li, Yifan Zhang +2

    cs.CVarXiv:2006.05683v12020
  10. RangeDet:In Defense of Range View for LiDAR-based 3D Object Detection

    Lue Fan, Xuan Xiong, Feng Wang +2

    cs.CVcs.ROarXiv:2103.10039v12021
  11. DCAN: Dual Channel-wise Alignment Networks for Unsupervised Scene Adaptation

    Zuxuan Wu, Xintong Han, Yen-Liang Lin +4

    cs.CVarXiv:1804.05827v12018
  12. Deep Gradient Learning for Efficient Camouflaged Object Detection

    Ge-Peng Ji, Deng-Ping Fan, Yu-Cheng Chou +3

    cs.CVarXiv:2205.12853v22022
  13. Demystify Mamba in Vision: A Linear Attention Perspective

    Dongchen Han, Ziyi Wang, Zhuofan Xia +7

    cs.CVarXiv:2405.16605v22024
  14. Rethinking Bottleneck Structure for Efficient Mobile Network Design

    Zhou Daquan, Qibin Hou, Yunpeng Chen +2

    cs.CVarXiv:2007.02269v42020
  15. Global Structure-from-Motion Revisited

    Linfei Pan, Dániel Baráth, Marc Pollefeys +1

    cs.CVarXiv:2407.20219v22024
  16. DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

    Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa +1

    cs.ROcs.CVarXiv:2608.28108v12026
  17. TextDiffuser: Diffusion Models as Text Painters

    Jingye Chen, Yupan Huang, Tengchao Lv +3

    cs.CVarXiv:2305.10855v52023
  18. ABCD: Alpha-Composited Block Coordinate Descent: Constant-VRAM Training for Large Radiance Fields

    Ka Heng Shiu, Kartic Subr

    cs.CVcs.GRarXiv:2608.27735v12026
  19. Revisiting Class-Incremental Learning with Pre-Trained Models: Generalizability and Adaptivity are All You Need

    Da-Wei Zhou, Zi-Wen Cai, Han-Jia Ye +2

    cs.LGcs.CVarXiv:2303.07338v22023
  20. Computational Pathology: Challenges and Promises for Tissue Analysis

    Thomas J. Fuchs, Joachim M. Buhmann

    cs.CVcs.AIarXiv:1601.00027v12015
  21. Combining EfficientNet and Vision Transformers for Video Deepfake Detection

    Davide Coccomini, Nicola Messina, Claudio Gennaro +1

    cs.CVarXiv:2107.02612v22021
  22. Satellite Pose Estimation Challenge: Dataset, Competition Design and Results

    Mate Kisantal, Sumant Sharma, Tae Ha Park +3

    cs.CVarXiv:1911.02050v22019
  23. Evaluating Bayesian Deep Learning Methods for Semantic Segmentation

    Jishnu Mukhoti, Yarin Gal

    cs.CVarXiv:1811.12709v22018
  24. Total3DUnderstanding: Joint Layout, Object Pose and Mesh Reconstruction for Indoor Scenes from a Single Image

    Yinyu Nie, Xiaoguang Han, Shihui Guo +3

    cs.CVarXiv:2002.12212v12020
  25. Report Supervision

    Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal +10

    cs.CVarXiv:2608.27668v12026
  26. Oracle Based Active Set Algorithm for Scalable Elastic Net Subspace Clustering

    Chong You, Chun-Guang Li, Daniel P. Robinson +1

    cs.LGcs.CVstat.MLarXiv:1605.02633v12016
  27. Unsupervised Learning of Object Landmarks through Conditional Image Generation

    Tomas Jakab, Ankush Gupta, Hakan Bilen +1

    cs.CVarXiv:1806.07823v22018
  28. Video Summarization Using Fully Convolutional Sequence Networks

    Mrigank Rochan, Linwei Ye, Yang Wang

    cs.CVarXiv:1805.10538v22018
  29. AdaMerging: Adaptive Model Merging for Multi-Task Learning

    Enneng Yang, Zhenyi Wang, Li Shen +4

    cs.LGcs.CVarXiv:2310.02575v22023
  30. SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality

    Cheng-Yu Hsieh, Jieyu Zhang, Zixian Ma +2

    cs.CVcs.CLcs.LGarXiv:2306.14610v12023
  31. MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction

    Bencheng Liao, Shaoyu Chen, Yunchi Zhang +5

    cs.CVcs.ROarXiv:2308.05736v22023
  32. Working Memory Connections for LSTM

    Federico Landi, Lorenzo Baraldi, Marcella Cornia +1

    cs.LGcs.CLcs.CVarXiv:2109.00020v12021
  33. Change Detection Methods for Remote Sensing in the Last Decade: A Comprehensive Review

    Guangliang Cheng, Yunmeng Huang, Xiangtai Li +4

    cs.CVcs.LGeess.IVarXiv:2305.05813v12023
  34. Multi-Task Learning for Segmentation of Building Footprints with Deep Neural Networks

    Benjamin Bischke, Patrick Helber, Joachim Folz +2

    cs.CVarXiv:1709.05932v12017
  35. DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory

    Shengming Yin, Chenfei Wu, Jian Liang +4

    cs.CVarXiv:2308.08089v12023
  36. End-to-end 3D face reconstruction with deep neural networks

    Pengfei Dou, Shishir K. Shah, Ioannis A. Kakadiaris

    cs.CVarXiv:1704.05020v12017
  37. Trustworthy AI

    Richa Singh, Mayank Vatsa, Nalini Ratha

    cs.CYcs.CRcs.CVarXiv:2011.02272v12020
  38. How good are detection proposals, really?

    Jan Hosang, Rodrigo Benenson, Bernt Schiele

    cs.CVarXiv:1406.6962v22014
  39. Valley: Video Assistant with Large Language model Enhanced abilitY

    Ruipu Luo, Ziwang Zhao, Min Yang +6

    cs.CVcs.AIcs.CLarXiv:2306.07207v32023
  40. Semantic Labeling in Very High Resolution Images via a Self-Cascaded Convolutional Neural Network

    Yongcheng Liu, Bin Fan, Lingfeng Wang +3

    cs.CVcs.AIcs.LGarXiv:1807.11236v12018
  41. WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion

    Soyong Shin, Juyong Kim, Eni Halilaj +1

    cs.CVarXiv:2312.07531v22023
  42. Support-set bottlenecks for video-text representation learning

    Mandela Patrick, Po-Yao Huang, Yuki Asano +4

    cs.CVarXiv:2010.02824v22020
  43. Multi-Temporal Recurrent Neural Networks For Progressive Non-Uniform Single Image Deblurring With Incremental Temporal Training

    Dongwon Park, Dong Un Kang, Jisoo Kim +1

    eess.IVcs.CVarXiv:1911.07410v12019
  44. TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

    Linli Yao, Yuancheng Wei, Yaojie Zhang +12

    cs.CVarXiv:2602.08711v32026
  45. A Variational Perspective on Solving Inverse Problems with Diffusion Models

    Morteza Mardani, Jiaming Song, Jan Kautz +1

    cs.LGcs.CVmath.NAarXiv:2305.04391v22023
  46. Pathwise Test-Time Correction for Autoregressive Long Video Generation

    Xunzhi Xiang, Zixuan Duan, Guiyu Zhang +7

    cs.CVarXiv:2602.05871v22026
  47. PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

    Minh-Quan Le, Gaurav Mittal, Cheng Zhao +3

    cs.CVarXiv:2602.01624v22026
  48. Towards Open Vocabulary Learning: A Survey

    Jianzong Wu, Xiangtai Li, Shilin Xu +9

    cs.CVcs.AIarXiv:2306.15880v42023
  49. PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers

    Haopeng Li, Shitong Shao, Wenliang Zhong +4

    cs.CVarXiv:2602.01077v22026
  50. PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction

    Danpeng Chen, Hai Li, Weicai Ye +7

    cs.CVarXiv:2406.06521v22024
  51. Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation

    David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu +5

    cs.CVarXiv:2309.15818v32023
  52. Imagic: Text-Based Real Image Editing with Diffusion Models

    Bahjat Kawar, Shiran Zada, Oran Lang +5

    cs.CVarXiv:2210.09276v32022
  53. More Diverse Means Better: Multimodal Deep Learning Meets Remote Sensing Imagery Classification

    Danfeng Hong, Lianru Gao, Naoto Yokoya +4

    cs.CVeess.IVarXiv:2008.05457v12020
  54. Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition

    Qibin Hou, Cheng-Ze Lu, Ming-Ming Cheng +1

    cs.CVarXiv:2211.11943v12022
  55. On Unifying Multi-View Self-Representations for Clustering by Tensor Multi-Rank Minimization

    Yuan Xie, Dacheng Tao, Wensheng Zhang +3

    cs.CVarXiv:1610.07126v32016
  56. Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations

    Ranjay Krishna, Yuke Zhu, Oliver Groth +9

    cs.CVcs.AIarXiv:1602.07332v12016
  57. PTQ4ViT: Post-training quantization for vision transformers with twin uniform quantization

    Zhihang Yuan, Chenhao Xue, Yiqi Chen +2

    cs.CVarXiv:2111.12293v32021
  58. Dropout Sampling for Robust Object Detection in Open-Set Conditions

    Dimity Miller, Lachlan Nicholson, Feras Dayoub +1

    cs.CVarXiv:1710.06677v22017
  59. Improved Few-Shot Visual Classification

    Peyman Bateni, Raghav Goyal, Vaden Masrani +2

    cs.CVarXiv:1912.03432v32019
  60. Prioritized Training on Points that are Learnable, Worth Learning, and Not Yet Learnt

    Sören Mindermann, Jan Brauner, Muhammed Razzak +8

    cs.LGcs.AIcs.CLarXiv:2206.07137v32022