Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

9,841 to 9,900 of 18,817

  1. Report Supervision

    Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal +10

    cs.CVarXiv:2608.27668v12026
  2. Oracle Based Active Set Algorithm for Scalable Elastic Net Subspace Clustering

    Chong You, Chun-Guang Li, Daniel P. Robinson +1

    cs.LGcs.CVstat.MLarXiv:1605.02633v12016
  3. Unsupervised Learning of Object Landmarks through Conditional Image Generation

    Tomas Jakab, Ankush Gupta, Hakan Bilen +1

    cs.CVarXiv:1806.07823v22018
  4. Video Summarization Using Fully Convolutional Sequence Networks

    Mrigank Rochan, Linwei Ye, Yang Wang

    cs.CVarXiv:1805.10538v22018
  5. AdaMerging: Adaptive Model Merging for Multi-Task Learning

    Enneng Yang, Zhenyi Wang, Li Shen +4

    cs.LGcs.CVarXiv:2310.02575v22023
  6. SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality

    Cheng-Yu Hsieh, Jieyu Zhang, Zixian Ma +2

    cs.CVcs.CLcs.LGarXiv:2306.14610v12023
  7. MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction

    Bencheng Liao, Shaoyu Chen, Yunchi Zhang +5

    cs.CVcs.ROarXiv:2308.05736v22023
  8. Working Memory Connections for LSTM

    Federico Landi, Lorenzo Baraldi, Marcella Cornia +1

    cs.LGcs.CLcs.CVarXiv:2109.00020v12021
  9. Change Detection Methods for Remote Sensing in the Last Decade: A Comprehensive Review

    Guangliang Cheng, Yunmeng Huang, Xiangtai Li +4

    cs.CVcs.LGeess.IVarXiv:2305.05813v12023
  10. Multi-Task Learning for Segmentation of Building Footprints with Deep Neural Networks

    Benjamin Bischke, Patrick Helber, Joachim Folz +2

    cs.CVarXiv:1709.05932v12017
  11. DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory

    Shengming Yin, Chenfei Wu, Jian Liang +4

    cs.CVarXiv:2308.08089v12023
  12. End-to-end 3D face reconstruction with deep neural networks

    Pengfei Dou, Shishir K. Shah, Ioannis A. Kakadiaris

    cs.CVarXiv:1704.05020v12017
  13. Trustworthy AI

    Richa Singh, Mayank Vatsa, Nalini Ratha

    cs.CYcs.CRcs.CVarXiv:2011.02272v12020
  14. How good are detection proposals, really?

    Jan Hosang, Rodrigo Benenson, Bernt Schiele

    cs.CVarXiv:1406.6962v22014
  15. Valley: Video Assistant with Large Language model Enhanced abilitY

    Ruipu Luo, Ziwang Zhao, Min Yang +6

    cs.CVcs.AIcs.CLarXiv:2306.07207v32023
  16. Semantic Labeling in Very High Resolution Images via a Self-Cascaded Convolutional Neural Network

    Yongcheng Liu, Bin Fan, Lingfeng Wang +3

    cs.CVcs.AIcs.LGarXiv:1807.11236v12018
  17. WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion

    Soyong Shin, Juyong Kim, Eni Halilaj +1

    cs.CVarXiv:2312.07531v22023
  18. Support-set bottlenecks for video-text representation learning

    Mandela Patrick, Po-Yao Huang, Yuki Asano +4

    cs.CVarXiv:2010.02824v22020
  19. Multi-Temporal Recurrent Neural Networks For Progressive Non-Uniform Single Image Deblurring With Incremental Temporal Training

    Dongwon Park, Dong Un Kang, Jisoo Kim +1

    eess.IVcs.CVarXiv:1911.07410v12019
  20. TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

    Linli Yao, Yuancheng Wei, Yaojie Zhang +12

    cs.CVarXiv:2602.08711v32026
  21. A Variational Perspective on Solving Inverse Problems with Diffusion Models

    Morteza Mardani, Jiaming Song, Jan Kautz +1

    cs.LGcs.CVmath.NAarXiv:2305.04391v22023
  22. Pathwise Test-Time Correction for Autoregressive Long Video Generation

    Xunzhi Xiang, Zixuan Duan, Guiyu Zhang +7

    cs.CVarXiv:2602.05871v22026
  23. PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

    Minh-Quan Le, Gaurav Mittal, Cheng Zhao +3

    cs.CVarXiv:2602.01624v22026
  24. Towards Open Vocabulary Learning: A Survey

    Jianzong Wu, Xiangtai Li, Shilin Xu +9

    cs.CVcs.AIarXiv:2306.15880v42023
  25. PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers

    Haopeng Li, Shitong Shao, Wenliang Zhong +4

    cs.CVarXiv:2602.01077v22026
  26. PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction

    Danpeng Chen, Hai Li, Weicai Ye +7

    cs.CVarXiv:2406.06521v22024
  27. Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation

    David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu +5

    cs.CVarXiv:2309.15818v32023
  28. Imagic: Text-Based Real Image Editing with Diffusion Models

    Bahjat Kawar, Shiran Zada, Oran Lang +5

    cs.CVarXiv:2210.09276v32022
  29. More Diverse Means Better: Multimodal Deep Learning Meets Remote Sensing Imagery Classification

    Danfeng Hong, Lianru Gao, Naoto Yokoya +4

    cs.CVeess.IVarXiv:2008.05457v12020
  30. Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition

    Qibin Hou, Cheng-Ze Lu, Ming-Ming Cheng +1

    cs.CVarXiv:2211.11943v12022
  31. On Unifying Multi-View Self-Representations for Clustering by Tensor Multi-Rank Minimization

    Yuan Xie, Dacheng Tao, Wensheng Zhang +3

    cs.CVarXiv:1610.07126v32016
  32. Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations

    Ranjay Krishna, Yuke Zhu, Oliver Groth +9

    cs.CVcs.AIarXiv:1602.07332v12016
  33. PTQ4ViT: Post-training quantization for vision transformers with twin uniform quantization

    Zhihang Yuan, Chenhao Xue, Yiqi Chen +2

    cs.CVarXiv:2111.12293v32021
  34. Dropout Sampling for Robust Object Detection in Open-Set Conditions

    Dimity Miller, Lachlan Nicholson, Feras Dayoub +1

    cs.CVarXiv:1710.06677v22017
  35. Improved Few-Shot Visual Classification

    Peyman Bateni, Raghav Goyal, Vaden Masrani +2

    cs.CVarXiv:1912.03432v32019
  36. Prioritized Training on Points that are Learnable, Worth Learning, and Not Yet Learnt

    Sören Mindermann, Jan Brauner, Muhammed Razzak +8

    cs.LGcs.AIcs.CLarXiv:2206.07137v32022
  37. Registration based Few-Shot Anomaly Detection

    Chaoqin Huang, Haoyan Guan, Aofan Jiang +3

    cs.CVarXiv:2207.07361v12022
  38. Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards

    Alexandre Ramé, Guillaume Couairon, Mustafa Shukor +4

    cs.LGcs.AIcs.CVarXiv:2306.04488v22023
  39. Asymmetric Student-Teacher Networks for Industrial Anomaly Detection

    Marco Rudolph, Tom Wehrbein, Bodo Rosenhahn +1

    cs.LGcs.AIcs.CVarXiv:2210.07829v22022
  40. Texture Image Classification Using DWT AlexNet Feature Fusion and Deep Neural Networks

    Arun D. Kulkarni

    cs.CVcs.AIarXiv:2608.28524v12026
  41. Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification

    Sanath Narayan, Akshita Gupta, Fahad Shahbaz Khan +2

    cs.CVarXiv:2003.07833v22020
  42. Learning Combinatorial Embedding Networks for Deep Graph Matching

    Runzhong Wang, Junchi Yan, Xiaokang Yang

    cs.CVarXiv:1904.00597v32019
  43. Learning to Answer Questions in Dynamic Audio-Visual Scenarios

    Guangyao Li, Yake Wei, Yapeng Tian +3

    cs.CVarXiv:2203.14072v22022
  44. ICE: Inter-instance Contrastive Encoding for Unsupervised Person Re-identification

    Hao Chen, Benoit Lagadec, Francois Bremond

    cs.CVarXiv:2103.16364v22021
  45. DeepTrack: Learning Discriminative Feature Representations Online for Robust Visual Tracking

    Hanxi Li, Yi Li, Fatih Porikli

    cs.CVarXiv:1503.00072v12015
  46. FusionNet: A deep fully residual convolutional neural network for image segmentation in connectomics

    Tran Minh Quan, David G. C. Hildebrand, Won-Ki Jeong

    cs.CVarXiv:1612.05360v22016
  47. Anatomy-Aware Promptable Segmentation with Online Interactive Training for AUTOPET V

    Pablo Lozano-Jimenez, Sergio Romero-Tapiador, Ruben Tolosana

    cs.CVcs.AIarXiv:2608.28461v12026
  48. Learning Likelihoods with Conditional Normalizing Flows

    Christina Winkler, Daniel Worrall, Emiel Hoogeboom +1

    cs.LGcs.CVstat.MLarXiv:1912.00042v22019
  49. SpaText: Spatio-Textual Representation for Controllable Image Generation

    Omri Avrahami, Thomas Hayes, Oran Gafni +6

    cs.CVcs.GRcs.LGarXiv:2211.14305v22022
  50. Cross-Scale Internal Graph Neural Network for Image Super-Resolution

    Shangchen Zhou, Jiawei Zhang, Wangmeng Zuo +1

    cs.CVarXiv:2006.16673v22020
  51. Learning the Depths of Moving People by Watching Frozen People

    Zhengqi Li, Tali Dekel, Forrester Cole +4

    cs.CVarXiv:1904.11111v12019
  52. Mixed Neural Network Approach for Temporal Sleep Stage Classification

    Hao Dong, Akara Supratak, Wei Pan +3

    q-bio.NCcs.CVcs.LGarXiv:1610.06421v32016
  53. EGSDE: Unpaired Image-to-Image Translation via Energy-Guided Stochastic Differential Equations

    Min Zhao, Fan Bao, Chongxuan Li +1

    cs.CVarXiv:2207.06635v52022
  54. Video Face Manipulation Detection Through Ensemble of CNNs

    Nicolò Bonettini, Edoardo Daniele Cannas, Sara Mandelli +3

    cs.CVcs.MMeess.IVarXiv:2004.07676v12020
  55. Real-Time Musculoskeletal Surrogates for Pediatric Cerebral Palsy: a Credibility Pilot

    Mohammad Arif Ul Alam

    cs.CVcs.AIarXiv:2608.28371v12026
  56. GeoNeRF: Generalizing NeRF with Geometry Priors

    Mohammad Mahdi Johari, Yann Lepoittevin, François Fleuret

    cs.CVarXiv:2111.13539v22021
  57. Joint Distribution Matters: Deep Brownian Distance Covariance for Few-Shot Classification

    Jiangtao Xie, Fei Long, Jiaming Lv +2

    cs.CVcs.LGstat.MLarXiv:2204.04567v12022
  58. Spatio-Temporal Graph for Video Captioning with Knowledge Distillation

    Boxiao Pan, Haoye Cai, De-An Huang +4

    cs.CVarXiv:2003.13942v12020
  59. RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics

    Wentao Yuan, Jiafei Duan, Valts Blukis +5

    cs.ROcs.AIcs.CVarXiv:2406.10721v12024
  60. ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT

    Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol +1

    cs.CVcs.AIarXiv:2608.28455v12026