Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
541 to 600 of 18,866
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
Lei Li, Yuqi Wang, Runxin Xu +4
cs.CVcs.CLarXiv:2403.00231v32024SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
Tongcheng Fang, Hanling Zhang, Ruiqi Xie +8
cs.CVarXiv:2601.16515v220263AM: 3egment Anything with Geometric Consistency in Videos
Yang-Che Sun, Cheng Sun, Chin-Yang Lin +4
cs.CVarXiv:2601.08831v52026GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
Wenshuai Li, Xiantai Xiang, Zixiao Wen +6
cs.CVarXiv:2601.04118v22026VINO: A Unified Visual Generator with Interleaved OmniModal Context
Junyi Chen, Tong He, Zhoujie Fu +3
cs.CVarXiv:2601.02358v22026Stronger Normalization-Free Transformers
Mingzhi Chen, Taiming Lu, Jiachen Zhu +2
cs.LGcs.AIcs.CLarXiv:2512.10938v22025SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
Yandan Yang, Baoxiong Jia, Shujie Zhang +1
cs.GRcs.CVcs.LGarXiv:2509.20414v22025SQN: Weakly-Supervised Semantic Segmentation of Large-Scale 3D Point Clouds
Qingyong Hu, Bo Yang, Guangchi Fang +4
cs.CVcs.AIcs.ROarXiv:2104.04891v32021Thyme: Think Beyond Images
Yi-Fan Zhang, Xingyu Lu, Shukang Yin +17
cs.CVarXiv:2508.11630v12025OpenGAN: Open-Set Recognition via Open Data Generation
Shu Kong, Deva Ramanan
cs.CVarXiv:2104.02939v32021OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion
Yunhan Yang, Yufan Zhou, Yuan-Chen Guo +7
cs.CVarXiv:2507.06165v12025Multimodal Object Detection via Probabilistic Ensembling
Yi-Ting Chen, Jinghao Shi, Zelin Ye +3
cs.CVarXiv:2104.02904v32021High-Fidelity Pluralistic Image Completion with Transformers
Ziyu Wan, Jingbo Zhang, Dongdong Chen +1
cs.CVcs.GRarXiv:2103.14031v12021Joint 3D Face Reconstruction and Dense Alignment with Position Map Regression Network
Yao Feng, Fan Wu, Xiaohu Shao +2
cs.CVcs.GRarXiv:1803.07835v12018MagFace: A Universal Representation for Face Recognition and Quality Assessment
Qiang Meng, Shichao Zhao, Zhida Huang +1
cs.CVarXiv:2103.06627v42021Zero-Shot Object Detection: Learning to Simultaneously Recognize and Localize Novel Concepts
Shafin Rahman, Salman Khan, Fatih Porikli
cs.CVarXiv:1803.06049v12018Counterfactual Zero-Shot and Open-Set Visual Recognition
Zhongqi Yue, Tan Wang, Hanwang Zhang +2
cs.CVcs.AIarXiv:2103.00887v12021Discriminability objective for training descriptive captions
Ruotian Luo, Brian Price, Scott Cohen +1
cs.CVarXiv:1803.04376v22018DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
Jinyoung Park, Jeehye Na, Jinyoung Kim +1
cs.CVcs.AIarXiv:2506.07464v52025Transformer in Transformer
Kai Han, An Xiao, Enhua Wu +3
cs.CVcs.AIarXiv:2103.00112v32021Vision Language Models are Biased
An Vo, Khai-Nguyen Nguyen, Mohammad Reza Taesiri +3
cs.LGcs.CVarXiv:2505.23941v42025Tree-CNN: A Hierarchical Deep Convolutional Neural Network for Incremental Learning
Deboleena Roy, Priyadarshini Panda, Kaushik Roy
cs.CVcs.AIeess.IVarXiv:1802.05800v32018PointCNN: Convolution On $\mathcal{X}$-Transformed Points
Yangyan Li, Rui Bu, Mingchao Sun +3
cs.CVcs.AIcs.GRarXiv:1801.07791v52018Cross-Modal Contrastive Learning for Text-to-Image Generation
Han Zhang, Jing Yu Koh, Jason Baldridge +2
cs.CVarXiv:2101.04702v52021Stacked Conditional Generative Adversarial Networks for Jointly Learning Shadow Detection and Shadow Removal
Jifeng Wang, Xiang Li, Le Hui +1
cs.CVarXiv:1712.02478v12017Dense 3D Regression for Hand Pose Estimation
Chengde Wan, Thomas Probst, Luc Van Gool +1
cs.CVarXiv:1711.08996v12017Seed1.5-VL Technical Report
Dong Guo, Faming Wu, Feida Zhu +194
cs.CVcs.AIarXiv:2505.07062v12025PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning
Arun Mallya, Svetlana Lazebnik
cs.CVarXiv:1711.05769v22017Deep Learning for Medical Anomaly Detection -- A Survey
Tharindu Fernando, Harshala Gammulle, Simon Denman +2
cs.LGcs.CVeess.IVarXiv:2012.02364v22020Causal Contextual Prediction for Learned Image Compression
Zongyu Guo, Zhizheng Zhang, Runsen Feng +1
cs.CVeess.IVarXiv:2011.09704v52020Soft Proposal Networks for Weakly Supervised Object Localization
Yi Zhu, Yanzhao Zhou, Qixiang Ye +2
cs.CVarXiv:1709.01829v12017Pixel-Level Matching for Video Object Segmentation using Convolutional Neural Networks
Jae Shin Yoon, Francois Rameau, Junsik Kim +3
cs.CVarXiv:1708.05137v12017TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
Linli Yao, Yicheng Li, Yuancheng Wei +11
cs.CVarXiv:2504.17343v12025Learning and Evaluating Representations for Deep One-class Classification
Kihyuk Sohn, Chun-Liang Li, Jinsung Yoon +2
cs.CVarXiv:2011.02578v22020PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi +26
cs.CVcs.AIcs.LGarXiv:2504.13180v32025Optimization for Medical Image Segmentation: Theory and Practice when evaluating with Dice Score or Jaccard Index
Tom Eelbode, Jeroen Bertels, Maxim Berman +4
eess.IVcs.CVcs.LGarXiv:2010.13499v12020SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
Junke Wang, Zhi Tian, Xun Wang +4
cs.CVarXiv:2504.11455v12025Skeleton-based Action Recognition Using LSTM and CNN
Chuankun Li, Pichao Wang, Shuang Wang +2
cs.CVarXiv:1707.02356v12017Video-Bench: Human-Aligned Video Generation Benchmark
Hui Han, Siyuan Li, Jiaqi Chen +10
cs.CVcs.AIarXiv:2504.04907v22025Representation Learning via Invariant Causal Mechanisms
Jovana Mitrovic, Brian McWilliams, Jacob Walker +2
cs.LGcs.CVstat.MLarXiv:2010.07922v12020End-to-End Driving with Online Trajectory Evaluation via BEV World Model
Yingyan Li, Yuqi Wang, Yang Liu +3
cs.CVarXiv:2504.01941v22025Recurrent computations for visual pattern completion
Hanlin Tang, Martin Schrimpf, Bill Lotter +6
q-bio.NCcs.AIcs.CVarXiv:1706.02240v22017DropGaussian: Structural Regularization for Sparse-view Gaussian Splatting
Hyunwoo Park, Gun Ryu, Wonjun Kim
cs.CVarXiv:2504.00773v12025RESA: Recurrent Feature-Shift Aggregator for Lane Detection
Tu Zheng, Hao Fang, Yi Zhang +4
cs.CVarXiv:2008.13719v22020CERN: Confidence-Energy Recurrent Network for Group Activity Recognition
Tianmin Shu, Sinisa Todorovic, Song-Chun Zhu
cs.CVcs.LGstat.MLarXiv:1704.03058v12017Same Same But DifferNet: Semi-Supervised Defect Detection with Normalizing Flows
Marco Rudolph, Bastian Wandt, Bodo Rosenhahn
cs.CVcs.LGeess.IVarXiv:2008.12577v12020UniH$^3$: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration
Zhiwen Yang, Jiayin Li, Chengyu Liu +3
cs.CVarXiv:2609.11156v12026Lift, Splat, Shoot: Encoding Images From Arbitrary Camera Rigs by Implicitly Unprojecting to 3D
Jonah Philion, Sanja Fidler
cs.CVarXiv:2008.05711v12020Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection
Duygu Sarikaya, Jason J. Corso, Khurshid A. Guru
cs.CVarXiv:2008.00936v12020Video Super Resolution Based on Deep Learning: A Comprehensive Survey
Hongying Liu, Zhubo Ruan, Peng Zhao +5
cs.CVeess.IVarXiv:2007.12928v32020Exponential Pixelating Integral transform with dual fractal features for enhanced chest X-ray abnormality detection
Naveenraj Kamalakannan, Sri Ram Macharla, M Kanimozhi +1
eess.IVcs.CVarXiv:2609.10988v12026Segmentation of optic disc, fovea and retinal vasculature using a single convolutional neural network
Jen Hong Tan, U. Rajendra Acharya, Sulatha V. Bhandary +2
cs.CVcs.LGarXiv:1702.00509v12017AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow
Junran Wang, Zehao Jin, Tianyu Luan +1
cs.CVcs.AIarXiv:2609.10723v12026RUN: Reversible Unfolding Network for Concealed Object Segmentation
Chunming He, Rihan Zhang, Fengyang Xiao +7
cs.CVarXiv:2501.18783v22025MCUNet: Tiny Deep Learning on IoT Devices
Ji Lin, Wei-Ming Chen, Yujun Lin +3
cs.CVarXiv:2007.10319v22020Non-Local Spatial Propagation Network for Depth Completion
Jinsun Park, Kyungdon Joo, Zhe Hu +2
cs.CVarXiv:2007.10042v12020Attract, Perturb, and Explore: Learning a Feature Alignment Network for Semi-supervised Domain Adaptation
Taekyung Kim, Changick Kim
cs.CVarXiv:2007.09375v12020Test-time Alignment of Diffusion Models without Reward Over-optimization
Sunwoo Kim, Minkyu Kim, Dongmin Park
cs.LGcs.AIcs.CVarXiv:2501.05803v32025Infra-Bench CLS: A Global, Open-Source Benchmark for Critical Infrastructure Classification with Earth Observation Foundation Models
Justin Guthrie, Edward Oughton, Konrad Wessels +2
cs.CVcs.LGarXiv:2609.09482v12026Reliability-Aware Hybrid-K Ensemble Selection for Cervical Cytology Classification: Integrating Discrimination, Calibration, and Selective Prediction
Nisreen Albzour, Sarah S. Lam
eess.IVcs.AIcs.CVarXiv:2609.09189v12026