Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

541 to 600 of 18,866

  1. Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models

    Lei Li, Yuqi Wang, Runxin Xu +4

    cs.CVcs.CLarXiv:2403.00231v32024
  2. SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

    Tongcheng Fang, Hanling Zhang, Ruiqi Xie +8

    cs.CVarXiv:2601.16515v22026
  3. 3AM: 3egment Anything with Geometric Consistency in Videos

    Yang-Che Sun, Cheng Sun, Chin-Yang Lin +4

    cs.CVarXiv:2601.08831v52026
  4. GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning

    Wenshuai Li, Xiantai Xiang, Zixiao Wen +6

    cs.CVarXiv:2601.04118v22026
  5. VINO: A Unified Visual Generator with Interleaved OmniModal Context

    Junyi Chen, Tong He, Zhoujie Fu +3

    cs.CVarXiv:2601.02358v22026
  6. Stronger Normalization-Free Transformers

    Mingzhi Chen, Taiming Lu, Jiachen Zhu +2

    cs.LGcs.AIcs.CLarXiv:2512.10938v22025
  7. SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

    Yandan Yang, Baoxiong Jia, Shujie Zhang +1

    cs.GRcs.CVcs.LGarXiv:2509.20414v22025
  8. SQN: Weakly-Supervised Semantic Segmentation of Large-Scale 3D Point Clouds

    Qingyong Hu, Bo Yang, Guangchi Fang +4

    cs.CVcs.AIcs.ROarXiv:2104.04891v32021
  9. Thyme: Think Beyond Images

    Yi-Fan Zhang, Xingyu Lu, Shukang Yin +17

    cs.CVarXiv:2508.11630v12025
  10. OpenGAN: Open-Set Recognition via Open Data Generation

    Shu Kong, Deva Ramanan

    cs.CVarXiv:2104.02939v32021
  11. OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion

    Yunhan Yang, Yufan Zhou, Yuan-Chen Guo +7

    cs.CVarXiv:2507.06165v12025
  12. Multimodal Object Detection via Probabilistic Ensembling

    Yi-Ting Chen, Jinghao Shi, Zelin Ye +3

    cs.CVarXiv:2104.02904v32021
  13. High-Fidelity Pluralistic Image Completion with Transformers

    Ziyu Wan, Jingbo Zhang, Dongdong Chen +1

    cs.CVcs.GRarXiv:2103.14031v12021
  14. Joint 3D Face Reconstruction and Dense Alignment with Position Map Regression Network

    Yao Feng, Fan Wu, Xiaohu Shao +2

    cs.CVcs.GRarXiv:1803.07835v12018
  15. MagFace: A Universal Representation for Face Recognition and Quality Assessment

    Qiang Meng, Shichao Zhao, Zhida Huang +1

    cs.CVarXiv:2103.06627v42021
  16. Zero-Shot Object Detection: Learning to Simultaneously Recognize and Localize Novel Concepts

    Shafin Rahman, Salman Khan, Fatih Porikli

    cs.CVarXiv:1803.06049v12018
  17. Counterfactual Zero-Shot and Open-Set Visual Recognition

    Zhongqi Yue, Tan Wang, Hanwang Zhang +2

    cs.CVcs.AIarXiv:2103.00887v12021
  18. Discriminability objective for training descriptive captions

    Ruotian Luo, Brian Price, Scott Cohen +1

    cs.CVarXiv:1803.04376v22018
  19. DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO

    Jinyoung Park, Jeehye Na, Jinyoung Kim +1

    cs.CVcs.AIarXiv:2506.07464v52025
  20. Transformer in Transformer

    Kai Han, An Xiao, Enhua Wu +3

    cs.CVcs.AIarXiv:2103.00112v32021
  21. Vision Language Models are Biased

    An Vo, Khai-Nguyen Nguyen, Mohammad Reza Taesiri +3

    cs.LGcs.CVarXiv:2505.23941v42025
  22. Tree-CNN: A Hierarchical Deep Convolutional Neural Network for Incremental Learning

    Deboleena Roy, Priyadarshini Panda, Kaushik Roy

    cs.CVcs.AIeess.IVarXiv:1802.05800v32018
  23. PointCNN: Convolution On $\mathcal{X}$-Transformed Points

    Yangyan Li, Rui Bu, Mingchao Sun +3

    cs.CVcs.AIcs.GRarXiv:1801.07791v52018
  24. Cross-Modal Contrastive Learning for Text-to-Image Generation

    Han Zhang, Jing Yu Koh, Jason Baldridge +2

    cs.CVarXiv:2101.04702v52021
  25. Stacked Conditional Generative Adversarial Networks for Jointly Learning Shadow Detection and Shadow Removal

    Jifeng Wang, Xiang Li, Le Hui +1

    cs.CVarXiv:1712.02478v12017
  26. Dense 3D Regression for Hand Pose Estimation

    Chengde Wan, Thomas Probst, Luc Van Gool +1

    cs.CVarXiv:1711.08996v12017
  27. Seed1.5-VL Technical Report

    Dong Guo, Faming Wu, Feida Zhu +194

    cs.CVcs.AIarXiv:2505.07062v12025
  28. PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning

    Arun Mallya, Svetlana Lazebnik

    cs.CVarXiv:1711.05769v22017
  29. Deep Learning for Medical Anomaly Detection -- A Survey

    Tharindu Fernando, Harshala Gammulle, Simon Denman +2

    cs.LGcs.CVeess.IVarXiv:2012.02364v22020
  30. Causal Contextual Prediction for Learned Image Compression

    Zongyu Guo, Zhizheng Zhang, Runsen Feng +1

    cs.CVeess.IVarXiv:2011.09704v52020
  31. Soft Proposal Networks for Weakly Supervised Object Localization

    Yi Zhu, Yanzhao Zhou, Qixiang Ye +2

    cs.CVarXiv:1709.01829v12017
  32. Pixel-Level Matching for Video Object Segmentation using Convolutional Neural Networks

    Jae Shin Yoon, Francois Rameau, Junsik Kim +3

    cs.CVarXiv:1708.05137v12017
  33. TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos

    Linli Yao, Yicheng Li, Yuancheng Wei +11

    cs.CVarXiv:2504.17343v12025
  34. Learning and Evaluating Representations for Deep One-class Classification

    Kihyuk Sohn, Chun-Liang Li, Jinsung Yoon +2

    cs.CVarXiv:2011.02578v22020
  35. PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding

    Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi +26

    cs.CVcs.AIcs.LGarXiv:2504.13180v32025
  36. Optimization for Medical Image Segmentation: Theory and Practice when evaluating with Dice Score or Jaccard Index

    Tom Eelbode, Jeroen Bertels, Maxim Berman +4

    eess.IVcs.CVcs.LGarXiv:2010.13499v12020
  37. SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL

    Junke Wang, Zhi Tian, Xun Wang +4

    cs.CVarXiv:2504.11455v12025
  38. Skeleton-based Action Recognition Using LSTM and CNN

    Chuankun Li, Pichao Wang, Shuang Wang +2

    cs.CVarXiv:1707.02356v12017
  39. Video-Bench: Human-Aligned Video Generation Benchmark

    Hui Han, Siyuan Li, Jiaqi Chen +10

    cs.CVcs.AIarXiv:2504.04907v22025
  40. Representation Learning via Invariant Causal Mechanisms

    Jovana Mitrovic, Brian McWilliams, Jacob Walker +2

    cs.LGcs.CVstat.MLarXiv:2010.07922v12020
  41. End-to-End Driving with Online Trajectory Evaluation via BEV World Model

    Yingyan Li, Yuqi Wang, Yang Liu +3

    cs.CVarXiv:2504.01941v22025
  42. Recurrent computations for visual pattern completion

    Hanlin Tang, Martin Schrimpf, Bill Lotter +6

    q-bio.NCcs.AIcs.CVarXiv:1706.02240v22017
  43. DropGaussian: Structural Regularization for Sparse-view Gaussian Splatting

    Hyunwoo Park, Gun Ryu, Wonjun Kim

    cs.CVarXiv:2504.00773v12025
  44. RESA: Recurrent Feature-Shift Aggregator for Lane Detection

    Tu Zheng, Hao Fang, Yi Zhang +4

    cs.CVarXiv:2008.13719v22020
  45. CERN: Confidence-Energy Recurrent Network for Group Activity Recognition

    Tianmin Shu, Sinisa Todorovic, Song-Chun Zhu

    cs.CVcs.LGstat.MLarXiv:1704.03058v12017
  46. Same Same But DifferNet: Semi-Supervised Defect Detection with Normalizing Flows

    Marco Rudolph, Bastian Wandt, Bodo Rosenhahn

    cs.CVcs.LGeess.IVarXiv:2008.12577v12020
  47. UniH$^3$: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration

    Zhiwen Yang, Jiayin Li, Chengyu Liu +3

    cs.CVarXiv:2609.11156v12026
  48. Lift, Splat, Shoot: Encoding Images From Arbitrary Camera Rigs by Implicitly Unprojecting to 3D

    Jonah Philion, Sanja Fidler

    cs.CVarXiv:2008.05711v12020
  49. Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection

    Duygu Sarikaya, Jason J. Corso, Khurshid A. Guru

    cs.CVarXiv:2008.00936v12020
  50. Video Super Resolution Based on Deep Learning: A Comprehensive Survey

    Hongying Liu, Zhubo Ruan, Peng Zhao +5

    cs.CVeess.IVarXiv:2007.12928v32020
  51. Exponential Pixelating Integral transform with dual fractal features for enhanced chest X-ray abnormality detection

    Naveenraj Kamalakannan, Sri Ram Macharla, M Kanimozhi +1

    eess.IVcs.CVarXiv:2609.10988v12026
  52. Segmentation of optic disc, fovea and retinal vasculature using a single convolutional neural network

    Jen Hong Tan, U. Rajendra Acharya, Sulatha V. Bhandary +2

    cs.CVcs.LGarXiv:1702.00509v12017
  53. AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow

    Junran Wang, Zehao Jin, Tianyu Luan +1

    cs.CVcs.AIarXiv:2609.10723v12026
  54. RUN: Reversible Unfolding Network for Concealed Object Segmentation

    Chunming He, Rihan Zhang, Fengyang Xiao +7

    cs.CVarXiv:2501.18783v22025
  55. MCUNet: Tiny Deep Learning on IoT Devices

    Ji Lin, Wei-Ming Chen, Yujun Lin +3

    cs.CVarXiv:2007.10319v22020
  56. Non-Local Spatial Propagation Network for Depth Completion

    Jinsun Park, Kyungdon Joo, Zhe Hu +2

    cs.CVarXiv:2007.10042v12020
  57. Attract, Perturb, and Explore: Learning a Feature Alignment Network for Semi-supervised Domain Adaptation

    Taekyung Kim, Changick Kim

    cs.CVarXiv:2007.09375v12020
  58. Test-time Alignment of Diffusion Models without Reward Over-optimization

    Sunwoo Kim, Minkyu Kim, Dongmin Park

    cs.LGcs.AIcs.CVarXiv:2501.05803v32025
  59. Infra-Bench CLS: A Global, Open-Source Benchmark for Critical Infrastructure Classification with Earth Observation Foundation Models

    Justin Guthrie, Edward Oughton, Konrad Wessels +2

    cs.CVcs.LGarXiv:2609.09482v12026
  60. Reliability-Aware Hybrid-K Ensemble Selection for Cervical Cytology Classification: Integrating Discrimination, Calibration, and Selective Prediction

    Nisreen Albzour, Sarah S. Lam

    eess.IVcs.AIcs.CVarXiv:2609.09189v12026