Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,541 to 15,600 of 18,830

  1. Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content Creation

    Rui Chen, Yongwei Chen, Ningxin Jiao +1

    cs.CVcs.AIarXiv:2303.13873v32023
  2. Region Attention Networks for Pose and Occlusion Robust Facial Expression Recognition

    Kai Wang, Xiaojiang Peng, Jianfei Yang +2

    cs.CVarXiv:1905.04075v22019
  3. RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

    Songming Liu, Lingxuan Wu, Bangguo Li +6

    cs.ROcs.AIcs.CVarXiv:2410.07864v22024
  4. Feedback Network for Image Super-Resolution

    Zhen Li, Jinglei Yang, Zheng Liu +3

    cs.CVarXiv:1903.09814v22019
  5. ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

    Aviad Dahan, Moran Yanuka, Noa Kraicer +2

    cs.SDcs.CVcs.GRarXiv:2603.10256v12026
  6. OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

    Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang +1

    cs.CVarXiv:2601.09575v12026
  7. V-Bridge: Bridging Video Generative Priors to Versatile Few-shot Image Restoration

    Shenghe Zheng, Junpeng Jiang, Wenbo Li

    cs.CVarXiv:2603.13089v12026
  8. Deep Semantic Segmentation of Natural and Medical Images: A Review

    Saeid Asgari Taghanaki, Kumar Abhishek, Joseph Paul Cohen +2

    cs.CVcs.LGeess.IVarXiv:1910.07655v42019
  9. Remote Sensing Image Scene Classification Meets Deep Learning: Challenges, Methods, Benchmarks, and Opportunities

    Gong Cheng, Xingxing Xie, Junwei Han +2

    cs.CVarXiv:2005.01094v22020
  10. Learning Self-Correction in Vision-Language Models via Rollout Augmentation

    Yi Ding, Ziliang Qiu, Bolian Li +1

    cs.CVcs.CLcs.LGarXiv:2602.08503v22026
  11. The Application of Two-level Attention Models in Deep Convolutional Neural Network for Fine-grained Image Classification

    Tianjun Xiao, Yichong Xu, Kuiyuan Yang +3

    cs.CVarXiv:1411.6447v12014
  12. CodePercept: Code-Grounded Visual STEM Perception for MLLMs

    Tongkun Guan, Zhibo Yang, Jianqiang Wan +10

    cs.CVarXiv:2603.10757v22026
  13. FCOS3D: Fully Convolutional One-Stage Monocular 3D Object Detection

    Tai Wang, Xinge Zhu, Jiangmiao Pang +1

    cs.CVcs.AIcs.ROarXiv:2104.10956v32021
  14. HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

    Jiayue Pu, Zhongxiang Sun, Zilu Zhang +2

    cs.CVcs.AIcs.CRarXiv:2603.11975v22026
  15. One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers

    Moayed Haji-Ali, Willi Menapace, Ivan Skorokhodov +6

    cs.CVarXiv:2603.12245v12026
  16. Audio-Visual Scene Analysis with Self-Supervised Multisensory Features

    Andrew Owens, Alexei A. Efros

    cs.CVcs.SDeess.ASarXiv:1804.03641v22018
  17. Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026

    Luca Rossetto, Werner Bailer, Cathal Gurrin +5

    cs.CVcs.MMarXiv:2608.22914v12026
  18. FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation

    Jing Zuo, Lingzhou Mu, Fan Jiang +3

    cs.CVcs.ROarXiv:2601.13976v22026
  19. MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

    Zhekai Chen, Yuqing Wang, Manyuan Zhang +1

    cs.CVarXiv:2603.25319v12026
  20. cGANs with Projection Discriminator

    Takeru Miyato, Masanori Koyama

    cs.LGcs.CVstat.MLarXiv:1802.05637v22018
  21. VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents

    Udi Barzelay, Ophir Azulai, Inbar Shapira +4

    cs.CVarXiv:2603.15118v22026
  22. SegviGen: Repurposing 3D Generative Model for Part Segmentation

    Lin Li, Haoran Feng, Zehuan Huang +8

    cs.CVarXiv:2603.16869v32026
  23. High-Resolution Image Inpainting using Multi-Scale Neural Patch Synthesis

    Chao Yang, Xin Lu, Zhe Lin +3

    cs.CVarXiv:1611.09969v22016
  24. DoubleU-Net: A Deep Convolutional Neural Network for Medical Image Segmentation

    Debesh Jha, Michael A. Riegler, Dag Johansen +2

    eess.IVcs.CVarXiv:2006.04868v22020
  25. EfficientViT: Memory Efficient Vision Transformer with Cascaded Group Attention

    Xinyu Liu, Houwen Peng, Ningxin Zheng +3

    cs.CVarXiv:2305.07027v12023
  26. Automatic segmentation of MR brain images with a convolutional neural network

    Pim Moeskops, Max A. Viergever, Adriënne M. Mendrik +3

    cs.CVarXiv:1704.03295v12017
  27. Towards Comprehensive Basketball Understanding

    Yirong Hu, Jiayuan Rao, Yu Zhang +2

    cs.CVcs.AIarXiv:2608.23435v12026
  28. Ocean: Object-aware Anchor-free Tracking

    Zhipeng Zhang, Houwen Peng, Jianlong Fu +2

    cs.CVarXiv:2006.10721v22020
  29. FCNs in the Wild: Pixel-level Adversarial and Constraint-based Adaptation

    Judy Hoffman, Dequan Wang, Fisher Yu +1

    cs.CVarXiv:1612.02649v12016
  30. SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation

    Jiongze Yu, Xiangbo Gao, Pooja Verlani +4

    cs.CVcs.AIarXiv:2603.16864v12026
  31. Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

    Yuhao Dong, Zuyan Liu, Shulin Tian +2

    cs.CVcs.AIcs.LGarXiv:2603.18118v12026
  32. Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

    Chenyang Gu, Mingyuan Zhang, Haozhe Xie +3

    cs.CVarXiv:2603.19227v12026
  33. Learning Spherical Occupancy Profiles for Multi-View 3D Reconstruction and Generation

    YiHsuan Tsai

    cs.CVarXiv:2608.23206v12026
  34. MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

    Haitian Li, Haozhe Xie, Junxiang Xu +3

    cs.CVarXiv:2603.19231v12026
  35. AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing

    Tianyu Liu, Weitao Xiong, Kunming Luo +4

    cs.CVarXiv:2603.26546v32026
  36. Neural Fields in Visual Computing and Beyond

    Yiheng Xie, Towaki Takikawa, Shunsuke Saito +7

    cs.CVcs.GRcs.LGarXiv:2111.11426v42021
  37. CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

    Chao Wang, Xudong Tan, Jianjian Cao +2

    cs.CVarXiv:2603.19571v12026
  38. Learning Lane Graph Representations for Motion Forecasting

    Ming Liang, Bin Yang, Rui Hu +4

    cs.CVarXiv:2007.13732v12020
  39. OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

    Alperen Avan, Jordi Sanchez-Riera

    cs.ROcs.CVarXiv:2608.23354v12026
  40. HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation

    Bowen Cheng, Bin Xiao, Jingdong Wang +3

    cs.CVcs.LGeess.IVarXiv:1908.10357v32019
  41. Extract Free Dense Labels from CLIP

    Chong Zhou, Chen Change Loy, Bo Dai

    cs.CVcs.CLarXiv:2112.01071v22021
  42. LagrangeGS: Non-Conservative Lagrangian System on Dynamic 3D Gaussian Splatting

    Shogo Sato, Takuhiro Kaneko, Shoichiro Takeda +4

    cs.CVarXiv:2608.22773v12026
  43. VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding

    Hu Xu, Gargi Ghosh, Po-Yao Huang +5

    cs.CVcs.CLarXiv:2109.14084v22021
  44. High Speed and High Dynamic Range Video with an Event Camera

    Henri Rebecq, René Ranftl, Vladlen Koltun +1

    cs.CVarXiv:1906.07165v12019
  45. Improving Unsupervised Defect Segmentation by Applying Structural Similarity to Autoencoders

    Paul Bergmann, Sindy Löwe, Michael Fauser +2

    cs.CVcs.LGarXiv:1807.02011v32018
  46. Is Faster R-CNN Doing Well for Pedestrian Detection?

    Liliang Zhang, Liang Lin, Xiaodan Liang +1

    cs.CVarXiv:1607.07032v22016
  47. Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing

    Xiaolu Liu, Yicong Li, Qiyuan He +4

    cs.CVarXiv:2601.14103v12026
  48. Single Image Super-Resolution via a Holistic Attention Network

    Ben Niu, Weilei Wen, Wenqi Ren +6

    eess.IVcs.CVarXiv:2008.08767v12020
  49. Large-Small Model Collaboration for Zero-Shot Surgical Phase Recognition

    Yiyi Zhang, Ying Zheng, Wenxin Fan +5

    cs.CVarXiv:2608.22879v12026
  50. Variable Rate Image Compression with Recurrent Neural Networks

    George Toderici, Sean M. O'Malley, Sung Jin Hwang +5

    cs.CVcs.LGcs.NEarXiv:1511.06085v52015
  51. Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments

    Antoni Valls, Jordi Sanchez-Riera

    cs.CVarXiv:2608.23290v12026
  52. WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

    Runjie Zhou, Youbo Shao, Haoyu Lu +16

    cs.CVcs.LGarXiv:2602.02537v12026
  53. An Attention Enhanced Graph Convolutional LSTM Network for Skeleton-Based Action Recognition

    Chenyang Si, Wentao Chen, Wei Wang +2

    cs.CVarXiv:1902.09130v22019
  54. ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes

    Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner +1

    cs.CVarXiv:2308.11417v12023
  55. MovieQA: Understanding Stories in Movies through Question-Answering

    Makarand Tapaswi, Yukun Zhu, Rainer Stiefelhagen +3

    cs.CVcs.CLarXiv:1512.02902v22015
  56. AttGAN: Facial Attribute Editing by Only Changing What You Want

    Zhenliang He, Wangmeng Zuo, Meina Kan +2

    cs.CVstat.MLarXiv:1711.10678v32017
  57. Aligning Agentic World Models via Knowledgeable Experience Learning

    Baochang Ren, Yunzhi Yao, Rui Sun +3

    cs.CLcs.AIcs.CVarXiv:2601.13247v12026
  58. Semantic3D.net: A new Large-scale Point Cloud Classification Benchmark

    Timo Hackel, Nikolay Savinov, Lubor Ladicky +3

    cs.CVcs.LGcs.NEarXiv:1704.03847v12017
  59. Salient Object Detection: A Survey

    Ali Borji, Ming-Ming Cheng, Qibin Hou +2

    cs.CVcs.AIq-bio.NCarXiv:1411.5878v62014
  60. The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

    Chenyu Mu, Xin He, Qu Yang +13

    cs.CVcs.AIarXiv:2601.17737v32026