Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,541 to 15,600 of 18,830
Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content Creation
Rui Chen, Yongwei Chen, Ningxin Jiao +1
cs.CVcs.AIarXiv:2303.13873v32023Region Attention Networks for Pose and Occlusion Robust Facial Expression Recognition
Kai Wang, Xiaojiang Peng, Jianfei Yang +2
cs.CVarXiv:1905.04075v22019RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
Songming Liu, Lingxuan Wu, Bangguo Li +6
cs.ROcs.AIcs.CVarXiv:2410.07864v22024Feedback Network for Image Super-Resolution
Zhen Li, Jinglei Yang, Zheng Liu +3
cs.CVarXiv:1903.09814v22019ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
Aviad Dahan, Moran Yanuka, Noa Kraicer +2
cs.SDcs.CVcs.GRarXiv:2603.10256v12026OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang +1
cs.CVarXiv:2601.09575v12026V-Bridge: Bridging Video Generative Priors to Versatile Few-shot Image Restoration
Shenghe Zheng, Junpeng Jiang, Wenbo Li
cs.CVarXiv:2603.13089v12026Deep Semantic Segmentation of Natural and Medical Images: A Review
Saeid Asgari Taghanaki, Kumar Abhishek, Joseph Paul Cohen +2
cs.CVcs.LGeess.IVarXiv:1910.07655v42019Remote Sensing Image Scene Classification Meets Deep Learning: Challenges, Methods, Benchmarks, and Opportunities
Gong Cheng, Xingxing Xie, Junwei Han +2
cs.CVarXiv:2005.01094v22020Learning Self-Correction in Vision-Language Models via Rollout Augmentation
Yi Ding, Ziliang Qiu, Bolian Li +1
cs.CVcs.CLcs.LGarXiv:2602.08503v22026The Application of Two-level Attention Models in Deep Convolutional Neural Network for Fine-grained Image Classification
Tianjun Xiao, Yichong Xu, Kuiyuan Yang +3
cs.CVarXiv:1411.6447v12014CodePercept: Code-Grounded Visual STEM Perception for MLLMs
Tongkun Guan, Zhibo Yang, Jianqiang Wan +10
cs.CVarXiv:2603.10757v22026FCOS3D: Fully Convolutional One-Stage Monocular 3D Object Detection
Tai Wang, Xinge Zhu, Jiangmiao Pang +1
cs.CVcs.AIcs.ROarXiv:2104.10956v32021HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios
Jiayue Pu, Zhongxiang Sun, Zilu Zhang +2
cs.CVcs.AIcs.CRarXiv:2603.11975v22026One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
Moayed Haji-Ali, Willi Menapace, Ivan Skorokhodov +6
cs.CVarXiv:2603.12245v12026Audio-Visual Scene Analysis with Self-Supervised Multisensory Features
Andrew Owens, Alexei A. Efros
cs.CVcs.SDeess.ASarXiv:1804.03641v22018Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026
Luca Rossetto, Werner Bailer, Cathal Gurrin +5
cs.CVcs.MMarXiv:2608.22914v12026FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
Jing Zuo, Lingzhou Mu, Fan Jiang +3
cs.CVcs.ROarXiv:2601.13976v22026MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data
Zhekai Chen, Yuqing Wang, Manyuan Zhang +1
cs.CVarXiv:2603.25319v12026cGANs with Projection Discriminator
Takeru Miyato, Masanori Koyama
cs.LGcs.CVstat.MLarXiv:1802.05637v22018VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents
Udi Barzelay, Ophir Azulai, Inbar Shapira +4
cs.CVarXiv:2603.15118v22026SegviGen: Repurposing 3D Generative Model for Part Segmentation
Lin Li, Haoran Feng, Zehuan Huang +8
cs.CVarXiv:2603.16869v32026High-Resolution Image Inpainting using Multi-Scale Neural Patch Synthesis
Chao Yang, Xin Lu, Zhe Lin +3
cs.CVarXiv:1611.09969v22016DoubleU-Net: A Deep Convolutional Neural Network for Medical Image Segmentation
Debesh Jha, Michael A. Riegler, Dag Johansen +2
eess.IVcs.CVarXiv:2006.04868v22020EfficientViT: Memory Efficient Vision Transformer with Cascaded Group Attention
Xinyu Liu, Houwen Peng, Ningxin Zheng +3
cs.CVarXiv:2305.07027v12023Automatic segmentation of MR brain images with a convolutional neural network
Pim Moeskops, Max A. Viergever, Adriënne M. Mendrik +3
cs.CVarXiv:1704.03295v12017Towards Comprehensive Basketball Understanding
Yirong Hu, Jiayuan Rao, Yu Zhang +2
cs.CVcs.AIarXiv:2608.23435v12026Ocean: Object-aware Anchor-free Tracking
Zhipeng Zhang, Houwen Peng, Jianlong Fu +2
cs.CVarXiv:2006.10721v22020FCNs in the Wild: Pixel-level Adversarial and Constraint-based Adaptation
Judy Hoffman, Dequan Wang, Fisher Yu +1
cs.CVarXiv:1612.02649v12016SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
Jiongze Yu, Xiangbo Gao, Pooja Verlani +4
cs.CVcs.AIarXiv:2603.16864v12026Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
Yuhao Dong, Zuyan Liu, Shulin Tian +2
cs.CVcs.AIcs.LGarXiv:2603.18118v12026Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
Chenyang Gu, Mingyuan Zhang, Haozhe Xie +3
cs.CVarXiv:2603.19227v12026Learning Spherical Occupancy Profiles for Multi-View 3D Reconstruction and Generation
YiHsuan Tsai
cs.CVarXiv:2608.23206v12026MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
Haitian Li, Haozhe Xie, Junxiang Xu +3
cs.CVarXiv:2603.19231v12026AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing
Tianyu Liu, Weitao Xiong, Kunming Luo +4
cs.CVarXiv:2603.26546v32026Neural Fields in Visual Computing and Beyond
Yiheng Xie, Towaki Takikawa, Shunsuke Saito +7
cs.CVcs.GRcs.LGarXiv:2111.11426v42021CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
Chao Wang, Xudong Tan, Jianjian Cao +2
cs.CVarXiv:2603.19571v12026Learning Lane Graph Representations for Motion Forecasting
Ming Liang, Bin Yang, Rui Hu +4
cs.CVarXiv:2007.13732v12020OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
Alperen Avan, Jordi Sanchez-Riera
cs.ROcs.CVarXiv:2608.23354v12026HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation
Bowen Cheng, Bin Xiao, Jingdong Wang +3
cs.CVcs.LGeess.IVarXiv:1908.10357v32019Extract Free Dense Labels from CLIP
Chong Zhou, Chen Change Loy, Bo Dai
cs.CVcs.CLarXiv:2112.01071v22021LagrangeGS: Non-Conservative Lagrangian System on Dynamic 3D Gaussian Splatting
Shogo Sato, Takuhiro Kaneko, Shoichiro Takeda +4
cs.CVarXiv:2608.22773v12026VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding
Hu Xu, Gargi Ghosh, Po-Yao Huang +5
cs.CVcs.CLarXiv:2109.14084v22021High Speed and High Dynamic Range Video with an Event Camera
Henri Rebecq, René Ranftl, Vladlen Koltun +1
cs.CVarXiv:1906.07165v12019Improving Unsupervised Defect Segmentation by Applying Structural Similarity to Autoencoders
Paul Bergmann, Sindy Löwe, Michael Fauser +2
cs.CVcs.LGarXiv:1807.02011v32018Is Faster R-CNN Doing Well for Pedestrian Detection?
Liliang Zhang, Liang Lin, Xiaodan Liang +1
cs.CVarXiv:1607.07032v22016Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing
Xiaolu Liu, Yicong Li, Qiyuan He +4
cs.CVarXiv:2601.14103v12026Single Image Super-Resolution via a Holistic Attention Network
Ben Niu, Weilei Wen, Wenqi Ren +6
eess.IVcs.CVarXiv:2008.08767v12020Large-Small Model Collaboration for Zero-Shot Surgical Phase Recognition
Yiyi Zhang, Ying Zheng, Wenxin Fan +5
cs.CVarXiv:2608.22879v12026Variable Rate Image Compression with Recurrent Neural Networks
George Toderici, Sean M. O'Malley, Sung Jin Hwang +5
cs.CVcs.LGcs.NEarXiv:1511.06085v52015Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments
Antoni Valls, Jordi Sanchez-Riera
cs.CVarXiv:2608.23290v12026WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
Runjie Zhou, Youbo Shao, Haoyu Lu +16
cs.CVcs.LGarXiv:2602.02537v12026An Attention Enhanced Graph Convolutional LSTM Network for Skeleton-Based Action Recognition
Chenyang Si, Wentao Chen, Wei Wang +2
cs.CVarXiv:1902.09130v22019ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes
Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner +1
cs.CVarXiv:2308.11417v12023MovieQA: Understanding Stories in Movies through Question-Answering
Makarand Tapaswi, Yukun Zhu, Rainer Stiefelhagen +3
cs.CVcs.CLarXiv:1512.02902v22015AttGAN: Facial Attribute Editing by Only Changing What You Want
Zhenliang He, Wangmeng Zuo, Meina Kan +2
cs.CVstat.MLarXiv:1711.10678v32017Aligning Agentic World Models via Knowledgeable Experience Learning
Baochang Ren, Yunzhi Yao, Rui Sun +3
cs.CLcs.AIcs.CVarXiv:2601.13247v12026Semantic3D.net: A new Large-scale Point Cloud Classification Benchmark
Timo Hackel, Nikolay Savinov, Lubor Ladicky +3
cs.CVcs.LGcs.NEarXiv:1704.03847v12017Salient Object Detection: A Survey
Ali Borji, Ming-Ming Cheng, Qibin Hou +2
cs.CVcs.AIq-bio.NCarXiv:1411.5878v62014The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation
Chenyu Mu, Xin He, Qu Yang +13
cs.CVcs.AIarXiv:2601.17737v32026