Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,601 to 15,660 of 18,855
Neural Fields in Visual Computing and Beyond
Yiheng Xie, Towaki Takikawa, Shunsuke Saito +7
cs.CVcs.GRcs.LGarXiv:2111.11426v42021CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
Chao Wang, Xudong Tan, Jianjian Cao +2
cs.CVarXiv:2603.19571v12026Learning Lane Graph Representations for Motion Forecasting
Ming Liang, Bin Yang, Rui Hu +4
cs.CVarXiv:2007.13732v12020OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
Alperen Avan, Jordi Sanchez-Riera
cs.ROcs.CVarXiv:2608.23354v12026HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation
Bowen Cheng, Bin Xiao, Jingdong Wang +3
cs.CVcs.LGeess.IVarXiv:1908.10357v32019Extract Free Dense Labels from CLIP
Chong Zhou, Chen Change Loy, Bo Dai
cs.CVcs.CLarXiv:2112.01071v22021LagrangeGS: Non-Conservative Lagrangian System on Dynamic 3D Gaussian Splatting
Shogo Sato, Takuhiro Kaneko, Shoichiro Takeda +4
cs.CVarXiv:2608.22773v12026VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding
Hu Xu, Gargi Ghosh, Po-Yao Huang +5
cs.CVcs.CLarXiv:2109.14084v22021High Speed and High Dynamic Range Video with an Event Camera
Henri Rebecq, René Ranftl, Vladlen Koltun +1
cs.CVarXiv:1906.07165v12019Improving Unsupervised Defect Segmentation by Applying Structural Similarity to Autoencoders
Paul Bergmann, Sindy Löwe, Michael Fauser +2
cs.CVcs.LGarXiv:1807.02011v32018Is Faster R-CNN Doing Well for Pedestrian Detection?
Liliang Zhang, Liang Lin, Xiaodan Liang +1
cs.CVarXiv:1607.07032v22016Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing
Xiaolu Liu, Yicong Li, Qiyuan He +4
cs.CVarXiv:2601.14103v12026Single Image Super-Resolution via a Holistic Attention Network
Ben Niu, Weilei Wen, Wenqi Ren +6
eess.IVcs.CVarXiv:2008.08767v12020Large-Small Model Collaboration for Zero-Shot Surgical Phase Recognition
Yiyi Zhang, Ying Zheng, Wenxin Fan +5
cs.CVarXiv:2608.22879v12026Variable Rate Image Compression with Recurrent Neural Networks
George Toderici, Sean M. O'Malley, Sung Jin Hwang +5
cs.CVcs.LGcs.NEarXiv:1511.06085v52015Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments
Antoni Valls, Jordi Sanchez-Riera
cs.CVarXiv:2608.23290v12026WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
Runjie Zhou, Youbo Shao, Haoyu Lu +16
cs.CVcs.LGarXiv:2602.02537v12026An Attention Enhanced Graph Convolutional LSTM Network for Skeleton-Based Action Recognition
Chenyang Si, Wentao Chen, Wei Wang +2
cs.CVarXiv:1902.09130v22019ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes
Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner +1
cs.CVarXiv:2308.11417v12023MovieQA: Understanding Stories in Movies through Question-Answering
Makarand Tapaswi, Yukun Zhu, Rainer Stiefelhagen +3
cs.CVcs.CLarXiv:1512.02902v22015AttGAN: Facial Attribute Editing by Only Changing What You Want
Zhenliang He, Wangmeng Zuo, Meina Kan +2
cs.CVstat.MLarXiv:1711.10678v32017Aligning Agentic World Models via Knowledgeable Experience Learning
Baochang Ren, Yunzhi Yao, Rui Sun +3
cs.CLcs.AIcs.CVarXiv:2601.13247v12026Semantic3D.net: A new Large-scale Point Cloud Classification Benchmark
Timo Hackel, Nikolay Savinov, Lubor Ladicky +3
cs.CVcs.LGcs.NEarXiv:1704.03847v12017Salient Object Detection: A Survey
Ali Borji, Ming-Ming Cheng, Qibin Hou +2
cs.CVcs.AIq-bio.NCarXiv:1411.5878v62014The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation
Chenyu Mu, Xin He, Qu Yang +13
cs.CVcs.AIarXiv:2601.17737v32026LoViF 2026 The First Challenge on Unified Removal of Raindrops and Reflections: Methods and Results
Zewei He, Xi Tong, Yu Chen +49
cs.CVarXiv:2608.22723v12026Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution
Yiyi Zhang, Yuchen Yuan, Ying Zheng +4
cs.CVarXiv:2608.22972v12026SEGCloud: Semantic Segmentation of 3D Point Clouds
Lyne P. Tchapmi, Christopher B. Choy, Iro Armeni +2
cs.CVarXiv:1710.07563v12017PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks
Junxian Li, Kai Liu, Leyang Chen +7
cs.CVarXiv:2602.06663v22026Scale-aware Fast R-CNN for Pedestrian Detection
Jianan Li, Xiaodan Liang, ShengMei Shen +3
cs.CVarXiv:1510.08160v32015Learning Deep Structure-Preserving Image-Text Embeddings
Liwei Wang, Yin Li, Svetlana Lazebnik
cs.CVcs.CLcs.LGarXiv:1511.06078v22015Learning Loss for Active Learning
Donggeun Yoo, In So Kweon
cs.CVcs.LGarXiv:1905.03677v12019Predicting brain age with deep learning from raw imaging data results in a reliable and heritable biomarker
James H Cole, Rudra PK Poudel, Dimosthenis Tsagkrasoulis +4
stat.MLcs.CVcs.LGarXiv:1612.02572v12016Make Geometry Matter for Spatial Reasoning
Shihua Zhang, Qiuhong Shen, Shizun Wang +2
cs.CVcs.AIarXiv:2603.26639v12026Composition Loss for Counting, Density Map Estimation and Localization in Dense Crowds
Haroon Idrees, Muhmmad Tayyab, Kishan Athrey +4
cs.CVarXiv:1808.01050v12018MOOZY: A Patient-First Foundation Model for Computational Pathology
Yousef Kotp, Vincent Quoc-Huy Trinh, Christopher Pal +1
cs.CVarXiv:2603.27048v32026Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
Wenqi Liu, Shijie Ma, Yunxiao Wang +18
cs.CVcs.AIarXiv:2608.23329v12026SegNet: A Deep Convolutional Encoder-Decoder Architecture for Robust Semantic Pixel-Wise Labelling
Vijay Badrinarayanan, Ankur Handa, Roberto Cipolla
cs.CVarXiv:1505.07293v12015KonIQ-10k: An ecologically valid database for deep learning of blind image quality assessment
Vlad Hosu, Hanhe Lin, Tamas Sziranyi +1
cs.CVcs.MMarXiv:1910.06180v22019Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
Yunze Tong, Mushui Liu, Canyu Zhao +7
cs.CVarXiv:2602.06422v22026SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
Niccolo Avogaro, Nayanika Debnath, Li Mi +6
cs.CVcs.AIcs.CLarXiv:2602.06566v32026Axial-DeepLab: Stand-Alone Axial-Attention for Panoptic Segmentation
Huiyu Wang, Yukun Zhu, Bradley Green +3
cs.CVcs.LGarXiv:2003.07853v22020Pose-driven Deep Convolutional Model for Person Re-identification
Chi Su, Jianing Li, Shiliang Zhang +3
cs.CVarXiv:1709.08325v12017Optimizing Few-Step Generation with Adaptive Matching Distillation
Lichen Bai, Zikai Zhou, Shitong Shao +5
cs.CVcs.LGarXiv:2602.07345v22026CogAgent: A Visual Language Model for GUI Agents
Wenyi Hong, Weihan Wang, Qingsong Lv +11
cs.CVarXiv:2312.08914v32023PointFlow: 3D Point Cloud Generation with Continuous Normalizing Flows
Guandao Yang, Xun Huang, Zekun Hao +3
cs.CVcs.LGarXiv:1906.12320v32019LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
Shufan Li, Yuchen Zhu, Jiuxiang Gu +6
cs.CVarXiv:2602.14147v22026Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
Sen Ye, Mengde Xu, Shuyang Gu +3
cs.CVcs.AIarXiv:2602.15772v22026Multi-Scale Progressive Fusion Network for Single Image Deraining
Kui Jiang, Zhongyuan Wang, Peng Yi +5
cs.CVcs.LGeess.IVarXiv:2003.10985v22020DreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learning
Mingshuang Luo, Shuang Liang, Zhengkun Rong +7
cs.CVcs.AIarXiv:2601.21716v12026An Analysis of Scale Invariance in Object Detection - SNIP
Bharat Singh, Larry S. Davis
cs.CVarXiv:1711.08189v22017Few-Shot Learning via Embedding Adaptation with Set-to-Set Functions
Han-Jia Ye, Hexiang Hu, De-Chuan Zhan +1
cs.LGcs.CVarXiv:1812.03664v62018Controllable blind deblurring with diffusion models
Imane Si Salah, Emile Cribelier, Thomas Veit +2
cs.CVarXiv:2608.23343v12026Neural Operator based Multi-Field Reconstruction of Inner Solar Boundary State
Vignesh Kumar Pandian Sathia, Reza Mansouri, Dustin J. Kempton +2
cs.LGastro-ph.IMastro-ph.SRarXiv:2608.22782v12026Geometric Autoencoder for Diffusion Models
Hangyu Liu, Jianyong Wang, Yutao Sun
cs.CVarXiv:2603.10365v22026Using Pre-Training Can Improve Model Robustness and Uncertainty
Dan Hendrycks, Kimin Lee, Mantas Mazeika
cs.LGcs.CVstat.MLarXiv:1901.09960v52019Wonder3D: Single Image to 3D using Cross-Domain Diffusion
Xiaoxiao Long, Yuan-Chen Guo, Cheng Lin +8
cs.CVarXiv:2310.15008v32023MambaIR: A Simple Baseline for Image Restoration with State-Space Model
Hang Guo, Jinmin Li, Tao Dai +3
cs.CVarXiv:2402.15648v32024Grounding Free-Form Instructions for Fashion Complementary Image Generation
Matteo Attimonelli, Claudio Pomo, Alessandro De Bellis +3
cs.CVarXiv:2608.23302v12026DF-MoE: Generalizable Deepfake Detection via Multimodal Sparse Mixture-of-Experts
Vlad Hondru, Florinel Alin Croitoru, Iuliana Georgescu +2
cs.CVcs.AIcs.LGarXiv:2608.23363v12026