Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,601 to 15,660 of 18,855

  1. Neural Fields in Visual Computing and Beyond

    Yiheng Xie, Towaki Takikawa, Shunsuke Saito +7

    cs.CVcs.GRcs.LGarXiv:2111.11426v42021
  2. CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

    Chao Wang, Xudong Tan, Jianjian Cao +2

    cs.CVarXiv:2603.19571v12026
  3. Learning Lane Graph Representations for Motion Forecasting

    Ming Liang, Bin Yang, Rui Hu +4

    cs.CVarXiv:2007.13732v12020
  4. OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

    Alperen Avan, Jordi Sanchez-Riera

    cs.ROcs.CVarXiv:2608.23354v12026
  5. HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation

    Bowen Cheng, Bin Xiao, Jingdong Wang +3

    cs.CVcs.LGeess.IVarXiv:1908.10357v32019
  6. Extract Free Dense Labels from CLIP

    Chong Zhou, Chen Change Loy, Bo Dai

    cs.CVcs.CLarXiv:2112.01071v22021
  7. LagrangeGS: Non-Conservative Lagrangian System on Dynamic 3D Gaussian Splatting

    Shogo Sato, Takuhiro Kaneko, Shoichiro Takeda +4

    cs.CVarXiv:2608.22773v12026
  8. VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding

    Hu Xu, Gargi Ghosh, Po-Yao Huang +5

    cs.CVcs.CLarXiv:2109.14084v22021
  9. High Speed and High Dynamic Range Video with an Event Camera

    Henri Rebecq, René Ranftl, Vladlen Koltun +1

    cs.CVarXiv:1906.07165v12019
  10. Improving Unsupervised Defect Segmentation by Applying Structural Similarity to Autoencoders

    Paul Bergmann, Sindy Löwe, Michael Fauser +2

    cs.CVcs.LGarXiv:1807.02011v32018
  11. Is Faster R-CNN Doing Well for Pedestrian Detection?

    Liliang Zhang, Liang Lin, Xiaodan Liang +1

    cs.CVarXiv:1607.07032v22016
  12. Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing

    Xiaolu Liu, Yicong Li, Qiyuan He +4

    cs.CVarXiv:2601.14103v12026
  13. Single Image Super-Resolution via a Holistic Attention Network

    Ben Niu, Weilei Wen, Wenqi Ren +6

    eess.IVcs.CVarXiv:2008.08767v12020
  14. Large-Small Model Collaboration for Zero-Shot Surgical Phase Recognition

    Yiyi Zhang, Ying Zheng, Wenxin Fan +5

    cs.CVarXiv:2608.22879v12026
  15. Variable Rate Image Compression with Recurrent Neural Networks

    George Toderici, Sean M. O'Malley, Sung Jin Hwang +5

    cs.CVcs.LGcs.NEarXiv:1511.06085v52015
  16. Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments

    Antoni Valls, Jordi Sanchez-Riera

    cs.CVarXiv:2608.23290v12026
  17. WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

    Runjie Zhou, Youbo Shao, Haoyu Lu +16

    cs.CVcs.LGarXiv:2602.02537v12026
  18. An Attention Enhanced Graph Convolutional LSTM Network for Skeleton-Based Action Recognition

    Chenyang Si, Wentao Chen, Wei Wang +2

    cs.CVarXiv:1902.09130v22019
  19. ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes

    Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner +1

    cs.CVarXiv:2308.11417v12023
  20. MovieQA: Understanding Stories in Movies through Question-Answering

    Makarand Tapaswi, Yukun Zhu, Rainer Stiefelhagen +3

    cs.CVcs.CLarXiv:1512.02902v22015
  21. AttGAN: Facial Attribute Editing by Only Changing What You Want

    Zhenliang He, Wangmeng Zuo, Meina Kan +2

    cs.CVstat.MLarXiv:1711.10678v32017
  22. Aligning Agentic World Models via Knowledgeable Experience Learning

    Baochang Ren, Yunzhi Yao, Rui Sun +3

    cs.CLcs.AIcs.CVarXiv:2601.13247v12026
  23. Semantic3D.net: A new Large-scale Point Cloud Classification Benchmark

    Timo Hackel, Nikolay Savinov, Lubor Ladicky +3

    cs.CVcs.LGcs.NEarXiv:1704.03847v12017
  24. Salient Object Detection: A Survey

    Ali Borji, Ming-Ming Cheng, Qibin Hou +2

    cs.CVcs.AIq-bio.NCarXiv:1411.5878v62014
  25. The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

    Chenyu Mu, Xin He, Qu Yang +13

    cs.CVcs.AIarXiv:2601.17737v32026
  26. LoViF 2026 The First Challenge on Unified Removal of Raindrops and Reflections: Methods and Results

    Zewei He, Xi Tong, Yu Chen +49

    cs.CVarXiv:2608.22723v12026
  27. Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution

    Yiyi Zhang, Yuchen Yuan, Ying Zheng +4

    cs.CVarXiv:2608.22972v12026
  28. SEGCloud: Semantic Segmentation of 3D Point Clouds

    Lyne P. Tchapmi, Christopher B. Choy, Iro Armeni +2

    cs.CVarXiv:1710.07563v12017
  29. PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

    Junxian Li, Kai Liu, Leyang Chen +7

    cs.CVarXiv:2602.06663v22026
  30. Scale-aware Fast R-CNN for Pedestrian Detection

    Jianan Li, Xiaodan Liang, ShengMei Shen +3

    cs.CVarXiv:1510.08160v32015
  31. Learning Deep Structure-Preserving Image-Text Embeddings

    Liwei Wang, Yin Li, Svetlana Lazebnik

    cs.CVcs.CLcs.LGarXiv:1511.06078v22015
  32. Learning Loss for Active Learning

    Donggeun Yoo, In So Kweon

    cs.CVcs.LGarXiv:1905.03677v12019
  33. Predicting brain age with deep learning from raw imaging data results in a reliable and heritable biomarker

    James H Cole, Rudra PK Poudel, Dimosthenis Tsagkrasoulis +4

    stat.MLcs.CVcs.LGarXiv:1612.02572v12016
  34. Make Geometry Matter for Spatial Reasoning

    Shihua Zhang, Qiuhong Shen, Shizun Wang +2

    cs.CVcs.AIarXiv:2603.26639v12026
  35. Composition Loss for Counting, Density Map Estimation and Localization in Dense Crowds

    Haroon Idrees, Muhmmad Tayyab, Kishan Athrey +4

    cs.CVarXiv:1808.01050v12018
  36. MOOZY: A Patient-First Foundation Model for Computational Pathology

    Yousef Kotp, Vincent Quoc-Huy Trinh, Christopher Pal +1

    cs.CVarXiv:2603.27048v32026
  37. Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

    Wenqi Liu, Shijie Ma, Yunxiao Wang +18

    cs.CVcs.AIarXiv:2608.23329v12026
  38. SegNet: A Deep Convolutional Encoder-Decoder Architecture for Robust Semantic Pixel-Wise Labelling

    Vijay Badrinarayanan, Ankur Handa, Roberto Cipolla

    cs.CVarXiv:1505.07293v12015
  39. KonIQ-10k: An ecologically valid database for deep learning of blind image quality assessment

    Vlad Hosu, Hanhe Lin, Tamas Sziranyi +1

    cs.CVcs.MMarXiv:1910.06180v22019
  40. Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

    Yunze Tong, Mushui Liu, Canyu Zhao +7

    cs.CVarXiv:2602.06422v22026
  41. SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

    Niccolo Avogaro, Nayanika Debnath, Li Mi +6

    cs.CVcs.AIcs.CLarXiv:2602.06566v32026
  42. Axial-DeepLab: Stand-Alone Axial-Attention for Panoptic Segmentation

    Huiyu Wang, Yukun Zhu, Bradley Green +3

    cs.CVcs.LGarXiv:2003.07853v22020
  43. Pose-driven Deep Convolutional Model for Person Re-identification

    Chi Su, Jianing Li, Shiliang Zhang +3

    cs.CVarXiv:1709.08325v12017
  44. Optimizing Few-Step Generation with Adaptive Matching Distillation

    Lichen Bai, Zikai Zhou, Shitong Shao +5

    cs.CVcs.LGarXiv:2602.07345v22026
  45. CogAgent: A Visual Language Model for GUI Agents

    Wenyi Hong, Weihan Wang, Qingsong Lv +11

    cs.CVarXiv:2312.08914v32023
  46. PointFlow: 3D Point Cloud Generation with Continuous Normalizing Flows

    Guandao Yang, Xun Huang, Zekun Hao +3

    cs.CVcs.LGarXiv:1906.12320v32019
  47. LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

    Shufan Li, Yuchen Zhu, Jiuxiang Gu +6

    cs.CVarXiv:2602.14147v22026
  48. Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

    Sen Ye, Mengde Xu, Shuyang Gu +3

    cs.CVcs.AIarXiv:2602.15772v22026
  49. Multi-Scale Progressive Fusion Network for Single Image Deraining

    Kui Jiang, Zhongyuan Wang, Peng Yi +5

    cs.CVcs.LGeess.IVarXiv:2003.10985v22020
  50. DreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learning

    Mingshuang Luo, Shuang Liang, Zhengkun Rong +7

    cs.CVcs.AIarXiv:2601.21716v12026
  51. An Analysis of Scale Invariance in Object Detection - SNIP

    Bharat Singh, Larry S. Davis

    cs.CVarXiv:1711.08189v22017
  52. Few-Shot Learning via Embedding Adaptation with Set-to-Set Functions

    Han-Jia Ye, Hexiang Hu, De-Chuan Zhan +1

    cs.LGcs.CVarXiv:1812.03664v62018
  53. Controllable blind deblurring with diffusion models

    Imane Si Salah, Emile Cribelier, Thomas Veit +2

    cs.CVarXiv:2608.23343v12026
  54. Neural Operator based Multi-Field Reconstruction of Inner Solar Boundary State

    Vignesh Kumar Pandian Sathia, Reza Mansouri, Dustin J. Kempton +2

    cs.LGastro-ph.IMastro-ph.SRarXiv:2608.22782v12026
  55. Geometric Autoencoder for Diffusion Models

    Hangyu Liu, Jianyong Wang, Yutao Sun

    cs.CVarXiv:2603.10365v22026
  56. Using Pre-Training Can Improve Model Robustness and Uncertainty

    Dan Hendrycks, Kimin Lee, Mantas Mazeika

    cs.LGcs.CVstat.MLarXiv:1901.09960v52019
  57. Wonder3D: Single Image to 3D using Cross-Domain Diffusion

    Xiaoxiao Long, Yuan-Chen Guo, Cheng Lin +8

    cs.CVarXiv:2310.15008v32023
  58. MambaIR: A Simple Baseline for Image Restoration with State-Space Model

    Hang Guo, Jinmin Li, Tao Dai +3

    cs.CVarXiv:2402.15648v32024
  59. Grounding Free-Form Instructions for Fashion Complementary Image Generation

    Matteo Attimonelli, Claudio Pomo, Alessandro De Bellis +3

    cs.CVarXiv:2608.23302v12026
  60. DF-MoE: Generalizable Deepfake Detection via Multimodal Sparse Mixture-of-Experts

    Vlad Hondru, Florinel Alin Croitoru, Iuliana Georgescu +2

    cs.CVcs.AIcs.LGarXiv:2608.23363v12026