Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,661 to 3,720 of 18,839

  1. DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving

    Shuyao Shang, Bing Zhan, Yunfei Yan +9

    cs.CVcs.ROarXiv:2603.11041v22026
  2. Diverse Weight Averaging for Out-of-Distribution Generalization

    Alexandre Ramé, Matthieu Kirchmeyer, Thibaud Rahier +3

    cs.CVcs.AIcs.LGarXiv:2205.09739v22022
  3. X-View: Graph-Based Semantic Multi-View Localization

    Abel Gawel, Carlo Del Don, Roland Siegwart +2

    cs.ROcs.CVarXiv:1709.09905v32017
  4. TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning

    Zhuo Chen, Shawn Young, Lijian Xu

    cs.CVcs.AIarXiv:2603.01143v12026
  5. Fully Convolutional Crowd Counting On Highly Congested Scenes

    Mark Marsden, Kevin McGuinness, Suzanne Little +1

    cs.CVarXiv:1612.00220v22016
  6. Lifelong Machine Learning with Deep Streaming Linear Discriminant Analysis

    Tyler L. Hayes, Christopher Kanan

    cs.LGcs.CVstat.MLarXiv:1909.01520v32019
  7. Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models

    Zhiqiu Lin, Samuel Yu, Zhiyi Kuang +2

    cs.CVcs.AIcs.LGarXiv:2301.06267v52023
  8. When NAS Meets Robustness: In Search of Robust Architectures against Adversarial Attacks

    Minghao Guo, Yuzhe Yang, Rui Xu +2

    cs.LGcs.CRcs.CVarXiv:1911.10695v32019
  9. Trans-SVNet: Accurate Phase Recognition from Surgical Videos via Hybrid Embedding Aggregation Transformer

    Xiaojie Gao, Yueming Jin, Yonghao Long +2

    cs.CVcs.AIarXiv:2103.09712v22021
  10. TransCenter: Transformers with Dense Representations for Multiple-Object Tracking

    Yihong Xu, Yutong Ban, Guillaume Delorme +3

    cs.CVarXiv:2103.15145v42021
  11. HF-NeuS: Improved Surface Reconstruction Using High-Frequency Details

    Yiqun Wang, Ivan Skorokhodov, Peter Wonka

    cs.CVcs.GRarXiv:2206.07850v22022
  12. Visual Question Generation as Dual Task of Visual Question Answering

    Yikang Li, Nan Duan, Bolei Zhou +3

    cs.CVarXiv:1709.07192v12017
  13. SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation

    Jiwen Zhang, Zejun Li, Siyuan Wang +3

    cs.CVcs.AIcs.ROarXiv:2601.06806v12026
  14. Context-Aware Trajectory Prediction

    Federico Bartoli, Giuseppe Lisanti, Lamberto Ballan +1

    cs.CVarXiv:1705.02503v12017
  15. TF-Blender: Temporal Feature Blender for Video Object Detection

    Yiming Cui, Liqi Yan, Zhiwen Cao +1

    cs.CVarXiv:2108.05821v12021
  16. ARM: Advantage Reward Modeling for Long-Horizon Manipulation

    Yiming Mao, Zixi Yu, Weixin Mao +5

    cs.ROcs.AIcs.CVarXiv:2604.03037v22026
  17. NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

    Huichao Zhang, Liao Qu, Yiheng Liu +33

    cs.CVcs.AIarXiv:2601.02204v12026
  18. 3D Human Pose Estimation in RGBD Images for Robotic Task Learning

    Christian Zimmermann, Tim Welschehold, Christian Dornhege +2

    cs.CVcs.ROarXiv:1803.02622v22018
  19. AutoFigure-Edit: Generating Editable Scientific Illustration

    Zhen Lin, Qiujie Xie, Minjun Zhu +10

    cs.CVcs.AIarXiv:2603.06674v12026
  20. Synthetic data generation for end-to-end thermal infrared tracking

    Lichao Zhang, Abel Gonzalez-Garcia, Joost van de Weijer +2

    cs.CVarXiv:1806.01013v22018
  21. Landslide4Sense: Reference Benchmark Data and Deep Learning Models for Landslide Detection

    Omid Ghorbanzadeh, Yonghao Xu, Pedram Ghamisi +2

    cs.CVeess.IVarXiv:2206.00515v32022
  22. SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning

    Minjun Kim, Jongjin Kim, U Kang

    cs.CVarXiv:2603.18423v12026
  23. Prostate Cancer Diagnosis using Deep Learning with 3D Multiparametric MRI

    Saifeng Liu, Huaixiu Zheng, Yesu Feng +1

    cs.CVstat.MLarXiv:1703.04078v12017
  24. Hierarchical Dense Correlation Distillation for Few-Shot Segmentation

    Bohao Peng, Zhuotao Tian, Xiaoyang Wu +4

    cs.CVcs.AIarXiv:2303.14652v12023
  25. AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots

    Likui Zhang, Tao Tang, Zhihao Zhan +9

    cs.ROcs.AIcs.CVarXiv:2603.07648v12026
  26. Self-Supervised Learning of Audio-Visual Objects from Video

    Triantafyllos Afouras, Andrew Owens, Joon Son Chung +1

    cs.CVcs.SDeess.ASarXiv:2008.04237v12020
  27. Online Video Deblurring via Dynamic Temporal Blending Network

    Tae Hyun Kim, Kyoung Mu Lee, Bernhard Schölkopf +1

    cs.CVarXiv:1704.03285v12017
  28. Full-Duplex Strategy for Video Object Segmentation

    Ge-Peng Ji, Deng-Ping Fan, Keren Fu +3

    cs.CVarXiv:2108.03151v32021
  29. LoMa: Local Feature Matching Revisited

    David Nordström, Johan Edstedt, Georg Bökman +6

    cs.CVarXiv:2604.04931v22026
  30. Deep Gaussian Scale Mixture Prior for Spectral Compressive Imaging

    Tao Huang, Weisheng Dong, Xin Yuan +2

    eess.IVcs.CVarXiv:2103.07152v22021
  31. Point Cloud Upsampling via Disentangled Refinement

    Ruihui Li, Xianzhi Li, Pheng-Ann Heng +1

    cs.CVarXiv:2106.04779v12021
  32. TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention

    Chuancheng Shi, Shangze Li, Wenjun Lu +5

    cs.CVcs.AIcs.CYarXiv:2601.21900v22026
  33. Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting

    Hao Feng, Wei Shi, Ke Zhang +9

    cs.CVarXiv:2602.05384v12026
  34. Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning

    Lili Yu, Bowen Shi, Ramakanth Pasunuru +24

    cs.LGcs.CLcs.CVarXiv:2309.02591v12023
  35. PF-LRM: Pose-Free Large Reconstruction Model for Joint Pose and Shape Prediction

    Peng Wang, Hao Tan, Sai Bi +6

    cs.CVarXiv:2311.12024v22023
  36. Deep DIC: Deep Learning-Based Digital Image Correlation for End-to-End Displacement and Strain Measurement

    Ru Yang, Yang Li, Danielle Zeng +1

    eess.IVcond-mat.mtrl-scics.CVarXiv:2110.13720v22021
  37. Contrastive and Non-Contrastive Self-Supervised Learning Recover Global and Local Spectral Embedding Methods

    Randall Balestriero, Yann LeCun

    cs.LGcs.AIcs.CVarXiv:2205.11508v32022
  38. RenderGAN: Generating Realistic Labeled Data

    Leon Sixt, Benjamin Wild, Tim Landgraf

    cs.NEcs.CVarXiv:1611.01331v52016
  39. Visually-Guided Policy Optimization for Multimodal Reasoning

    Zengbin Wang, Feng Xiong, Liang Lin +5

    cs.CVcs.AIcs.CLarXiv:2604.09349v22026
  40. Scale-Aware Modulation Meet Transformer

    Weifeng Lin, Ziheng Wu, Jiayu Chen +2

    cs.CVarXiv:2307.08579v22023
  41. E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models

    Shengjun Zhang, Zhang Zhang, Chensheng Dai +1

    cs.LGcs.AIcs.CVarXiv:2601.00423v12026
  42. Pixel-level Encoding and Depth Layering for Instance-level Semantic Labeling

    Jonas Uhrig, Marius Cordts, Uwe Franke +1

    cs.CVarXiv:1604.05096v22016
  43. Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

    Taekyung Ki, Sangwon Jang, Jaehyeong Jo +2

    cs.LGcs.AIcs.CVarXiv:2601.00664v22026
  44. VideoCapsuleNet: A Simplified Network for Action Detection

    Kevin Duarte, Yogesh S Rawat, Mubarak Shah

    cs.CVarXiv:1805.08162v12018
  45. Vision Transformers Need More Than Registers

    Cheng Shi, Yizhou Yu, Sibei Yang

    cs.CVarXiv:2602.22394v22026
  46. Visual prompting reimagined: The power of the Activation Prompts

    Yihua Zhang, Hongkang Li, Yuguang Yao +5

    cs.CVcs.LGarXiv:2604.06440v12026
  47. CentripetalNet: Pursuing High-quality Keypoint Pairs for Object Detection

    Zhiwei Dong, Guoxuan Li, Yue Liao +3

    cs.CVarXiv:2003.09119v12020
  48. Multimodal Transfer: A Hierarchical Deep Convolutional Neural Network for Fast Artistic Style Transfer

    Xin Wang, Geoffrey Oxholm, Da Zhang +1

    cs.CVcs.AIarXiv:1612.01895v22016
  49. LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

    Chong Cheng, Xianda Chen, Tao Xie +5

    cs.CVarXiv:2602.13172v22026
  50. Multiple Inputs and Mixwd data for Alzheimer's Disease Classification Based on 3D Vision Transformer

    Juan A. Castro-Silva, Maria N. Moreno Garcia, Diego H. Peluffo-Ordoñez

    cs.CVarXiv:2603.00545v12026
  51. How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study

    Simiao Ren, Yuchen Zhou, Xingyu Shen +9

    cs.CVcs.AIarXiv:2602.07814v12026
  52. Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures

    Yuxi Wang, Wenqi Ouyang, Tianyi Wei +3

    cs.CVarXiv:2602.09600v22026
  53. ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration

    Xu Zhang, Huan Zhang, Guoli Wang +2

    cs.CVarXiv:2601.02763v22026
  54. Video-based Person Re-identification with Accumulative Motion Context

    Hao Liu, Zequn Jie, Karlekar Jayashree +4

    cs.CVarXiv:1701.00193v22017
  55. No-Reference Quality Assessment for 3D Colored Point Cloud and Mesh Models

    Zicheng Zhang, Wei Sun, Xiongkuo Min +3

    cs.CVcs.GReess.IVarXiv:2107.02041v62021
  56. Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object Detection

    Jiageng Mao, Minzhe Niu, Haoyue Bai +3

    cs.CVarXiv:2109.02499v12021
  57. Speech2Face: Learning the Face Behind a Voice

    Tae-Hyun Oh, Tali Dekel, Changil Kim +4

    cs.CVcs.MMarXiv:1905.09773v12019
  58. SVIT: Scaling up Visual Instruction Tuning

    Bo Zhao, Boya Wu, Muyang He +1

    cs.CVarXiv:2307.04087v32023
  59. DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning

    Zhenyu Jiang, Yuqi Xie, Kevin Lin +5

    cs.ROcs.AIcs.CVarXiv:2410.24185v22024
  60. Neural Inverse Rendering of an Indoor Scene from a Single Image

    Soumyadip Sengupta, Jinwei Gu, Kihwan Kim +3

    cs.CVarXiv:1901.02453v32019