Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,201 to 16,260 of 18,855
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
Jie Liu, Zilyu Ye, Linxiao Yuan +8
cs.CVarXiv:2603.23500v12026GRAF: Generative Radiance Fields for 3D-Aware Image Synthesis
Katja Schwarz, Yiyi Liao, Michael Niemeyer +1
cs.CVarXiv:2007.02442v42020A Simple Pooling-Based Design for Real-Time Salient Object Detection
Jiang-Jiang Liu, Qibin Hou, Ming-Ming Cheng +2
cs.CVarXiv:1904.09569v12019Learning Deep Feature Representations with Domain Guided Dropout for Person Re-identification
Tong Xiao, Hongsheng Li, Wanli Ouyang +1
cs.CVarXiv:1604.07528v12016Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding
Zhongxing Xu, Zhonghua Wang, Zhe Qian +10
cs.CVcs.AIarXiv:2603.13366v12026Contrastive Adaptation Network for Unsupervised Domain Adaptation
Guoliang Kang, Lu Jiang, Yi Yang +1
cs.CVarXiv:1901.00976v22019Character Region Awareness for Text Detection
Youngmin Baek, Bado Lee, Dongyoon Han +2
cs.CVarXiv:1904.01941v12019KiloNeRF: Speeding up Neural Radiance Fields with Thousands of Tiny MLPs
Christian Reiser, Songyou Peng, Yiyi Liao +1
cs.CVarXiv:2103.13744v22021Attentional Feature Fusion
Yimian Dai, Fabian Gieseke, Stefan Oehmcke +2
cs.CVarXiv:2009.14082v22020OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation
Yuheng Liu, Xin Lin, Xinke Li +9
cs.CVarXiv:2603.30045v12026AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
Yibo Shi, Jungang Li, Linghao Zhang +25
cs.CVarXiv:2603.18429v12026Deep Modular Co-Attention Networks for Visual Question Answering
Zhou Yu, Jun Yu, Yuhao Cui +2
cs.CVarXiv:1906.10770v12019Fast Edge Detection Using Structured Forests
Piotr Dollár, C. Lawrence Zitnick
cs.CVarXiv:1406.5549v22014DoRA: Weight-Decomposed Low-Rank Adaptation
Shih-Yang Liu, Chien-Yi Wang, Hongxu Yin +4
cs.CLcs.CVarXiv:2402.09353v62024FLAVA: A Foundational Language And Vision Alignment Model
Amanpreet Singh, Ronghang Hu, Vedanuj Goswami +4
cs.CVcs.CLarXiv:2112.04482v32021Associative Embedding: End-to-End Learning for Joint Detection and Grouping
Alejandro Newell, Zhiao Huang, Jia Deng
cs.CVarXiv:1611.05424v22016UNeXt: MLP-based Rapid Medical Image Segmentation Network
Jeya Maria Jose Valanarasu, Vishal M. Patel
eess.IVcs.CVarXiv:2203.04967v12022The Little Engine that Could: Regularization by Denoising (RED)
Yaniv Romano, Michael Elad, Peyman Milanfar
cs.CVmath.NAarXiv:1611.02862v32016IBRNet: Learning Multi-View Image-Based Rendering
Qianqian Wang, Zhicheng Wang, Kyle Genova +6
cs.CVarXiv:2102.13090v22021Sparsity in Deep Learning: Pruning and growth for efficient inference and training in neural networks
Torsten Hoefler, Dan Alistarh, Tal Ben-Nun +2
cs.LGcs.AIcs.ARarXiv:2102.00554v12021Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention
Chengtao Lv, Yumeng Shi, Yushi Huang +3
cs.CVarXiv:2602.04789v42026Eye Tracking for Everyone
Kyle Krafka, Aditya Khosla, Petr Kellnhofer +4
cs.CVarXiv:1606.05814v12016Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions
Yunheng Li, Hengrui Zhang, Meng-Hao Guo +5
cs.CVarXiv:2602.13013v12026ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth
Shariq Farooq Bhat, Reiner Birkl, Diana Wofk +2
cs.CVarXiv:2302.12288v12023Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
Songchun Zhang, Zeyue Xue, Siming Fu +6
cs.CVarXiv:2603.17051v12026Multimodal Few-Shot Learning with Frozen Language Models
Maria Tsimpoukelli, Jacob Menick, Serkan Cabi +3
cs.CVcs.CLcs.LGarXiv:2106.13884v22021MosaicMem: Hybrid Spatial Memory for Controllable Video World Models
Wei Yu, Runjia Qian, Yumeng Li +8
cs.CVarXiv:2603.17117v12026Deep Learning for Identifying Metastatic Breast Cancer
Dayong Wang, Aditya Khosla, Rishab Gargeya +2
q-bio.QMcs.CVarXiv:1606.05718v12016Mode Seeking meets Mean Seeking for Fast Long Video Generation
Shengqu Cai, Weili Nie, Chao Liu +8
cs.CVcs.LGarXiv:2602.24289v12026EgoForge: Goal-Directed Egocentric World Simulator
Yifan Shen, Jiateng Liu, Xinzhuo Li +9
cs.CVcs.MMarXiv:2603.20169v12026Streaming Autoregressive Video Generation via Diagonal Distillation
Jinxiu Liu, Xuanming Liu, Kangfu Mei +3
cs.CVarXiv:2603.09488v22026LISA: Reasoning Segmentation via Large Language Model
Xin Lai, Zhuotao Tian, Yukang Chen +4
cs.CVarXiv:2308.00692v32023Rotate to Attend: Convolutional Triplet Attention Module
Diganta Misra, Trikay Nalamada, Ajay Uppili Arasanipalai +1
cs.CVarXiv:2010.03045v22020Training Diffusion Models with Reinforcement Learning
Kevin Black, Michael Janner, Yilun Du +2
cs.LGcs.AIcs.CVarXiv:2305.13301v42023BBN: Bilateral-Branch Network with Cumulative Learning for Long-Tailed Visual Recognition
Boyan Zhou, Quan Cui, Xiu-Shen Wei +1
cs.CVcs.LGarXiv:1912.02413v42019Deep Predictive Coding Networks for Video Prediction and Unsupervised Learning
William Lotter, Gabriel Kreiman, David Cox
cs.LGcs.AIcs.CVarXiv:1605.08104v52016Deep Learning-Based Human Pose Estimation: A Survey
Ce Zheng, Wenhan Wu, Chen Chen +5
cs.CVcs.GRcs.MMarXiv:2012.13392v52020Visual7W: Grounded Question Answering in Images
Yuke Zhu, Oliver Groth, Michael Bernstein +1
cs.CVcs.LGcs.NEarXiv:1511.03416v42015Extracting Training Data from Diffusion Models
Nicholas Carlini, Jamie Hayes, Milad Nasr +6
cs.CRcs.CVcs.LGarXiv:2301.13188v12023Brain Intelligence: Go Beyond Artificial Intelligence
Huimin Lu, Yujie Li, Min Chen +2
cs.CVarXiv:1706.01040v12017FASTER: Rethinking Real-Time Flow VLAs
Yuxiang Lu, Zhe Liu, Xianzhe Fan +5
cs.ROcs.CVarXiv:2603.19199v32026SSD-6D: Making RGB-based 3D detection and 6D pose estimation great again
Wadim Kehl, Fabian Manhardt, Federico Tombari +2
cs.CVarXiv:1711.10006v12017According to Me: Long-Term Personalized Referential Memory QA
Jingbiao Mei, Jinghong Chen, Guangyu Yang +3
cs.AIcs.CLcs.CVarXiv:2603.01990v12026From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
Ruilin Luo, Chufan Shi, Yizhen Zhang +10
cs.CVcs.AIarXiv:2603.03825v12026Physical Simulator In-the-Loop Video Generation
Lin Geng Foo, Mark He Huang, Alexandros Lattas +3
cs.CVcs.AIcs.GRarXiv:2603.06408v12026Texture Networks: Feed-forward Synthesis of Textures and Stylized Images
Dmitry Ulyanov, Vadim Lebedev, Andrea Vedaldi +1
cs.CVarXiv:1603.03417v12016PromptRL: Prompt Matters in RL for Flow-Based Image Generation
Fu-Yun Wang, Han Zhang, Michael Gharbi +2
cs.CVcs.LGarXiv:2602.01382v12026Photographic Image Synthesis with Cascaded Refinement Networks
Qifeng Chen, Vladlen Koltun
cs.CVcs.AIcs.GRarXiv:1707.09405v12017Detecting Text in Natural Image with Connectionist Text Proposal Network
Zhi Tian, Weilin Huang, Tong He +2
cs.CVarXiv:1609.03605v12016Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation
Zihan Su, Hongyang Wei, Kangrui Cen +4
cs.CVcs.LGarXiv:2601.21406v32026Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation
Junde Wu, Wei Ji, Yuanpei Liu +4
cs.CVarXiv:2304.12620v72023HY3D-Bench: Generation of 3D Assets
Team Hunyuan3D, :, Bowen Zhang +22
cs.CVcs.AIarXiv:2602.03907v12026A Simple Baseline for Bayesian Uncertainty in Deep Learning
Wesley Maddox, Timur Garipov, Pavel Izmailov +2
cs.LGcs.AIcs.CVarXiv:1902.02476v22019SO-Net: Self-Organizing Network for Point Cloud Analysis
Jiaxin Li, Ben M. Chen, Gim Hee Lee
cs.CVarXiv:1803.04249v42018Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control
Linxi Xie, Lisong C. Sun, Ashley Neall +3
cs.CVarXiv:2602.18422v12026Learning Enriched Features for Real Image Restoration and Enhancement
Syed Waqas Zamir, Aditya Arora, Salman Khan +4
cs.CVarXiv:2003.06792v22020GraphVAE: Towards Generation of Small Graphs Using Variational Autoencoders
Martin Simonovsky, Nikos Komodakis
cs.LGcs.CVcs.NEarXiv:1802.03480v12018The Unmanned Aerial Vehicle Benchmark: Object Detection and Tracking
Dawei Du, Yuankai Qi, Hongyang Yu +6
cs.CVarXiv:1804.00518v12018The History Began from AlexNet: A Comprehensive Survey on Deep Learning Approaches
Md Zahangir Alom, Tarek M. Taha, Christopher Yakopcic +6
cs.CVarXiv:1803.01164v22018RLBench: The Robot Learning Benchmark & Learning Environment
Stephen James, Zicong Ma, David Rovick Arrojo +1
cs.ROcs.AIcs.CVarXiv:1909.12271v12019