Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
8,581 to 8,640 of 18,867
Multi-interactive Dual-decoder for RGB-thermal Salient Object Detection
Zhengzheng Tu, Zhun Li, Chenglong Li +2
cs.CVarXiv:2005.02315v32020Fine-Grained Multi Image Object Hallucination Benchmark
Joonki Min, Chaeyun Kim, Hyungwook Choi +4
cs.CVcs.AIcs.LGarXiv:2608.30653v12026GO-SLAM: Global Optimization for Consistent 3D Instant Reconstruction
Youmin Zhang, Fabio Tosi, Stefano Mattoccia +1
cs.CVcs.ROarXiv:2309.02436v12023TMR: Text-to-Motion Retrieval Using Contrastive 3D Human Motion Synthesis
Mathis Petrovich, Michael J. Black, Gül Varol
cs.CVcs.CLarXiv:2305.00976v22023E-RAFT: Dense Optical Flow from Event Cameras
Mathias Gehrig, Mario Millhäusler, Daniel Gehrig +1
cs.CVarXiv:2108.10552v32021FLOT: Scene Flow on Point Clouds Guided by Optimal Transport
Gilles Puy, Alexandre Boulch, Renaud Marlet
cs.CVarXiv:2007.11142v12020Regularizing Deep Neural Networks by Noise: Its Interpretation and Optimization
Hyeonwoo Noh, Tackgeun You, Jonghwan Mun +1
cs.LGcs.CVarXiv:1710.05179v22017Minerals in the Wild: A Hyperspectral-XRF Dataset for Elemental Composition Estimation
Eleftheria Tetoula-Tsonga, George Arvanitakis, Theodoros Giannakas
cs.CVcs.LGarXiv:2608.30537v12026A Review on Deep Learning Techniques for the Diagnosis of Novel Coronavirus (COVID-19)
Md. Milon Islam, Fakhri Karray, Reda Alhajj +1
eess.IVcs.CVcs.LGarXiv:2008.04815v12020LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark
Zhenfei Yin, Jiong Wang, Jianjian Cao +9
cs.CVarXiv:2306.06687v32023Hierarchical LSTMs with Adaptive Attention for Visual Captioning
Jingkuan Song, Xiangpeng Li, Lianli Gao +1
cs.CVarXiv:1812.11004v12018Multi-Modal 3D Object Detection in Autonomous Driving: a Survey
Yingjie Wang, Qiuyu Mao, Hanqi Zhu +5
cs.CVarXiv:2106.12735v32021ObjectSplat: Improving Mesh Fidelity and Interactivity for 3D Scenes via Object-Level Mesh Splatting
Minhas Kamal, Hiranya Garbha Kumar, Mahedi Kamal +1
cs.CVcs.AIcs.LGarXiv:2608.30423v12026CT-GAN: Malicious Tampering of 3D Medical Imagery using Deep Learning
Yisroel Mirsky, Tom Mahler, Ilan Shelef +1
cs.CRcs.CVcs.LGarXiv:1901.03597v32019Compositional Chain-of-Thought Prompting for Large Multimodal Models
Chancharik Mitra, Brandon Huang, Trevor Darrell +1
cs.CVcs.AIcs.CLarXiv:2311.17076v32023Point in, Box out: Beyond Counting Persons in Crowds
Yuting Liu, Miaojing Shi, Qijun Zhao +1
cs.CVarXiv:1904.01333v22019Rethinking Architecture Design for Tackling Data Heterogeneity in Federated Learning
Liangqiong Qu, Yuyin Zhou, Paul Pu Liang +5
cs.LGcs.CVarXiv:2106.06047v22021ViTGAN: Training GANs with Vision Transformers
Kwonjoon Lee, Huiwen Chang, Lu Jiang +3
cs.CVcs.LGeess.IVarXiv:2107.04589v22021Fast and Accurate Image Super Resolution by Deep CNN with Skip Connection and Network in Network
Jin Yamanaka, Shigesumi Kuwashima, Takio Kurita
cs.CVarXiv:1707.05425v72017VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs
Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1
cs.CVcs.LGarXiv:2608.30480v12026Learning a Probabilistic Model for Diffeomorphic Registration
Julian Krebs, Hervé Delingette, Boris Mailhé +2
cs.CVarXiv:1812.07460v22018DeepCache: Principled Cache for Mobile Deep Vision
Mengwei Xu, Mengze Zhu, Yunxin Liu +2
cs.CVarXiv:1712.01670v52017BBAM: Bounding Box Attribution Map for Weakly Supervised Semantic and Instance Segmentation
Jungbeom Lee, Jihun Yi, Chaehun Shin +1
cs.CVarXiv:2103.08907v12021LaneNet: Real-Time Lane Detection Networks for Autonomous Driving
Ze Wang, Weiqiang Ren, Qiang Qiu
cs.CVarXiv:1807.01726v12018Scene Memory Transformer for Embodied Agents in Long-Horizon Tasks
Kuan Fang, Alexander Toshev, Li Fei-Fei +1
cs.LGcs.CVcs.ROarXiv:1903.03878v12019Faster gaze prediction with dense networks and Fisher pruning
Lucas Theis, Iryna Korshunova, Alykhan Tejani +1
cs.CVstat.MLarXiv:1801.05787v22018Transformer Tracking with Cyclic Shifting Window Attention
Zikai Song, Junqing Yu, Yi-Ping Phoebe Chen +1
cs.CVarXiv:2205.03806v12022Cycle Self-Training for Domain Adaptation
Hong Liu, Jianmin Wang, Mingsheng Long
cs.LGcs.CVarXiv:2103.03571v32021The MYOSAIQ Challenge: Myocardial Segmentation with Automated Infarct Quantification
Olivier Bernard, William A. Romero R., Cyprien Bouton +24
eess.IVcs.CVarXiv:2608.29246v12026ZipLoRA: Any Subject in Any Style by Effectively Merging LoRAs
Viraj Shah, Nataniel Ruiz, Forrester Cole +4
cs.CVcs.GRcs.LGarXiv:2311.13600v22023SegViT: Semantic Segmentation with Plain Vision Transformers
Bowen Zhang, Zhi Tian, Quan Tang +4
cs.CVarXiv:2210.05844v22022PLA: Language-Driven Open-Vocabulary 3D Scene Understanding
Runyu Ding, Jihan Yang, Chuhui Xue +3
cs.CVarXiv:2211.16312v22022Revisiting the "Video" in Video-Language Understanding
Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon +3
cs.CVcs.AIcs.CLarXiv:2206.01720v12022Rethinking Pseudo-LiDAR Representation
Xinzhu Ma, Shinan Liu, Zhiyi Xia +3
cs.CVarXiv:2008.04582v12020Point Density-Aware Voxels for LiDAR 3D Object Detection
Jordan S. K. Hu, Tianshu Kuai, Steven L. Waslander
cs.CVarXiv:2203.05662v22022Multi-Fiber Networks for Video Recognition
Yunpeng Chen, Yannis Kalantidis, Jianshu Li +2
cs.CVarXiv:1807.11195v32018Lipreading with Long Short-Term Memory
Michael Wand, Jan Koutník, Jürgen Schmidhuber
cs.CVcs.CLarXiv:1601.08188v12016Monocular Real-time Hand Shape and Motion Capture using Multi-modal Data
Yuxiao Zhou, Marc Habermann, Weipeng Xu +3
cs.CVarXiv:2003.09572v32020Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Hongzhe Bi, Zihao Zhou, Yihang Tang +16
cs.ROcs.AIcs.CVarXiv:2608.30237v12026DeepSVG: A Hierarchical Generative Network for Vector Graphics Animation
Alexandre Carlier, Martin Danelljan, Alexandre Alahi +1
cs.CVarXiv:2007.11301v32020Neural-Pull: Learning Signed Distance Functions from Point Clouds by Learning to Pull Space onto Surfaces
Baorui Ma, Zhizhong Han, Yu-Shen Liu +1
cs.CVarXiv:2011.13495v22020TF-ICON: Diffusion-Based Training-Free Cross-Domain Image Composition
Shilin Lu, Yanzhu Liu, Adams Wai-Kin Kong
cs.CVcs.AIarXiv:2307.12493v42023Solving Inverse Problems with Latent Diffusion Models via Hard Data Consistency
Bowen Song, Soo Min Kwon, Zecheng Zhang +3
cs.CVarXiv:2307.08123v32023Collaborative Representation based Classification for Face Recognition
Lei Zhang, Meng Yang, Xiangchu Feng +2
cs.CVarXiv:1204.2358v22012LaDI-VTON: Latent Diffusion Textual-Inversion Enhanced Virtual Try-On
Davide Morelli, Alberto Baldrati, Giuseppe Cartella +3
cs.CVcs.AIcs.MMarXiv:2305.13501v32023Recent Advances and New Guidelines on Hyperspectral and Multispectral Image Fusion
Renwei Dian, Shutao Li, Bin Sun +1
eess.IVcs.CVarXiv:2008.03426v12020Attentive Contexts for Object Detection
Jianan Li, Yunchao Wei, Xiaodan Liang +4
cs.CVarXiv:1603.07415v12016SCAttNet: Semantic Segmentation Network with Spatial and Channel Attention Mechanism for High-Resolution Remote Sensing Images
Haifeng Li, Kaijian Qiu, Li Chen +3
cs.CVarXiv:1912.09121v22019TSPFN: A Temporal Tabular Foundation Model for Physiological Time Series Classification
Jérémie Stym-Popper, Clément Rambour, Federica Granese +2
cs.LGcs.CVarXiv:2608.31013v12026Seeing through the Human Reporting Bias: Visual Classifiers from Noisy Human-Centric Labels
Ishan Misra, C. Lawrence Zitnick, Margaret Mitchell +1
cs.CVarXiv:1512.06974v22015Dreamix: Video Diffusion Models are General Video Editors
Eyal Molad, Eliahu Horwitz, Dani Valevski +5
cs.CVarXiv:2302.01329v12023Raising the Bar of AI-generated Image Detection with CLIP
Davide Cozzolino, Giovanni Poggi, Riccardo Corvi +2
cs.CVarXiv:2312.00195v22023Skip RNN: Learning to Skip State Updates in Recurrent Neural Networks
Victor Campos, Brendan Jou, Xavier Giro-i-Nieto +2
cs.AIcs.CVarXiv:1708.06834v32017Cross-Modal Interaction Networks for Query-Based Moment Retrieval in Videos
Zhu Zhang, Zhijie Lin, Zhou Zhao +1
cs.IRcs.CVcs.MMarXiv:1906.02497v2201970 years of machine learning in geoscience in review
Jesper Sören Dramsch
physics.geo-phcs.CVcs.LGarXiv:2006.13311v32020Self-Supervised Discriminative Feature Learning for Deep Multi-View Clustering
Jie Xu, Yazhou Ren, Huayi Tang +6
cs.LGcs.CVarXiv:2103.15069v32021CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory
Nur Muhammad Mahi Shafiullah, Chris Paxton, Lerrel Pinto +2
cs.ROcs.CVarXiv:2210.05663v32022Maximum-Margin Structured Learning with Deep Networks for 3D Human Pose Estimation
Sijin Li, Weichen Zhang, Antoni B. Chan
cs.CVarXiv:1508.06708v12015Semantic-aware Knowledge Distillation for Few-Shot Class-Incremental Learning
Ali Cheraghian, Shafin Rahman, Pengfei Fang +3
cs.CVarXiv:2103.04059v22021NASA: Neural Articulated Shape Approximation
Boyang Deng, JP Lewis, Timothy Jeruzalski +4
cs.CVcs.GRcs.LGarXiv:1912.03207v52019