Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
4,801 to 4,860 of 18,815
LiDAR Snowfall Simulation for Robust 3D Object Detection
Martin Hahner, Christos Sakaridis, Mario Bijelic +4
cs.CVcs.LGarXiv:2203.15118v22022Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model
Lixue Gong, Xiaoxia Hou, Fanshi Li +25
cs.CVarXiv:2503.07703v12025MegaLoc: One Retrieval to Place Them All
Gabriele Berton, Carlo Masone
cs.CVarXiv:2502.17237v32025Faster CNNs with Direct Sparse Convolutions and Guided Pruning
Jongsoo Park, Sheng Li, Wei Wen +4
cs.CVarXiv:1608.01409v52016MMRL: Multi-Modal Representation Learning for Vision-Language Models
Yuncheng Guo, Xiaodong Gu
cs.LGcs.CVarXiv:2503.08497v22025TokenPacker: Efficient Visual Projector for Multimodal LLM
Wentong Li, Yuqian Yuan, Jian Liu +5
cs.CVarXiv:2407.02392v42024SIoU Loss: More Powerful Learning for Bounding Box Regression
Zhora Gevorgyan
cs.CVcs.AIarXiv:2205.12740v12022Metric Learning for Adversarial Robustness
Chengzhi Mao, Ziyuan Zhong, Junfeng Yang +2
cs.LGcs.CRcs.CVarXiv:1909.00900v22019Monocular Semantic Occupancy Grid Mapping with Convolutional Variational Encoder-Decoder Networks
Chenyang Lu, Marinus Jacobus Gerardus van de Molengraft, Gijs Dubbelman
cs.ROcs.CVarXiv:1804.02176v32018Minimizing the Accumulated Trajectory Error to Improve Dataset Distillation
Jiawei Du, Yidi Jiang, Vincent Y. F. Tan +2
cs.LGcs.AIcs.CVarXiv:2211.11004v32022Semantic Style Transfer and Turning Two-Bit Doodles into Fine Artworks
Alex J. Champandard
cs.CVarXiv:1603.01768v12016Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
Chengzu Li, Wenshan Wu, Huanyu Zhang +5
cs.CLcs.CVcs.LGarXiv:2501.07542v12025Robust PCA via Nonconvex Rank Approximation
Zhao Kang, Chong Peng, Qiang Cheng
cs.CVcs.LGmath.NAarXiv:1511.05261v12015UniverSeg: Universal Medical Image Segmentation
Victor Ion Butoi, Jose Javier Gonzalez Ortiz, Tianyu Ma +3
cs.CVcs.LGarXiv:2304.06131v12023Face Forensics in the Wild
Tianfei Zhou, Wenguan Wang, Zhiyuan Liang +1
cs.CVarXiv:2103.16076v12021StableNormal: Reducing Diffusion Variance for Stable and Sharp Normal
Chongjie Ye, Lingteng Qiu, Xiaodong Gu +6
cs.CVcs.AIcs.GRarXiv:2406.16864v12024VoxelContext-Net: An Octree based Framework for Point Cloud Compression
Zizheng Que, Guo Lu, Dong Xu
cs.CVeess.IVarXiv:2105.02158v12021NeuRIS: Neural Reconstruction of Indoor Scenes Using Normal Priors
Jiepeng Wang, Peng Wang, Xiaoxiao Long +4
cs.CVarXiv:2206.13597v22022Smooth-AP: Smoothing the Path Towards Large-Scale Image Retrieval
Andrew Brown, Weidi Xie, Vicky Kalogeiton +1
cs.CVarXiv:2007.12163v22020An Intelligent Decision Support System for Emotion Monitoring using Microscopic Fixational Dynamics
Xiangyu Shen, Feiyang Deng, Zijian Dai +4
cs.CVarXiv:2609.00846v12026Seeing the World and the Self from Egocentric Video
Kai Guan, Minchao Jiang, Ruichen WangLi +2
cs.CVarXiv:2609.01276v12026InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction
Yuhui Wu, Liyi Chen, Ruibin Li +3
cs.CVarXiv:2503.20287v22025ShadowDiffusion: When Degradation Prior Meets Diffusion Model for Shadow Removal
Lanqing Guo, Chong Wang, Wenhan Yang +4
cs.CVarXiv:2212.04711v22022ControlNeXt: Powerful and Efficient Control for Image and Video Generation
Bohao Peng, Jian Wang, Yuechen Zhang +3
cs.CVarXiv:2408.06070v32024Long-Context State-Space Video World Models
Ryan Po, Yotam Nitzan, Richard Zhang +5
cs.CVarXiv:2505.20171v12025CLIP-It! Language-Guided Video Summarization
Medhini Narasimhan, Anna Rohrbach, Trevor Darrell
cs.CVcs.AIcs.MMarXiv:2107.00650v22021DiffPose: Toward More Reliable 3D Pose Estimation
Jia Gong, Lin Geng Foo, Zhipeng Fan +3
cs.CVarXiv:2211.16940v32022ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
Chaojie Mao, Jingfeng Zhang, Yulin Pan +4
cs.CVarXiv:2501.02487v32025Soft-Argmax for the Projective Plane via the Veronese Embedding
Benjamin El-Zein, Dominik Eckert, Paul Zech +4
cs.CVcs.LGarXiv:2609.00521v12026A Discriminative Framework for Anomaly Detection in Large Videos
Allison Del Giorno, J. Andrew Bagnell, Martial Hebert
cs.CVstat.MLarXiv:1609.08938v12016UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin +11
cs.CVcs.AIcs.CLarXiv:2503.15661v22025Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
Yufei Zhan, Yousong Zhu, Shurong Zheng +4
cs.CVcs.AIarXiv:2503.18013v12025MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion Scaffolds
Jiahui Lei, Yijia Weng, Adam Harley +2
cs.CVcs.GRarXiv:2405.17421v22024CLAWS: Clustering Assisted Weakly Supervised Learning with Normalcy Suppression for Anomalous Event Detection
Muhammad Zaigham Zaheer, Arif Mahmood, Marcella Astrid +1
cs.CVcs.AIarXiv:2011.12077v42020Long Short-Term Transformer for Online Action Detection
Mingze Xu, Yuanjun Xiong, Hao Chen +4
cs.CVarXiv:2107.03377v32021Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
Jiacong Xu, Shao-Yuan Lo, Bardia Safaei +2
cs.CVcs.CLarXiv:2502.07601v22025HAC++: Towards 100X Compression of 3D Gaussian Splatting
Yihang Chen, Qianyi Wu, Weiyao Lin +2
cs.CVarXiv:2501.12255v42025Vid2World: Crafting Video Diffusion Models to Interactive World Models
Siqiao Huang, Jialong Wu, Qixing Zhou +2
cs.CVcs.LGarXiv:2505.14357v32025Boundary-weighted Domain Adaptive Neural Network for Prostate MR Image Segmentation
Qikui Zhu, Bo Du, Pingkun Yan
cs.CVarXiv:1902.08128v22019OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
Pan Lu, Bowen Chen, Sheng Liu +3
cs.LGcs.CLcs.CVarXiv:2502.11271v22025A Review on Deep-Learning Algorithms for Fetal Ultrasound-Image Analysis
Maria Chiara Fiorentino, Francesca Pia Villani, Mariachiara Di Cosmo +2
eess.IVcs.CVcs.LGarXiv:2201.12260v12022Any2AnyTryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing Tasks
Hailong Guo, Bohan Zeng, Yiren Song +3
cs.CVarXiv:2501.15891v22025RewardDance: Reward Scaling in Visual Generation
Jie Wu, Yu Gao, Zilyu Ye +9
cs.CVarXiv:2509.08826v12025PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
Wenxuan Song, Jiayi Chen, Pengxiang Ding +9
cs.ROcs.CVarXiv:2503.02310v22025CSWin-UNet: Transformer UNet with Cross-Shaped Windows for Medical Image Segmentation
Xiao Liu, Peng Gao, Tao Yu +2
eess.IVcs.CVarXiv:2407.18070v32024Controllable Video Generation: A Survey
Yue Ma, Kunyu Feng, Zhongyuan Hu +19
cs.GRcs.CVarXiv:2507.16869v32025IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals
Md. Atabuzzaman, Christian Alexander, Chris Thomas
cs.CVcs.CLarXiv:2609.01375v12026DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics Awareness
Yiming Zhong, Qi Jiang, Jingyi Yu +1
cs.CVcs.AIcs.ROarXiv:2503.08257v22025Reliability Challenges in Diffusion Vision-Language Models
Md. Atabuzzaman, Chris Thomas
cs.CVcs.CLarXiv:2609.01318v12026ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
Yuzhou Huang, Ziyang Yuan, Quande Liu +6
cs.CVarXiv:2501.04698v22025RRPN: Radar Region Proposal Network for Object Detection in Autonomous Vehicles
Ramin Nabati, Hairong Qi
cs.CVarXiv:1905.00526v22019Semantic-Guided Multimodal Preprocessing for Vision Transformer-Based Clear Cell Renal Cell Carcinoma Grading
Fatemeh Javadian, Zhu Chen, Zahra Aminparast +1
cs.CVcs.AIcs.LGarXiv:2609.01426v12026One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt
Tao Liu, Kai Wang, Senmao Li +6
cs.CVcs.AIcs.LGarXiv:2501.13554v32025TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
Xinyu Wei, Jinrui Zhang, Zeqing Wang +4
cs.CVarXiv:2506.02161v32025VGGT-SLAM 2.0: Real-time Dense Feed-forward Scene Reconstruction
Dominic Maggio, Luca Carlone
cs.CVcs.ROarXiv:2601.19887v22026Spatial Broadcast Decoder: A Simple Architecture for Learning Disentangled Representations in VAEs
Nicholas Watters, Loic Matthey, Christopher P. Burgess +1
cs.LGcs.CVstat.MLarXiv:1901.07017v22019GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
Yuqi Zhou, Sunhao Dai, Shuai Wang +3
cs.CLcs.AIcs.CVarXiv:2505.15810v22025Fast, Exact and Multi-Scale Inference for Semantic Image Segmentation with Deep Gaussian CRFs
Siddhartha Chandra, Iasonas Kokkinos
cs.CVcs.LGarXiv:1603.08358v42016ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard Negatives
Nikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos +1
cs.CVcs.AIcs.LGarXiv:2609.01041v12026Data Augmentation for Skin Lesion Analysis
Fábio Perez, Cristina Vasconcelos, Sandra Avila +1
cs.CVarXiv:1809.01442v12018