Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,801 to 4,860 of 18,815

  1. LiDAR Snowfall Simulation for Robust 3D Object Detection

    Martin Hahner, Christos Sakaridis, Mario Bijelic +4

    cs.CVcs.LGarXiv:2203.15118v22022
  2. Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model

    Lixue Gong, Xiaoxia Hou, Fanshi Li +25

    cs.CVarXiv:2503.07703v12025
  3. MegaLoc: One Retrieval to Place Them All

    Gabriele Berton, Carlo Masone

    cs.CVarXiv:2502.17237v32025
  4. Faster CNNs with Direct Sparse Convolutions and Guided Pruning

    Jongsoo Park, Sheng Li, Wei Wen +4

    cs.CVarXiv:1608.01409v52016
  5. MMRL: Multi-Modal Representation Learning for Vision-Language Models

    Yuncheng Guo, Xiaodong Gu

    cs.LGcs.CVarXiv:2503.08497v22025
  6. TokenPacker: Efficient Visual Projector for Multimodal LLM

    Wentong Li, Yuqian Yuan, Jian Liu +5

    cs.CVarXiv:2407.02392v42024
  7. SIoU Loss: More Powerful Learning for Bounding Box Regression

    Zhora Gevorgyan

    cs.CVcs.AIarXiv:2205.12740v12022
  8. Metric Learning for Adversarial Robustness

    Chengzhi Mao, Ziyuan Zhong, Junfeng Yang +2

    cs.LGcs.CRcs.CVarXiv:1909.00900v22019
  9. Monocular Semantic Occupancy Grid Mapping with Convolutional Variational Encoder-Decoder Networks

    Chenyang Lu, Marinus Jacobus Gerardus van de Molengraft, Gijs Dubbelman

    cs.ROcs.CVarXiv:1804.02176v32018
  10. Minimizing the Accumulated Trajectory Error to Improve Dataset Distillation

    Jiawei Du, Yidi Jiang, Vincent Y. F. Tan +2

    cs.LGcs.AIcs.CVarXiv:2211.11004v32022
  11. Semantic Style Transfer and Turning Two-Bit Doodles into Fine Artworks

    Alex J. Champandard

    cs.CVarXiv:1603.01768v12016
  12. Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

    Chengzu Li, Wenshan Wu, Huanyu Zhang +5

    cs.CLcs.CVcs.LGarXiv:2501.07542v12025
  13. Robust PCA via Nonconvex Rank Approximation

    Zhao Kang, Chong Peng, Qiang Cheng

    cs.CVcs.LGmath.NAarXiv:1511.05261v12015
  14. UniverSeg: Universal Medical Image Segmentation

    Victor Ion Butoi, Jose Javier Gonzalez Ortiz, Tianyu Ma +3

    cs.CVcs.LGarXiv:2304.06131v12023
  15. Face Forensics in the Wild

    Tianfei Zhou, Wenguan Wang, Zhiyuan Liang +1

    cs.CVarXiv:2103.16076v12021
  16. StableNormal: Reducing Diffusion Variance for Stable and Sharp Normal

    Chongjie Ye, Lingteng Qiu, Xiaodong Gu +6

    cs.CVcs.AIcs.GRarXiv:2406.16864v12024
  17. VoxelContext-Net: An Octree based Framework for Point Cloud Compression

    Zizheng Que, Guo Lu, Dong Xu

    cs.CVeess.IVarXiv:2105.02158v12021
  18. NeuRIS: Neural Reconstruction of Indoor Scenes Using Normal Priors

    Jiepeng Wang, Peng Wang, Xiaoxiao Long +4

    cs.CVarXiv:2206.13597v22022
  19. Smooth-AP: Smoothing the Path Towards Large-Scale Image Retrieval

    Andrew Brown, Weidi Xie, Vicky Kalogeiton +1

    cs.CVarXiv:2007.12163v22020
  20. An Intelligent Decision Support System for Emotion Monitoring using Microscopic Fixational Dynamics

    Xiangyu Shen, Feiyang Deng, Zijian Dai +4

    cs.CVarXiv:2609.00846v12026
  21. Seeing the World and the Self from Egocentric Video

    Kai Guan, Minchao Jiang, Ruichen WangLi +2

    cs.CVarXiv:2609.01276v12026
  22. InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction

    Yuhui Wu, Liyi Chen, Ruibin Li +3

    cs.CVarXiv:2503.20287v22025
  23. ShadowDiffusion: When Degradation Prior Meets Diffusion Model for Shadow Removal

    Lanqing Guo, Chong Wang, Wenhan Yang +4

    cs.CVarXiv:2212.04711v22022
  24. ControlNeXt: Powerful and Efficient Control for Image and Video Generation

    Bohao Peng, Jian Wang, Yuechen Zhang +3

    cs.CVarXiv:2408.06070v32024
  25. Long-Context State-Space Video World Models

    Ryan Po, Yotam Nitzan, Richard Zhang +5

    cs.CVarXiv:2505.20171v12025
  26. CLIP-It! Language-Guided Video Summarization

    Medhini Narasimhan, Anna Rohrbach, Trevor Darrell

    cs.CVcs.AIcs.MMarXiv:2107.00650v22021
  27. DiffPose: Toward More Reliable 3D Pose Estimation

    Jia Gong, Lin Geng Foo, Zhipeng Fan +3

    cs.CVarXiv:2211.16940v32022
  28. ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling

    Chaojie Mao, Jingfeng Zhang, Yulin Pan +4

    cs.CVarXiv:2501.02487v32025
  29. Soft-Argmax for the Projective Plane via the Veronese Embedding

    Benjamin El-Zein, Dominik Eckert, Paul Zech +4

    cs.CVcs.LGarXiv:2609.00521v12026
  30. A Discriminative Framework for Anomaly Detection in Large Videos

    Allison Del Giorno, J. Andrew Bagnell, Martial Hebert

    cs.CVstat.MLarXiv:1609.08938v12016
  31. UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction

    Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin +11

    cs.CVcs.AIcs.CLarXiv:2503.15661v22025
  32. Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

    Yufei Zhan, Yousong Zhu, Shurong Zheng +4

    cs.CVcs.AIarXiv:2503.18013v12025
  33. MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion Scaffolds

    Jiahui Lei, Yijia Weng, Adam Harley +2

    cs.CVcs.GRarXiv:2405.17421v22024
  34. CLAWS: Clustering Assisted Weakly Supervised Learning with Normalcy Suppression for Anomalous Event Detection

    Muhammad Zaigham Zaheer, Arif Mahmood, Marcella Astrid +1

    cs.CVcs.AIarXiv:2011.12077v42020
  35. Long Short-Term Transformer for Online Action Detection

    Mingze Xu, Yuanjun Xiong, Hao Chen +4

    cs.CVarXiv:2107.03377v32021
  36. Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models

    Jiacong Xu, Shao-Yuan Lo, Bardia Safaei +2

    cs.CVcs.CLarXiv:2502.07601v22025
  37. HAC++: Towards 100X Compression of 3D Gaussian Splatting

    Yihang Chen, Qianyi Wu, Weiyao Lin +2

    cs.CVarXiv:2501.12255v42025
  38. Vid2World: Crafting Video Diffusion Models to Interactive World Models

    Siqiao Huang, Jialong Wu, Qixing Zhou +2

    cs.CVcs.LGarXiv:2505.14357v32025
  39. Boundary-weighted Domain Adaptive Neural Network for Prostate MR Image Segmentation

    Qikui Zhu, Bo Du, Pingkun Yan

    cs.CVarXiv:1902.08128v22019
  40. OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

    Pan Lu, Bowen Chen, Sheng Liu +3

    cs.LGcs.CLcs.CVarXiv:2502.11271v22025
  41. A Review on Deep-Learning Algorithms for Fetal Ultrasound-Image Analysis

    Maria Chiara Fiorentino, Francesca Pia Villani, Mariachiara Di Cosmo +2

    eess.IVcs.CVcs.LGarXiv:2201.12260v12022
  42. Any2AnyTryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing Tasks

    Hailong Guo, Bohan Zeng, Yiren Song +3

    cs.CVarXiv:2501.15891v22025
  43. RewardDance: Reward Scaling in Visual Generation

    Jie Wu, Yu Gao, Zilyu Ye +9

    cs.CVarXiv:2509.08826v12025
  44. PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

    Wenxuan Song, Jiayi Chen, Pengxiang Ding +9

    cs.ROcs.CVarXiv:2503.02310v22025
  45. CSWin-UNet: Transformer UNet with Cross-Shaped Windows for Medical Image Segmentation

    Xiao Liu, Peng Gao, Tao Yu +2

    eess.IVcs.CVarXiv:2407.18070v32024
  46. Controllable Video Generation: A Survey

    Yue Ma, Kunyu Feng, Zhongyuan Hu +19

    cs.GRcs.CVarXiv:2507.16869v32025
  47. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals

    Md. Atabuzzaman, Christian Alexander, Chris Thomas

    cs.CVcs.CLarXiv:2609.01375v12026
  48. DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics Awareness

    Yiming Zhong, Qi Jiang, Jingyi Yu +1

    cs.CVcs.AIcs.ROarXiv:2503.08257v22025
  49. Reliability Challenges in Diffusion Vision-Language Models

    Md. Atabuzzaman, Chris Thomas

    cs.CVcs.CLarXiv:2609.01318v12026
  50. ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning

    Yuzhou Huang, Ziyang Yuan, Quande Liu +6

    cs.CVarXiv:2501.04698v22025
  51. RRPN: Radar Region Proposal Network for Object Detection in Autonomous Vehicles

    Ramin Nabati, Hairong Qi

    cs.CVarXiv:1905.00526v22019
  52. Semantic-Guided Multimodal Preprocessing for Vision Transformer-Based Clear Cell Renal Cell Carcinoma Grading

    Fatemeh Javadian, Zhu Chen, Zahra Aminparast +1

    cs.CVcs.AIcs.LGarXiv:2609.01426v12026
  53. One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt

    Tao Liu, Kai Wang, Senmao Li +6

    cs.CVcs.AIcs.LGarXiv:2501.13554v32025
  54. TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

    Xinyu Wei, Jinrui Zhang, Zeqing Wang +4

    cs.CVarXiv:2506.02161v32025
  55. VGGT-SLAM 2.0: Real-time Dense Feed-forward Scene Reconstruction

    Dominic Maggio, Luca Carlone

    cs.CVcs.ROarXiv:2601.19887v22026
  56. Spatial Broadcast Decoder: A Simple Architecture for Learning Disentangled Representations in VAEs

    Nicholas Watters, Loic Matthey, Christopher P. Burgess +1

    cs.LGcs.CVstat.MLarXiv:1901.07017v22019
  57. GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents

    Yuqi Zhou, Sunhao Dai, Shuai Wang +3

    cs.CLcs.AIcs.CVarXiv:2505.15810v22025
  58. Fast, Exact and Multi-Scale Inference for Semantic Image Segmentation with Deep Gaussian CRFs

    Siddhartha Chandra, Iasonas Kokkinos

    cs.CVcs.LGarXiv:1603.08358v42016
  59. ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard Negatives

    Nikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos +1

    cs.CVcs.AIcs.LGarXiv:2609.01041v12026
  60. Data Augmentation for Skin Lesion Analysis

    Fábio Perez, Cristina Vasconcelos, Sandra Avila +1

    cs.CVarXiv:1809.01442v12018