Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,441 to 16,500 of 18,839

  1. SPARK-SAM: Self-Prompt Adaptation with Response Knowledge for SAM in Infrared Small Target Segmentation

    Aji Mao, Zhenming Peng, Bailin Mu +1

    cs.CVarXiv:2608.20754v12026
  2. A survey of loss functions for semantic segmentation

    Shruti Jadon

    eess.IVcs.CVcs.LGarXiv:2006.14822v42020
  3. fastMRI: An Open Dataset and Benchmarks for Accelerated MRI

    Jure Zbontar, Florian Knoll, Anuroop Sriram +24

    cs.CVcs.LGeess.SParXiv:1811.08839v22018
  4. Inference-time Physics Alignment of Video Generative Models with Latent World Models

    Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich +7

    cs.CVarXiv:2601.10553v22026
  5. MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories

    Haojin He, Hao Tan, Zichang Tan +2

    cs.CVarXiv:2608.20770v12026
  6. Learning multiple visual domains with residual adapters

    Sylvestre-Alvise Rebuffi, Hakan Bilen, Andrea Vedaldi

    cs.CVstat.MLarXiv:1705.08045v52017
  7. MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

    Ava Pun, Kangle Deng, Yiheng Zhu +3

    cs.GRcs.CVarXiv:2608.20448v12026
  8. World Guidance: World Modeling in Condition Space for Action Generation

    Yue Su, Sijin Chen, Haixin Shi +7

    cs.ROcs.CVarXiv:2602.22010v12026
  9. ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases

    Stéphane d'Ascoli, Hugo Touvron, Matthew Leavitt +3

    cs.CVcs.LGstat.MLarXiv:2103.10697v22021
  10. GIRAFFE: Representing Scenes as Compositional Generative Neural Feature Fields

    Michael Niemeyer, Andreas Geiger

    cs.CVcs.LGarXiv:2011.12100v22020
  11. Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

    Beibei Zhang, Chao Xu, Jun Lan +4

    cs.CVarXiv:2608.20814v12026
  12. Soft Filter Pruning for Accelerating Deep Convolutional Neural Networks

    Yang He, Guoliang Kang, Xuanyi Dong +2

    cs.CVarXiv:1808.06866v12018
  13. ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

    Yuzhi Chen, Ronghan Chen, Dongjie Huo +11

    cs.CVcs.ROarXiv:2603.23376v22026
  14. Towards Automatic Learning of Procedures from Web Instructional Videos

    Luowei Zhou, Chenliang Xu, Jason J. Corso

    cs.CVarXiv:1703.09788v32017
  15. When does fusing hand-crafted knowledge with learned representations pay? A cost-normalized benchmark of stacking, substitution, and interference

    Ahmad AlMughrabi, Albert Clop, Benjamin Busam +2

    cs.CVarXiv:2608.21098v12026
  16. A Survey on Learning to Hash

    Jingdong Wang, Ting Zhang, Jingkuan Song +2

    cs.CVarXiv:1606.00185v22016
  17. OmniGAIA: Towards Native Omni-Modal AI Agents

    Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10

    cs.AIcs.CLcs.CVarXiv:2602.22897v32026
  18. LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

    Junyi Zhang, Charles Herrmann, Junhwa Hur +5

    cs.CVcs.LGarXiv:2603.03269v22026
  19. SoPhie: An Attentive GAN for Predicting Paths Compliant to Social and Physical Constraints

    Amir Sadeghian, Vineet Kosaraju, Ali Sadeghian +3

    cs.CVarXiv:1806.01482v22018
  20. HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

    Haowei Zhang, Shudong Yang, Jinlan Fu +2

    cs.CVcs.AIcs.CLarXiv:2601.14724v42026
  21. AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

    Dongrui Liu, Qihan Ren, Chen Qian +40

    cs.AIcs.CCcs.CLarXiv:2601.18491v22026
  22. MVSNeRF: Fast Generalizable Radiance Field Reconstruction from Multi-View Stereo

    Anpei Chen, Zexiang Xu, Fuqiang Zhao +4

    cs.CVarXiv:2103.15595v22021
  23. WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition

    Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin +10

    cs.CVarXiv:2608.21281v12026
  24. Deep Closest Point: Learning Representations for Point Cloud Registration

    Yue Wang, Justin M. Solomon

    cs.CVarXiv:1905.03304v12019
  25. PVNet: Pixel-wise Voting Network for 6DoF Pose Estimation

    Sida Peng, Yuan Liu, Qixing Huang +2

    cs.CVarXiv:1812.11788v12018
  26. MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

    Honglin Lin, Zheng Liu, Yun Zhu +6

    cs.CVarXiv:2601.21821v12026
  27. RFN-Nest: An end-to-end residual fusion network for infrared and visible images

    Hui Li, Xiao-Jun Wu, Josef Kittler

    cs.CVarXiv:2103.04286v22021
  28. OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

    Wenyang Hong, Yuan Wang, Yanbin Hao +5

    cs.CVarXiv:2608.20932v12026
  29. Rethinking Video Generation Model for the Embodied World

    Yufan Deng, Zilin Pan, Hongyu Zhang +6

    cs.CVcs.AIcs.ROarXiv:2601.15282v12026
  30. Dorsal Hand Images for Immersive (XR) and Privacy-preserving Age Assurance and Child Safety

    Riccardo Bovo, George Loukas, Josh P. Davis

    cs.CVarXiv:2608.21009v12026
  31. AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations

    Minjun Zhu, Zhen Lin, Yixuan Weng +6

    cs.AIcs.CLcs.CVarXiv:2602.03828v22026
  32. EGNet:Edge Guidance Network for Salient Object Detection

    Jia-Xing Zhao, Jiangjiang Liu, Den-Ping Fan +3

    cs.CVarXiv:1908.08297v12019
  33. Evaluation of Output Embeddings for Fine-Grained Image Classification

    Zeynep Akata, Scott Reed, Daniel Walter +2

    cs.CVarXiv:1409.8403v22014
  34. Revisiting the Platonic Representation Hypothesis: An Aristotelian View

    Fabian Gröger, Shuo Wen, Maria Brbić

    cs.LGcs.AIcs.CVarXiv:2602.14486v22026
  35. Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

    Zhuoyuan Li, Rui Zhao, Jin Wang +5

    cs.CVcs.ROarXiv:2608.21247v12026
  36. DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation

    Haozhe Xie, Beichen Wen, Jiarui Zheng +4

    cs.ROcs.CVarXiv:2601.22153v12026
  37. Solaris: Building a Multiplayer Video World Model in Minecraft

    Georgy Savva, Oscar Michel, Daohan Lu +6

    cs.CVarXiv:2602.22208v22026
  38. A Transformer-Based Siamese Network for Change Detection

    Wele Gedara Chaminda Bandara, Vishal M. Patel

    cs.CVarXiv:2201.01293v72022
  39. Vision Transformers for Single Image Dehazing

    Yuda Song, Zhuqing He, Hui Qian +1

    cs.CVarXiv:2204.03883v12022
  40. UI-Venus-1.5 Technical Report

    Venus Team, Changlong Gao, Zhangxuan Gu +24

    cs.CVcs.AIcs.CLarXiv:2602.09082v22026
  41. Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory

    Ruiqi Wu, Xuanhua He, Meng Cheng +8

    cs.CVcs.AIarXiv:2602.02393v22026
  42. GridDehazeNet: Attention-Based Multi-Scale Network for Image Dehazing

    Xiaohong Liu, Yongrui Ma, Zhihao Shi +1

    cs.CVeess.IVarXiv:1908.03245v12019
  43. Gen-Searcher: Reinforcing Agentic Search for Image Generation

    Kaituo Feng, Manyuan Zhang, Shuang Chen +7

    cs.CVarXiv:2603.28767v32026
  44. FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models

    Will Grathwohl, Ricky T. Q. Chen, Jesse Bettencourt +2

    cs.LGcs.CVstat.MLarXiv:1810.01367v32018
  45. Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation

    Yuval Kirstain, Adam Polyak, Uriel Singer +3

    cs.CVcs.AIarXiv:2305.01569v22023
  46. FireRed-Image-Edit-1.0 Technical Report

    Super Intelligence Team, Changhao Qiao, Chao Hui +16

    cs.CVeess.IVarXiv:2602.13344v22026
  47. Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition

    Ziyu Liu, Hongwen Zhang, Zhenghao Chen +2

    cs.CVarXiv:2003.14111v22020
  48. Multi-Modal Traffic Sign Detection with Semantic Attributes for Autonomous Driving

    Meda Lazar, Sourab Sridhar, Shashwata Gupta +3

    cs.CVcs.ROarXiv:2608.20874v12026
  49. PCN: Point Completion Network

    Wentao Yuan, Tejas Khot, David Held +2

    cs.CVcs.ROarXiv:1808.00671v32018
  50. MedCLIP: Contrastive Learning from Unpaired Medical Images and Text

    Zifeng Wang, Zhenbang Wu, Dinesh Agarwal +1

    cs.CVcs.CLarXiv:2210.10163v12022
  51. Vector Quantized Diffusion Model for Text-to-Image Synthesis

    Shuyang Gu, Dong Chen, Jianmin Bao +5

    cs.CVcs.LGarXiv:2111.14822v32021
  52. RepPoints: Point Set Representation for Object Detection

    Ze Yang, Shaohui Liu, Han Hu +2

    cs.CVarXiv:1904.11490v22019
  53. OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

    Kaihang Pan, Qi Tian, Jianwei Zhang +11

    cs.CVarXiv:2603.24458v22026
  54. Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

    Fengshun Wang, Jin'ang Han, Zhigang Tu

    cs.CVcs.MMarXiv:2608.21022v12026
  55. eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers

    Yogesh Balaji, Seungjun Nah, Xun Huang +10

    cs.CVcs.LGarXiv:2211.01324v52022
  56. BabyVision: Visual Reasoning Beyond Language

    Liang Chen, Weichu Xie, Yiyan Liang +27

    cs.CVcs.CLarXiv:2601.06521v22026
  57. V-DPM: 4D Video Reconstruction with Dynamic Point Maps

    Edgar Sucar, Eldar Insafutdinov, Zihang Lai +1

    cs.CVarXiv:2601.09499v12026
  58. OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    Peng Wang, An Yang, Rui Men +7

    cs.CVcs.CLarXiv:2202.03052v22022
  59. KoViDoRe: Korean Visual Document Retrieval

    Yongbin Choi, Yongwoo Song, Mujeen Sung

    cs.IRcs.CVarXiv:2608.20840v12026
  60. Video-to-Video Synthesis

    Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu +4

    cs.CVcs.GRcs.LGarXiv:1808.06601v22018