Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,481 to 15,540 of 18,866
Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers
Bozhou Li, Yushuo Guan, Haolin Li +7
cs.CVarXiv:2602.03510v12026Delving Deeper into Convolutional Networks for Learning Video Representations
Nicolas Ballas, Li Yao, Chris Pal +1
cs.CVcs.LGcs.NEarXiv:1511.06432v42015Capsule-Forensics: Using Capsule Networks to Detect Forged Images and Videos
Huy H. Nguyen, Junichi Yamagishi, Isao Echizen
cs.CVeess.IVarXiv:1810.11215v12018CGNet: A Light-weight Context Guided Network for Semantic Segmentation
Tianyi Wu, Sheng Tang, Rui Zhang +1
cs.CVarXiv:1811.08201v22018Scaling Up Your Kernels to 31x31: Revisiting Large Kernel Design in CNNs
Xiaohan Ding, Xiangyu Zhang, Yizhuang Zhou +3
cs.CVcs.AIcs.LGarXiv:2203.06717v42022TransFuser: Imitation with Transformer-Based Sensor Fusion for Autonomous Driving
Kashyap Chitta, Aditya Prakash, Bernhard Jaeger +3
cs.CVcs.AIcs.LGarXiv:2205.15997v12022Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks
Bohan Zeng, Kaixin Zhu, Daili Hua +24
cs.CVarXiv:2602.01630v12026Working hard to know your neighbor's margins: Local descriptor learning loss
Anastasiya Mishchuk, Dmytro Mishkin, Filip Radenovic +1
cs.CVarXiv:1705.10872v420173D-Aware Implicit Motion Control for View-Adaptive Human Video Generation
Zhixue Fang, Xu He, Songlin Tang +5
cs.CVarXiv:2602.03796v22026Attribute2Image: Conditional Image Generation from Visual Attributes
Xinchen Yan, Jimei Yang, Kihyuk Sohn +1
cs.LGcs.AIcs.CVarXiv:1512.00570v22015How Merge-Tolerant Are Vision Transformers for Wheat Phenotyping?
Simon Ravé, Pejman Rasti, David Rousseau
cs.CVarXiv:2608.23142v12026TransTrack: Multiple Object Tracking with Transformer
Peize Sun, Jinkun Cao, Yi Jiang +5
cs.CVarXiv:2012.15460v22020Ref-NeRF: Structured View-Dependent Appearance for Neural Radiance Fields
Dor Verbin, Peter Hedman, Ben Mildenhall +3
cs.CVcs.GRarXiv:2112.03907v12021Adaptive 1D Video Diffusion Autoencoder
Yao Teng, Minxuan Lin, Xian Liu +3
cs.CVarXiv:2602.04220v12026When the Edit Changes the Patient: Measuring Identity Preservation in Counterfactual Retinal Images
Andrea Posada, Wenke Karbole, Bach Ngoc Doan +9
cs.CVarXiv:2608.23024v12026OmniRad: A Radiological Foundation Model for Multi-Task Medical Image Analysis
Luca Zedda, Andrea Loddo, Cecilia Di Ruberto
cs.CVcs.AIarXiv:2602.04547v12026No More Strided Convolutions or Pooling: A New CNN Building Block for Low-Resolution Images and Small Objects
Raja Sunkara, Tie Luo
cs.CVcs.LGarXiv:2208.03641v12022Cross Attention Network for Few-shot Classification
Ruibing Hou, Hong Chang, Bingpeng Ma +2
cs.CVarXiv:1910.07677v12019Human Action Recognition from Various Data Modalities: A Review
Zehua Sun, Qiuhong Ke, Hossein Rahmani +3
cs.CVarXiv:2012.11866v52020When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
Jiacheng Hou, Yining Sun, Ruochong Jin +4
cs.CVcs.AIarXiv:2602.10179v22026Object Goal Navigation using Goal-Oriented Semantic Exploration
Devendra Singh Chaplot, Dhiraj Gandhi, Abhinav Gupta +1
cs.CVcs.LGcs.ROarXiv:2007.00643v22020Neighbor-Aware View Synthesis for Restoring Missing Views in Light-Field Camera Arrays
Sakshi Goel, Ayush Goyal, K S Venkatesh +1
cs.CVarXiv:2608.23175v12026TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution
Deyang Jiang, Jing Huang, Xuanle Zhao +6
cs.CVarXiv:2602.09662v12026DeepFakes: a New Threat to Face Recognition? Assessment and Detection
Pavel Korshunov, Sebastien Marcel
cs.CVarXiv:1812.08685v12018Reinforced Attention Learning
Bangzheng Li, Jianmo Ni, Chen Qu +5
cs.CLcs.CVcs.LGarXiv:2602.04884v22026Auto-Encoding Scene Graphs for Image Captioning
Xu Yang, Kaihua Tang, Hanwang Zhang +1
cs.CVarXiv:1812.02378v32018Fast-SAM3D: 3Dfy Anything in Images but Faster
Weilun Feng, Mingqiang Wu, Zhiliang Chen +10
cs.CVarXiv:2602.05293v22026Prism: Spectral-Aware Block-Sparse Attention
Xinghao Wang, Pengyu Wang, Xiaoran Liu +4
cs.CLcs.AIcs.CVarXiv:2602.08426v22026MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE
Ruijie Zhu, Jiahao Lu, Wenbo Hu +4
cs.CVcs.AIcs.CGarXiv:2602.08961v22026ArcFlow: Unleashing 2-Step Text-to-Image Generation via High-Precision Non-Linear Flow Distillation
Zihan Yang, Shuyuan Tu, Licheng Zhang +3
cs.CVcs.AIarXiv:2602.09014v12026Joint Optimization Framework for Learning with Noisy Labels
Daiki Tanaka, Daiki Ikami, Toshihiko Yamasaki +1
cs.CVcs.LGstat.MLarXiv:1803.11364v12018Reasoning-Augmented Representations for Multimodal Retrieval
Jianrui Zhang, Anirudh Sundara Rajan, Brandon Han +3
cs.IRcs.AIcs.CVarXiv:2602.07125v12026VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
Issar Tzachor, Dvir Samuel, Rami Ben-Ari
cs.CVcs.AIarXiv:2602.08099v12026Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
Xu Ma, Yitian Zhang, Qihua Dong +1
cs.CVarXiv:2602.09439v12026Motion-Based Tokenization for Cross-Dataset Egocentric Gaze Modeling
Virmarie Maquiling, Zhuojiang Cai, Enkelejda Kasneci
cs.CVarXiv:2608.22926v12026Video Frame Synthesis using Deep Voxel Flow
Ziwei Liu, Raymond A. Yeh, Xiaoou Tang +2
cs.CVcs.GRcs.LGarXiv:1702.02463v22017Gated Siamese Convolutional Neural Network Architecture for Human Re-Identification
Rahul Rama Varior, Mrinal Haloi, Gang Wang
cs.CVarXiv:1607.08378v22016Multi-Task Learning with Deep Neural Networks: A Survey
Michael Crawshaw
cs.LGcs.CVstat.MLarXiv:2009.09796v12020Image Segmentation Using Text and Image Prompts
Timo Lüddecke, Alexander S. Ecker
cs.CVarXiv:2112.10003v22021AnaDiffusion: Anatomically CompositionalLatent Diffusion for Controllable 3D Brain MRI Generation
Huiwen Han, Lulin Liu, Bangya Liu +8
cs.CVarXiv:2608.23014v12026Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision
Aadarsh Sahoo, Georgia Gkioxari
cs.CVarXiv:2602.13195v12026MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation
Taha Koleilat, Hojat Asgariandehkordi, Omid Nejati Manzari +3
cs.CVcs.CLarXiv:2602.20423v12026Light4D: Training-Free Extreme Viewpoint 4D Video Relighting
Zhenghuang Wu, Kang Chen, Zeyu Zhang +1
cs.CVarXiv:2602.11769v12026UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan +11
cs.CVcs.AIcs.LGarXiv:2602.12279v22026What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis
Xirui Li, Ming Li, Tianyi Zhou
cs.CVcs.AIarXiv:2602.12395v12026LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
Jihao Qiu, Lingxi Xie, Xinyue Huo +2
cs.CVarXiv:2602.20913v22026Human Pose Estimation with Iterative Error Feedback
Joao Carreira, Pulkit Agrawal, Katerina Fragkiadaki +1
cs.CVcs.LGcs.NEarXiv:1507.06550v32015Distributed Deep Neural Networks over the Cloud, the Edge and End Devices
Surat Teerapittayanon, Bradley McDanel, H. T. Kung
cs.CVcs.DCarXiv:1709.01921v12017MomADv2: Reliable Temporal Memory for End-to-End Autonomous Driving
Ziying Song, Shengkai Zhang, Lin Liu +8
cs.CVcs.ROarXiv:2608.23405v12026Real-Time Flying Object Detection with YOLOv8
Dillon Reis, Jordan Kupec, Jacqueline Hong +1
cs.CVcs.LGarXiv:2305.09972v22023Human Action Recognition and Prediction: A Survey
Yu Kong, Yun Fu
cs.CVarXiv:1806.11230v32018WildHandBench: A Benchmark for Handwritten Text Understanding that Challenges MLLMs and Humans
Jun Zhang, Qiao Zhao, Cheng Cui +6
cs.CVcs.AIarXiv:2608.22959v12026Learning to Segment Object Candidates
Pedro O. Pinheiro, Ronan Collobert, Piotr Dollar
cs.CVarXiv:1506.06204v22015Vector-quantized Image Modeling with Improved VQGAN
Jiahui Yu, Xin Li, Jing Yu Koh +7
cs.CVcs.LGarXiv:2110.04627v32021Semi-supervised Medical Image Segmentation through Dual-task Consistency
Xiangde Luo, Jieneng Chen, Tao Song +3
cs.CVarXiv:2009.04448v32020DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
Dahye Kim, Deepti Ghadiyaram, Raghudeep Gadde
cs.CVcs.AIarXiv:2602.16968v12026FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors
Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan
cs.CVarXiv:2608.23549v12026MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models
Matthias Neuwirth-Trapp, Begüm Altunbas, Jiayi Wang +4
cs.CVcs.ROarXiv:2608.23140v12026FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding
Hengjie Zhu, Dayan Wu, Zihao Zhang +6
cs.CVarXiv:2608.22883v12026Simplified Cross-Modal Calibration for Heterogeneous Event-RGB Stereo Systems
Nico Hessenthaler, Adam T. Müller, Nicolaj C. Stache
cs.CVarXiv:2608.22965v12026