Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
4,261 to 4,320 of 18,780
SPLG-Mamba: Structure-Preserving Local-Global Mamba Network for Salient Object Detection in Optical Remote Sensing Images
Yi Xu, Ruichao Hou, Tongwei Ren +1
cs.CVarXiv:2608.29626v12026Style Transfer for Anime Sketches with Enhanced Residual U-net and Auxiliary Classifier GAN
Lvmin Zhang, Yi Ji, Xin Lin
cs.CVarXiv:1706.03319v22017Chemception: A Deep Neural Network with Minimal Chemistry Knowledge Matches the Performance of Expert-developed QSAR/QSPR Models
Garrett B. Goh, Charles Siegel, Abhinav Vishnu +2
stat.MLcs.AIcs.CEarXiv:1706.06689v12017Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models
Weichen Fan, Chenyang Si, Junhao Song +16
cs.CVcs.LGarXiv:2501.08453v12025WorldSculpt: Generating Compositional Worlds from Grounded Videos
Muyao Niu, Jixuan He, Ruihan Yu +9
cs.CVarXiv:2609.05416v12026Adversarial Dropout for Supervised and Semi-supervised Learning
Sungrae Park, Jun-Keon Park, Su-Jin Shin +1
cs.LGcs.CVarXiv:1707.03631v22017Text-to-Image Diffusion Models are Zero-Shot Classifiers
Kevin Clark, Priyank Jaini
cs.CVcs.AIcs.LGarXiv:2303.15233v22023Goku: Flow Based Video Generative Foundation Models
Shoufa Chen, Chongjian Ge, Yuqi Zhang +19
cs.CVarXiv:2502.04896v22025Strip R-CNN: Large Strip Convolution for Remote Sensing Object Detection
Xinbin Yuan, Zhaohui Zheng, Yuxuan Li +5
cs.CVarXiv:2501.03775v42025MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators
Yaqi Zhang, Di Huang, Bin Liu +7
cs.CVcs.AIarXiv:2306.10900v22023Scalable Vision Language Model Training via High Quality Data Curation
Hongyuan Dong, Zijian Kang, Weijie Yin +3
cs.CVcs.CLarXiv:2501.05952v32025Fine-graind Image Classification via Combining Vision and Language
Xiangteng He, Yuxin Peng
cs.CVarXiv:1704.02792v22017On the Arbitrary-Oriented Object Detection: Classification based Approaches Revisited
Xue Yang, Junchi Yan
cs.CVcs.AIarXiv:2003.05597v42020RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
Haifeng Huang, Xinyi Chen, Yilun Chen +6
cs.ROcs.CVarXiv:2504.21530v12025HyperDiffusion: Generating Implicit Neural Fields with Weight-Space Diffusion
Ziya Erkoç, Fangchang Ma, Qi Shan +2
cs.CVcs.LGarXiv:2303.17015v12023Amodal Instance Segmentation
Ke Li, Jitendra Malik
cs.CVarXiv:1604.08202v22016LEMUR 2: Unlocking Neural Network Diversity for AI
Tolgay Atinc Uzun, Waleed Khalid, Saif U Din +17
cs.LGcs.CVarXiv:2607.06839v12026SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization
Xianzhi Du, Tsung-Yi Lin, Pengchong Jin +5
cs.CVcs.LGeess.IVarXiv:1912.05027v32019Bio-inspired digit recognition using reward-modulated spike-timing-dependent plasticity in deep convolutional networks
Milad Mozafari, Mohammad Ganjtabesh, Abbas Nowzari-Dalini +2
cs.CVq-bio.NCarXiv:1804.00227v32018Online PCB Defect Detector On A New PCB Defect Dataset
Sanli Tang, Fan He, Xiaolin Huang +1
cs.CVarXiv:1902.06197v12019MeshSDF: Differentiable Iso-Surface Extraction
Edoardo Remelli, Artem Lukoianov, Stephan R. Richter +4
cs.CVarXiv:2006.03997v22020VICRegL: Self-Supervised Learning of Local Visual Features
Adrien Bardes, Jean Ponce, Yann LeCun
cs.CVcs.AIcs.LGarXiv:2210.01571v12022Latent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image Generation
Alan Baade, Eric Ryan Chan, Kyle Sargent +4
cs.CVcs.LGarXiv:2602.11401v12026Autoregressive Video Generation without Vector Quantization
Haoge Deng, Ting Pan, Haiwen Diao +6
cs.CVarXiv:2412.14169v22024SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration
Ye Li, Yuan Meng, Zewen Sun +7
cs.CVcs.AIarXiv:2506.12723v32025Learning to Prune Filters in Convolutional Neural Networks
Qiangui Huang, Kevin Zhou, Suya You +1
cs.CVarXiv:1801.07365v12018Native Video-Action Pretraining for Generalizable Robot Control
Qihang Zhang, Lin Li, Luyao Zhang +26
cs.ROcs.CVarXiv:2607.08639v22026Omni Aggregation Networks for Lightweight Image Super-Resolution
Hang Wang, Xuanhong Chen, Bingbing Ni +2
cs.CVarXiv:2304.10244v22023GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models
Pedram MohajerAnsari, Amir Salarpour, Run Wang +1
cs.CVarXiv:2608.29395v12026SAM2-UNet: Segment Anything 2 Makes Strong Encoder for Natural and Medical Image Segmentation
Xinyu Xiong, Zihuang Wu, Shuangyi Tan +6
cs.CVarXiv:2408.08870v12024Unpaired Image Super-Resolution using Pseudo-Supervision
Shunta Maeda
eess.IVcs.CVarXiv:2002.11397v12020MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle
Pranav Durai, Gary Doran
cs.CVarXiv:2608.28724v12026Captioning Images with Diverse Objects
Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3
cs.CVcs.CLarXiv:1606.07770v32016Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and Stereo
Lukas Mehl, Jenny Schmalfuss, Azin Jahedi +2
cs.CVarXiv:2303.01943v12023RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss
Andong Lu, Chenglong Li, Yuqing Yan +2
cs.CVarXiv:2011.07189v32020Online Learning of Correspondences between Images
Michael Felsberg, Fredrik Larsson, Johan Wiklund +2
cs.CVarXiv:2608.13104v12026Beyond Max-Margin: Class Margin Equilibrium for Few-shot Object Detection
Bohao Li, Boyu Yang, Chang Liu +3
cs.CVarXiv:2103.04612v32021SGTR: End-to-end Scene Graph Generation with Transformer
Rongjie Li, Songyang Zhang, Xuming He
cs.CVcs.LGarXiv:2112.12970v32021OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
Yihe Deng, Hritik Bansal, Fan Yin +3
cs.CVcs.CLarXiv:2503.17352v32025Interpreting CLIP with Hierarchical Sparse Autoencoders
Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek
cs.CVcs.AIcs.LGarXiv:2502.20578v22025Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images
Basudha Pal, Arjun Narayanan, Neha Ajith +2
cs.CVarXiv:2608.29456v12026Adaptive Homophily Clustering: Structure Homophily Graph Learning with Adaptive Filter for Hyperspectral Image
Yao Ding, Weijie Kang, Aitao Yang +5
cs.CVarXiv:2501.01595v22025High-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and its Applications to High-Level Vision
Gedas Bertasius, Jianbo Shi, Lorenzo Torresani
cs.CVarXiv:1504.06201v32015Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs
Yu Cheng, Arushi Goel, Hakan Bilen
cs.CVarXiv:2608.29374v12026CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution
Xin Liu, Jie Liu, Jie Tang +1
cs.CVarXiv:2503.06896v12025DeepStory: Video Story QA by Deep Embedded Memory Networks
Kyung-Min Kim, Min-Oh Heo, Seong-Ho Choi +1
cs.CVcs.AIcs.CLarXiv:1707.00836v12017RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation
Yuhan Li, Xianfeng Tan, Fangao Zeng +6
cs.CVcs.AIarXiv:2608.29280v12026MNN: A Universal and Efficient Inference Engine
Xiaotang Jiang, Huan Wang, Yiliu Chen +9
cs.CVcs.DCcs.LGarXiv:2002.12418v12020Pooled Motion Features for First-Person Videos
M. S. Ryoo, Brandon Rothrock, Larry Matthies
cs.CVarXiv:1412.6505v22014VideoRAG: Retrieval-Augmented Generation over Video Corpus
Soyeong Jeong, Kangsan Kim, Jinheon Baek +1
cs.CVcs.AIcs.CLarXiv:2501.05874v32025DiffuScene: Denoising Diffusion Models for Generative Indoor Scene Synthesis
Jiapeng Tang, Yinyu Nie, Lev Markhasin +3
cs.CVarXiv:2303.14207v22023Wavelet-Assisted Multi-Frequency Attention Network for Pansharpening
Jie Huang, Rui Huang, Jinghao Xu +3
eess.IVcs.AIcs.CVarXiv:2502.04903v12025ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-Shot
Jiarui Cai, Yizhou Wang, Jenq-Neng Hwang
cs.CVarXiv:2108.02385v12021Image Processing using Smooth Ordering of its Patches
Idan Ram, Michael Elad, Israel Cohen
cs.CVarXiv:1210.3832v12012Graph-Based Blind Image Deblurring From a Single Photograph
Yuanchao Bai, Gene Cheung, Xianming Liu +1
cs.CVarXiv:1802.07929v12018Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network
Bairui Wang, Lin Ma, Wei Zhang +3
cs.CVarXiv:1908.10072v12019PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet)
Mohammed Q. Alkhatib
cs.CVarXiv:2605.31137v12026Collaborative Global-Local Networks for Memory-Efficient Segmentation of Ultra-High Resolution Images
Wuyang Chen, Ziyu Jiang, Zhangyang Wang +2
cs.CVarXiv:1905.06368v32019Meta Batch-Instance Normalization for Generalizable Person Re-Identification
Seokeon Choi, Taekyung Kim, Minki Jeong +2
cs.CVarXiv:2011.14670v22020R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
Huanjin Yao, Qixiang Yin, Jingyi Zhang +8
cs.CVcs.AIcs.CLarXiv:2505.16673v12025