Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

4,261 to 4,320 of 18,780

  1. SPLG-Mamba: Structure-Preserving Local-Global Mamba Network for Salient Object Detection in Optical Remote Sensing Images

    Yi Xu, Ruichao Hou, Tongwei Ren +1

    cs.CVarXiv:2608.29626v12026
  2. Style Transfer for Anime Sketches with Enhanced Residual U-net and Auxiliary Classifier GAN

    Lvmin Zhang, Yi Ji, Xin Lin

    cs.CVarXiv:1706.03319v22017
  3. Chemception: A Deep Neural Network with Minimal Chemistry Knowledge Matches the Performance of Expert-developed QSAR/QSPR Models

    Garrett B. Goh, Charles Siegel, Abhinav Vishnu +2

    stat.MLcs.AIcs.CEarXiv:1706.06689v12017
  4. Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models

    Weichen Fan, Chenyang Si, Junhao Song +16

    cs.CVcs.LGarXiv:2501.08453v12025
  5. WorldSculpt: Generating Compositional Worlds from Grounded Videos

    Muyao Niu, Jixuan He, Ruihan Yu +9

    cs.CVarXiv:2609.05416v12026
  6. Adversarial Dropout for Supervised and Semi-supervised Learning

    Sungrae Park, Jun-Keon Park, Su-Jin Shin +1

    cs.LGcs.CVarXiv:1707.03631v22017
  7. Text-to-Image Diffusion Models are Zero-Shot Classifiers

    Kevin Clark, Priyank Jaini

    cs.CVcs.AIcs.LGarXiv:2303.15233v22023
  8. Goku: Flow Based Video Generative Foundation Models

    Shoufa Chen, Chongjian Ge, Yuqi Zhang +19

    cs.CVarXiv:2502.04896v22025
  9. Strip R-CNN: Large Strip Convolution for Remote Sensing Object Detection

    Xinbin Yuan, Zhaohui Zheng, Yuxuan Li +5

    cs.CVarXiv:2501.03775v42025
  10. MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators

    Yaqi Zhang, Di Huang, Bin Liu +7

    cs.CVcs.AIarXiv:2306.10900v22023
  11. Scalable Vision Language Model Training via High Quality Data Curation

    Hongyuan Dong, Zijian Kang, Weijie Yin +3

    cs.CVcs.CLarXiv:2501.05952v32025
  12. Fine-graind Image Classification via Combining Vision and Language

    Xiangteng He, Yuxin Peng

    cs.CVarXiv:1704.02792v22017
  13. On the Arbitrary-Oriented Object Detection: Classification based Approaches Revisited

    Xue Yang, Junchi Yan

    cs.CVcs.AIarXiv:2003.05597v42020
  14. RoboGround: Robotic Manipulation with Grounded Vision-Language Priors

    Haifeng Huang, Xinyi Chen, Yilun Chen +6

    cs.ROcs.CVarXiv:2504.21530v12025
  15. HyperDiffusion: Generating Implicit Neural Fields with Weight-Space Diffusion

    Ziya Erkoç, Fangchang Ma, Qi Shan +2

    cs.CVcs.LGarXiv:2303.17015v12023
  16. Amodal Instance Segmentation

    Ke Li, Jitendra Malik

    cs.CVarXiv:1604.08202v22016
  17. LEMUR 2: Unlocking Neural Network Diversity for AI

    Tolgay Atinc Uzun, Waleed Khalid, Saif U Din +17

    cs.LGcs.CVarXiv:2607.06839v12026
  18. SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization

    Xianzhi Du, Tsung-Yi Lin, Pengchong Jin +5

    cs.CVcs.LGeess.IVarXiv:1912.05027v32019
  19. Bio-inspired digit recognition using reward-modulated spike-timing-dependent plasticity in deep convolutional networks

    Milad Mozafari, Mohammad Ganjtabesh, Abbas Nowzari-Dalini +2

    cs.CVq-bio.NCarXiv:1804.00227v32018
  20. Online PCB Defect Detector On A New PCB Defect Dataset

    Sanli Tang, Fan He, Xiaolin Huang +1

    cs.CVarXiv:1902.06197v12019
  21. MeshSDF: Differentiable Iso-Surface Extraction

    Edoardo Remelli, Artem Lukoianov, Stephan R. Richter +4

    cs.CVarXiv:2006.03997v22020
  22. VICRegL: Self-Supervised Learning of Local Visual Features

    Adrien Bardes, Jean Ponce, Yann LeCun

    cs.CVcs.AIcs.LGarXiv:2210.01571v12022
  23. Latent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image Generation

    Alan Baade, Eric Ryan Chan, Kyle Sargent +4

    cs.CVcs.LGarXiv:2602.11401v12026
  24. Autoregressive Video Generation without Vector Quantization

    Haoge Deng, Ting Pan, Haiwen Diao +6

    cs.CVarXiv:2412.14169v22024
  25. SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration

    Ye Li, Yuan Meng, Zewen Sun +7

    cs.CVcs.AIarXiv:2506.12723v32025
  26. Learning to Prune Filters in Convolutional Neural Networks

    Qiangui Huang, Kevin Zhou, Suya You +1

    cs.CVarXiv:1801.07365v12018
  27. Native Video-Action Pretraining for Generalizable Robot Control

    Qihang Zhang, Lin Li, Luyao Zhang +26

    cs.ROcs.CVarXiv:2607.08639v22026
  28. Omni Aggregation Networks for Lightweight Image Super-Resolution

    Hang Wang, Xuanhong Chen, Bingbing Ni +2

    cs.CVarXiv:2304.10244v22023
  29. GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models

    Pedram MohajerAnsari, Amir Salarpour, Run Wang +1

    cs.CVarXiv:2608.29395v12026
  30. SAM2-UNet: Segment Anything 2 Makes Strong Encoder for Natural and Medical Image Segmentation

    Xinyu Xiong, Zihuang Wu, Shuangyi Tan +6

    cs.CVarXiv:2408.08870v12024
  31. Unpaired Image Super-Resolution using Pseudo-Supervision

    Shunta Maeda

    eess.IVcs.CVarXiv:2002.11397v12020
  32. MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle

    Pranav Durai, Gary Doran

    cs.CVarXiv:2608.28724v12026
  33. Captioning Images with Diverse Objects

    Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3

    cs.CVcs.CLarXiv:1606.07770v32016
  34. Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and Stereo

    Lukas Mehl, Jenny Schmalfuss, Azin Jahedi +2

    cs.CVarXiv:2303.01943v12023
  35. RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss

    Andong Lu, Chenglong Li, Yuqing Yan +2

    cs.CVarXiv:2011.07189v32020
  36. Online Learning of Correspondences between Images

    Michael Felsberg, Fredrik Larsson, Johan Wiklund +2

    cs.CVarXiv:2608.13104v12026
  37. Beyond Max-Margin: Class Margin Equilibrium for Few-shot Object Detection

    Bohao Li, Boyu Yang, Chang Liu +3

    cs.CVarXiv:2103.04612v32021
  38. SGTR: End-to-end Scene Graph Generation with Transformer

    Rongjie Li, Songyang Zhang, Xuming He

    cs.CVcs.LGarXiv:2112.12970v32021
  39. OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles

    Yihe Deng, Hritik Bansal, Fan Yin +3

    cs.CVcs.CLarXiv:2503.17352v32025
  40. Interpreting CLIP with Hierarchical Sparse Autoencoders

    Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek

    cs.CVcs.AIcs.LGarXiv:2502.20578v22025
  41. Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images

    Basudha Pal, Arjun Narayanan, Neha Ajith +2

    cs.CVarXiv:2608.29456v12026
  42. Adaptive Homophily Clustering: Structure Homophily Graph Learning with Adaptive Filter for Hyperspectral Image

    Yao Ding, Weijie Kang, Aitao Yang +5

    cs.CVarXiv:2501.01595v22025
  43. High-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and its Applications to High-Level Vision

    Gedas Bertasius, Jianbo Shi, Lorenzo Torresani

    cs.CVarXiv:1504.06201v32015
  44. Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

    Yu Cheng, Arushi Goel, Hakan Bilen

    cs.CVarXiv:2608.29374v12026
  45. CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution

    Xin Liu, Jie Liu, Jie Tang +1

    cs.CVarXiv:2503.06896v12025
  46. DeepStory: Video Story QA by Deep Embedded Memory Networks

    Kyung-Min Kim, Min-Oh Heo, Seong-Ho Choi +1

    cs.CVcs.AIcs.CLarXiv:1707.00836v12017
  47. RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

    Yuhan Li, Xianfeng Tan, Fangao Zeng +6

    cs.CVcs.AIarXiv:2608.29280v12026
  48. MNN: A Universal and Efficient Inference Engine

    Xiaotang Jiang, Huan Wang, Yiliu Chen +9

    cs.CVcs.DCcs.LGarXiv:2002.12418v12020
  49. Pooled Motion Features for First-Person Videos

    M. S. Ryoo, Brandon Rothrock, Larry Matthies

    cs.CVarXiv:1412.6505v22014
  50. VideoRAG: Retrieval-Augmented Generation over Video Corpus

    Soyeong Jeong, Kangsan Kim, Jinheon Baek +1

    cs.CVcs.AIcs.CLarXiv:2501.05874v32025
  51. DiffuScene: Denoising Diffusion Models for Generative Indoor Scene Synthesis

    Jiapeng Tang, Yinyu Nie, Lev Markhasin +3

    cs.CVarXiv:2303.14207v22023
  52. Wavelet-Assisted Multi-Frequency Attention Network for Pansharpening

    Jie Huang, Rui Huang, Jinghao Xu +3

    eess.IVcs.AIcs.CVarXiv:2502.04903v12025
  53. ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-Shot

    Jiarui Cai, Yizhou Wang, Jenq-Neng Hwang

    cs.CVarXiv:2108.02385v12021
  54. Image Processing using Smooth Ordering of its Patches

    Idan Ram, Michael Elad, Israel Cohen

    cs.CVarXiv:1210.3832v12012
  55. Graph-Based Blind Image Deblurring From a Single Photograph

    Yuanchao Bai, Gene Cheung, Xianming Liu +1

    cs.CVarXiv:1802.07929v12018
  56. Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network

    Bairui Wang, Lin Ma, Wei Zhang +3

    cs.CVarXiv:1908.10072v12019
  57. PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet)

    Mohammed Q. Alkhatib

    cs.CVarXiv:2605.31137v12026
  58. Collaborative Global-Local Networks for Memory-Efficient Segmentation of Ultra-High Resolution Images

    Wuyang Chen, Ziyu Jiang, Zhangyang Wang +2

    cs.CVarXiv:1905.06368v32019
  59. Meta Batch-Instance Normalization for Generalizable Person Re-Identification

    Seokeon Choi, Taekyung Kim, Minki Jeong +2

    cs.CVarXiv:2011.14670v22020
  60. R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

    Huanjin Yao, Qixiang Yin, Jingyi Zhang +8

    cs.CVcs.AIcs.CLarXiv:2505.16673v12025