Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

10,441 to 10,500 of 18,866

  1. Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations

    Yucheng Hu, Yanjiang Guo, Pengchao Wang +6

    cs.CVcs.ROarXiv:2412.14803v22024
  2. Causality Inspired Representation Learning for Domain Generalization

    Fangrui Lv, Jian Liang, Shuang Li +4

    cs.LGcs.CVarXiv:2203.14237v12022
  3. Learning to predict crisp boundaries

    Ruoxi Deng, Chunhua Shen, Shengjun Liu +2

    cs.CVarXiv:1807.10097v12018
  4. AGORA: Avatars in Geography Optimized for Regression Analysis

    Priyanka Patel, Chun-Hao P. Huang, Joachim Tesch +3

    cs.CVarXiv:2104.14643v12021
  5. CASENet: Deep Category-Aware Semantic Edge Detection

    Zhiding Yu, Chen Feng, Ming-Yu Liu +1

    cs.CVarXiv:1705.09759v12017
  6. MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions

    Henghui Ding, Chang Liu, Shuting He +2

    cs.CVarXiv:2308.08544v12023
  7. One-Step Effective Diffusion Network for Real-World Image Super-Resolution

    Rongyuan Wu, Lingchen Sun, Zhiyuan Ma +1

    eess.IVcs.CVarXiv:2406.08177v32024
  8. Video Understanding with Large Language Models: A Survey

    Yolo Y. Tang, Jing Bi, Siting Xu +17

    cs.CVcs.CLarXiv:2312.17432v82023
  9. Banach Wasserstein GAN

    Jonas Adler, Sebastian Lunz

    cs.CVcs.LGmath.FAarXiv:1806.06621v22018
  10. Zero-Shot Video Object Segmentation via Attentive Graph Neural Networks

    Wenguan Wang, Xiankai Lu, Jianbing Shen +2

    cs.CVarXiv:2001.06807v12020
  11. Deep Learning of Local RGB-D Patches for 3D Object Detection and 6D Pose Estimation

    Wadim Kehl, Fausto Milletari, Federico Tombari +2

    cs.CVarXiv:1607.06038v12016
  12. Transformation-Grounded Image Generation Network for Novel 3D View Synthesis

    Eunbyung Park, Jimei Yang, Ersin Yumer +2

    cs.CVarXiv:1703.02921v12017
  13. Does Object Recognition Work for Everyone?

    Terrance DeVries, Ishan Misra, Changhan Wang +1

    cs.CVcs.LGarXiv:1906.02659v22019
  14. ICDAR2019 Robust Reading Challenge on Multi-lingual Scene Text Detection and Recognition -- RRC-MLT-2019

    Nibal Nayef, Yash Patel, Michal Busta +8

    cs.CVarXiv:1907.00945v12019
  15. Collaborative Video Object Segmentation by Foreground-Background Integration

    Zongxin Yang, Yunchao Wei, Yi Yang

    cs.CVarXiv:2003.08333v22020
  16. Unsupervised Person Re-identification via Softened Similarity Learning

    Yutian Lin, Lingxi Xie, Yu Wu +2

    cs.CVarXiv:2004.03547v12020
  17. Augmentor: An Image Augmentation Library for Machine Learning

    Marcus D. Bloice, Christof Stocker, Andreas Holzinger

    cs.CVcs.LGstat.MLarXiv:1708.04680v12017
  18. GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation

    Chi-Lam Cheang, Guangzeng Chen, Ya Jing +9

    cs.ROcs.CVcs.LGarXiv:2410.06158v12024
  19. Smooth Grad-CAM++: An Enhanced Inference Level Visualization Technique for Deep Convolutional Neural Network Models

    Daniel Omeiza, Skyler Speakman, Celia Cintas +1

    cs.CVarXiv:1908.01224v12019
  20. Unsupervised Domain Adaptation with Similarity Learning

    Pedro O. Pinheiro

    cs.CVarXiv:1711.08995v22017
  21. Episodic Curiosity through Reachability

    Nikolay Savinov, Anton Raichuk, Raphaël Marinier +4

    cs.LGcs.AIcs.CVarXiv:1810.02274v52018
  22. The KFIoU Loss for Rotated Object Detection

    Xue Yang, Yue Zhou, Gefan Zhang +5

    cs.CVcs.AIcs.LGarXiv:2201.12558v62022
  23. MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding

    Bo He, Hengduo Li, Young Kyun Jang +5

    cs.CVarXiv:2404.05726v22024
  24. Locate, Size and Count: Accurately Resolving People in Dense Crowds via Detection

    Deepak Babu Sam, Skand Vishwanath Peri, Mukuntha Narayanan Sundararaman +2

    cs.CVarXiv:1906.07538v32019
  25. Diverse Embedding Expansion Network and Low-Light Cross-Modality Benchmark for Visible-Infrared Person Re-identification

    Yukang Zhang, Hanzi Wang

    cs.CVarXiv:2303.14481v12023
  26. Weakly Supervised Instance Segmentation using Class Peak Response

    Yanzhao Zhou, Yi Zhu, Qixiang Ye +2

    cs.CVarXiv:1804.00880v12018
  27. A Joint Speaker-Listener-Reinforcer Model for Referring Expressions

    Licheng Yu, Hao Tan, Mohit Bansal +1

    cs.CVcs.AIcs.CLarXiv:1612.09542v22016
  28. Self-Supervision with Superpixels: Training Few-shot Medical Image Segmentation without Annotation

    Cheng Ouyang, Carlo Biffi, Chen Chen +3

    cs.CVarXiv:2007.09886v22020
  29. Unlocking High-Accuracy Differentially Private Image Classification through Scale

    Soham De, Leonard Berrada, Jamie Hayes +2

    cs.LGcs.CRcs.CVarXiv:2204.13650v22022
  30. Delving into Out-of-Distribution Detection with Vision-Language Representations

    Yifei Ming, Ziyang Cai, Jiuxiang Gu +3

    cs.CVcs.AIcs.LGarXiv:2211.13445v12022
  31. Superpixel Sampling Networks

    Varun Jampani, Deqing Sun, Ming-Yu Liu +2

    cs.CVarXiv:1807.10174v12018
  32. Memory Matching Networks for One-Shot Image Recognition

    Qi Cai, Yingwei Pan, Ting Yao +2

    cs.CVarXiv:1804.08281v12018
  33. Category-Specific Object Reconstruction from a Single Image

    Abhishek Kar, Shubham Tulsiani, João Carreira +1

    cs.CVarXiv:1411.6069v22014
  34. Self-Supervised Model Adaptation for Multimodal Semantic Segmentation

    Abhinav Valada, Rohit Mohan, Wolfram Burgard

    cs.CVarXiv:1808.03833v32018
  35. Anti-Adversarially Manipulated Attributions for Weakly and Semi-Supervised Semantic Segmentation

    Jungbeom Lee, Eunji Kim, Sungroh Yoon

    cs.CVarXiv:2103.08896v12021
  36. Learning Spatial-Spectral Prior for Super-Resolution of Hyperspectral Imagery

    Junjun Jiang, He Sun, Xianming Liu +1

    eess.IVcs.CVcs.LGarXiv:2005.08752v22020
  37. Single-Image HDR Reconstruction by Learning to Reverse the Camera Pipeline

    Yu-Lun Liu, Wei-Sheng Lai, Yu-Sheng Chen +4

    eess.IVcs.CVarXiv:2004.01179v12020
  38. NO Need to Worry about Adversarial Examples in Object Detection in Autonomous Vehicles

    Jiajun Lu, Hussein Sibai, Evan Fabry +1

    cs.CVcs.AIcs.CRarXiv:1707.03501v12017
  39. Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities

    Enneng Yang, Li Shen, Guibing Guo +4

    cs.LGcs.AIcs.CLarXiv:2408.07666v52024
  40. Cross-Modality Attentive Feature Fusion for Object Detection in Multispectral Remote Sensing Imagery

    Qingyun Fang, Zhaokui Wang

    cs.CVcs.AIeess.IVarXiv:2112.02991v12021
  41. What Can Help Pedestrian Detection?

    Jiayuan Mao, Tete Xiao, Yuning Jiang +1

    cs.CVarXiv:1705.02757v12017
  42. Multi-level Wavelet Convolutional Neural Networks

    Pengju Liu, Hongzhi Zhang, Wei Lian +1

    cs.CVeess.IVarXiv:1907.03128v12019
  43. Deep Roots: Improving CNN Efficiency with Hierarchical Filter Groups

    Yani Ioannou, Duncan Robertson, Roberto Cipolla +1

    cs.NEcs.CVcs.LGarXiv:1605.06489v32016
  44. Wireless Deep Video Semantic Transmission

    Sixian Wang, Jincheng Dai, Zijian Liang +5

    cs.CVcs.ITarXiv:2205.13129v22022
  45. Explicit Knowledge-based Reasoning for Visual Question Answering

    Peng Wang, Qi Wu, Chunhua Shen +2

    cs.CVcs.CLarXiv:1511.02570v22015
  46. ChamNet: Towards Efficient Network Design through Platform-Aware Model Adaptation

    Xiaoliang Dai, Peizhao Zhang, Bichen Wu +10

    cs.CVcs.NEarXiv:1812.08934v12018
  47. Learning to Act by Predicting the Future

    Alexey Dosovitskiy, Vladlen Koltun

    cs.LGcs.AIcs.CVarXiv:1611.01779v22016
  48. Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity

    Byungseok Roh, JaeWoong Shin, Wuhyun Shin +1

    cs.CVcs.LGarXiv:2111.14330v22021
  49. VadCLIP: Adapting Vision-Language Models for Weakly Supervised Video Anomaly Detection

    Peng Wu, Xuerong Zhou, Guansong Pang +4

    cs.CVcs.MMarXiv:2308.11681v32023
  50. Continual Unsupervised Representation Learning

    Dushyant Rao, Francesco Visin, Andrei A. Rusu +3

    cs.LGcs.AIcs.CVarXiv:1910.14481v12019
  51. Model Adaptation with Synthetic and Real Data for Semantic Dense Foggy Scene Understanding

    Christos Sakaridis, Dengxin Dai, Simon Hecker +1

    cs.CVarXiv:1808.01265v12018
  52. Scene Text Recognition with Permuted Autoregressive Sequence Models

    Darwin Bautista, Rowel Atienza

    cs.CVcs.CLarXiv:2207.06966v12022
  53. Deep Learning Approaches for Data Augmentation in Medical Imaging: A Review

    Aghiles Kebaili, Jérôme Lapuyade-Lahorgue, Su Ruan

    eess.IVcs.CVarXiv:2307.13125v12023
  54. Breast Cancer Classification from Histopathological Images with Inception Recurrent Residual Convolutional Neural Network

    Md Zahangir Alom, Chris Yakopcic, Tarek M. Taha +1

    cs.CVarXiv:1811.04241v12018
  55. Channel-wise and Spatial Feature Modulation Network for Single Image Super-Resolution

    Yanting Hu, Jie Li, Yuanfei Huang +1

    cs.CVarXiv:1809.11130v12018
  56. Context Prior for Scene Segmentation

    Changqian Yu, Jingbo Wang, Changxin Gao +3

    cs.CVarXiv:2004.01547v12020
  57. CvxNet: Learnable Convex Decomposition

    Boyang Deng, Kyle Genova, Soroosh Yazdani +3

    cs.CVcs.GRcs.LGarXiv:1909.05736v42019
  58. Be Your Own Prada: Fashion Synthesis with Structural Coherence

    Shizhan Zhu, Sanja Fidler, Raquel Urtasun +2

    cs.CVarXiv:1710.07346v12017
  59. Depth-aware CNN for RGB-D Segmentation

    Weiyue Wang, Ulrich Neumann

    cs.CVarXiv:1803.06791v12018
  60. Toronto-3D: A Large-scale Mobile LiDAR Dataset for Semantic Segmentation of Urban Roadways

    Weikai Tan, Nannan Qin, Lingfei Ma +5

    cs.CVarXiv:2003.08284v32020