Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

12,721 to 12,780 of 18,839

  1. Searching for Efficient Multi-Scale Architectures for Dense Image Prediction

    Liang-Chieh Chen, Maxwell D. Collins, Yukun Zhu +5

    cs.CVcs.LGstat.MLarXiv:1809.04184v12018
  2. Neural Activation Constellations: Unsupervised Part Model Discovery with Convolutional Networks

    Marcel Simon, Erik Rodner

    cs.CVarXiv:1504.08289v32015
  3. Learning Fashion Compatibility with Bidirectional LSTMs

    Xintong Han, Zuxuan Wu, Yu-Gang Jiang +1

    cs.CVarXiv:1707.05691v12017
  4. CAD-Net: A Context-Aware Detection Network for Objects in Remote Sensing Imagery

    Gongjie Zhang, Shijian Lu, Wei Zhang

    cs.CVarXiv:1903.00857v12019
  5. On the "steerability" of generative adversarial networks

    Ali Jahanian, Lucy Chai, Phillip Isola

    cs.CVcs.LGarXiv:1907.07171v42019
  6. DocFormer: End-to-End Transformer for Document Understanding

    Srikar Appalaraju, Bhavan Jasani, Bhargava Urala Kota +2

    cs.CVarXiv:2106.11539v22021
  7. LayoutGPT: Compositional Visual Planning and Generation with Large Language Models

    Weixi Feng, Wanrong Zhu, Tsu-jui Fu +6

    cs.CVcs.AIarXiv:2305.15393v22023
    Summaries:한국어
  8. Robotic Tactile Perception of Object Properties: A Review

    Shan Luo, Joao Bimbo, Ravinder Dahiya +1

    cs.ROcs.CVarXiv:1711.03810v12017
  9. When Radiology Report Generation Meets Knowledge Graph

    Yixiao Zhang, Xiaosong Wang, Ziyue Xu +3

    cs.CVcs.AIcs.LGarXiv:2002.08277v12020
  10. Cross-domain Image Retrieval with a Dual Attribute-aware Ranking Network

    Junshi Huang, Rogerio S. Feris, Qiang Chen +1

    cs.CVarXiv:1505.07922v12015
  11. Modeling Relationships in Referential Expressions with Compositional Modular Networks

    Ronghang Hu, Marcus Rohrbach, Jacob Andreas +2

    cs.CVarXiv:1611.09978v12016
  12. Multidimensional classification of hippocampal shape features discriminates Alzheimer's disease and mild cognitive impairment from normal aging

    Emilie Gerardin, Gaël Chételat, Marie Chupin +9

    cs.CVq-bio.NCstat.MLarXiv:1707.05961v12017
  13. SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic Scenes

    Yi-Hua Huang, Yang-Tian Sun, Ziyi Yang +3

    cs.CVcs.GRarXiv:2312.14937v32023
  14. Fast Supervised Hashing with Decision Trees for High-Dimensional Data

    Guosheng Lin, Chunhua Shen, Qinfeng Shi +2

    cs.CVcs.LGarXiv:1404.1561v22014
  15. Comparative Evaluation of 3D Reconstruction Methods for Immersive Visualization of Laboratory Objects

    Brian De La Cruz, Aaron Y. Zhao, Maitrey Gramopadhye +4

    cs.GRcs.CVcs.HCarXiv:2608.27301v12026
  16. Parameter-Efficient pretrained-CT-to-MRI Transfer for Rectal Cancer Segmentation: Performance-Calibration Trade-offs

    Aneesh Rangnekar, Jorge Tapias Gomez, Joseph O Deasy +1

    cs.CVarXiv:2608.27178v12026
  17. Visually Indicated Sounds

    Andrew Owens, Phillip Isola, Josh McDermott +3

    cs.CVcs.LGcs.SDarXiv:1512.08512v22015
  18. Quantization Networks

    Jiwei Yang, Xu Shen, Jun Xing +5

    cs.CVcs.LGstat.MLarXiv:1911.09464v22019
  19. Controllable Text-to-Image Generation

    Bowen Li, Xiaojuan Qi, Thomas Lukasiewicz +1

    cs.CVcs.CLcs.LGarXiv:1909.07083v22019
  20. Bi-Directional ConvLSTM U-Net with Densley Connected Convolutions

    Reza Azad, Maryam Asadi-Aghbolaghi, Mahmood Fathy +1

    eess.IVcs.CVarXiv:1909.00166v12019
  21. Semantic Drift Compensation for Class-Incremental Learning

    Lu Yu, Bartłomiej Twardowski, Xialei Liu +5

    cs.CVcs.LGarXiv:2004.00440v12020
  22. Blind Image Quality Assessment via Vision-Language Correspondence: A Multitask Learning Perspective

    Weixia Zhang, Guangtao Zhai, Ying Wei +2

    cs.CVcs.LGarXiv:2303.14968v12023
  23. FourCastNet: Accelerating Global High-Resolution Weather Forecasting using Adaptive Fourier Neural Operators

    Thorsten Kurth, Shashank Subramanian, Peter Harrington +6

    physics.ao-phcs.AIcs.CVarXiv:2208.05419v12022
  24. Diffusion Models for Medical Anomaly Detection

    Julia Wolleb, Florentin Bieder, Robin Sandkühler +1

    eess.IVcs.CVarXiv:2203.04306v22022
  25. An Embodied Generalist Agent in 3D World

    Jiangyong Huang, Silong Yong, Xiaojian Ma +7

    cs.CVcs.AIcs.CLarXiv:2311.12871v32023
  26. 3D-FUTURE: 3D Furniture shape with TextURE

    Huan Fu, Rongfei Jia, Lin Gao +4

    cs.CVarXiv:2009.09633v12020
  27. Knowledge-Embedded Routing Network for Scene Graph Generation

    Tianshui Chen, Weihao Yu, Riquan Chen +1

    cs.CVarXiv:1903.03326v12019
  28. Diffusion Models for Implicit Image Segmentation Ensembles

    Julia Wolleb, Robin Sandkühler, Florentin Bieder +2

    cs.CVarXiv:2112.03145v22021
  29. TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes

    Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei +9

    cs.ROcs.CVarXiv:2608.26578v12026
  30. Point-M2AE: Multi-scale Masked Autoencoders for Hierarchical Point Cloud Pre-training

    Renrui Zhang, Ziyu Guo, Rongyao Fang +5

    cs.CVcs.AIarXiv:2205.14401v22022
  31. Modeling Temporal Dynamics and Spatial Configurations of Actions Using Two-Stream Recurrent Neural Networks

    Hongsong Wang, Liang Wang

    cs.CVarXiv:1704.02581v22017
  32. Learning to Quantize Deep Networks by Optimizing Quantization Intervals with Task Loss

    Sangil Jung, Changyong Son, Seohyung Lee +5

    cs.CVarXiv:1808.05779v32018
  33. Revisiting Single Image Depth Estimation: Toward Higher Resolution Maps with Accurate Object Boundaries

    Junjie Hu, Mete Ozay, Yan Zhang +1

    cs.CVarXiv:1803.08673v22018
  34. A Novel Transformer Based Semantic Segmentation Scheme for Fine-Resolution Remote Sensing Images

    Libo Wang, Rui Li, Chenxi Duan +3

    cs.CVarXiv:2104.12137v62021
  35. ClassMix: Segmentation-Based Data Augmentation for Semi-Supervised Learning

    Viktor Olsson, Wilhelm Tranheden, Juliano Pinto +1

    cs.CVarXiv:2007.07936v22020
  36. LVBench: An Extreme Long Video Understanding Benchmark

    Weihan Wang, Zehai He, Wenyi Hong +9

    cs.CVcs.AIarXiv:2406.08035v32024
  37. DeepLiDAR: Deep Surface Normal Guided Depth Prediction for Outdoor Scene from Sparse LiDAR Data and Single Color Image

    Jiaxiong Qiu, Zhaopeng Cui, Yinda Zhang +4

    cs.CVarXiv:1812.00488v22018
  38. Learning Visual Features from Large Weakly Supervised Data

    Armand Joulin, Laurens van der Maaten, Allan Jabri +1

    cs.CVarXiv:1511.02251v12015
  39. Image Restoration Using Convolutional Auto-encoders with Symmetric Skip Connections

    Xiao-Jiao Mao, Chunhua Shen, Yu-Bin Yang

    cs.CVarXiv:1606.08921v32016
  40. Scaling and Benchmarking Self-Supervised Visual Representation Learning

    Priya Goyal, Dhruv Mahajan, Abhinav Gupta +1

    cs.CVcs.AIcs.LGarXiv:1905.01235v22019
  41. Near-Online Multi-target Tracking with Aggregated Local Flow Descriptor

    Wongun Choi

    cs.CVarXiv:1504.02340v12015
  42. Towards Fairness in Visual Recognition: Effective Strategies for Bias Mitigation

    Zeyu Wang, Klint Qinami, Ioannis Christos Karakozis +4

    cs.CVarXiv:1911.11834v22019
  43. SRFlow: Learning the Super-Resolution Space with Normalizing Flow

    Andreas Lugmayr, Martin Danelljan, Luc Van Gool +1

    cs.CVeess.IVarXiv:2006.14200v22020
  44. Checkerboard Context Model for Efficient Learned Image Compression

    Dailan He, Yaoyan Zheng, Baocheng Sun +2

    eess.IVcs.CVarXiv:2103.15306v22021
  45. Advanced Steel Microstructural Classification by Deep Learning Methods

    Seyed Majid Azimi, Dominik Britz, Michael Engstler +2

    cs.CVcond-mat.mtrl-sciarXiv:1706.06480v22017
  46. Domain-adversarial neural networks to address the appearance variability of histopathology images

    Maxime W. Lafarge, Josien P. W. Pluim, Koen A. J. Eppenhof +2

    cs.CVarXiv:1707.06183v12017
  47. Object Detection Networks on Convolutional Feature Maps

    Shaoqing Ren, Kaiming He, Ross Girshick +2

    cs.CVarXiv:1504.06066v22015
  48. Quality Assessment of In-the-Wild Videos

    Dingquan Li, Tingting Jiang, Ming Jiang

    cs.MMcs.CVeess.IVarXiv:1908.00375v32019
  49. Stereo Magnification: Learning View Synthesis using Multiplane Images

    Tinghui Zhou, Richard Tucker, John Flynn +2

    cs.CVcs.GRarXiv:1805.09817v12018
  50. The Intrinsic Dimension of Images and Its Impact on Learning

    Phillip Pope, Chen Zhu, Ahmed Abdelkader +2

    cs.CVcs.LGstat.MLarXiv:2104.08894v12021
  51. DeepLung: Deep 3D Dual Path Nets for Automated Pulmonary Nodule Detection and Classification

    Wentao Zhu, Chaochun Liu, Wei Fan +1

    cs.CVcs.LGcs.NEarXiv:1801.09555v12018
  52. Real-time Multiple People Tracking with Deeply Learned Candidate Selection and Person Re-Identification

    Long Chen, Haizhou Ai, Zijie Zhuang +1

    cs.CVarXiv:1809.04427v12018
  53. SegFlow: Joint Learning for Video Object Segmentation and Optical Flow

    Jingchun Cheng, Yi-Hsuan Tsai, Shengjin Wang +1

    cs.CVarXiv:1709.06750v12017
  54. PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

    Junjie Liu, Shengyuan Ye, Xu Chen

    cs.CVcs.AIarXiv:2608.27206v12026
  55. NeuS2: Fast Learning of Neural Implicit Surfaces for Multi-view Reconstruction

    Yiming Wang, Qin Han, Marc Habermann +3

    cs.CVcs.GRarXiv:2212.05231v32022
  56. AVEC 2019 Workshop and Challenge: State-of-Mind, Detecting Depression with AI, and Cross-Cultural Affect Recognition

    Fabien Ringeval, Björn Schuller, Michel Valstar +14

    cs.HCcs.CVcs.IRarXiv:1907.11510v12019
  57. Mask3D: Mask Transformer for 3D Semantic Instance Segmentation

    Jonas Schult, Francis Engelmann, Alexander Hermans +3

    cs.CVarXiv:2210.03105v22022
  58. Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning

    Abhishek Das, Satwik Kottur, José M. F. Moura +2

    cs.CVcs.AIcs.CLarXiv:1703.06585v22017
  59. Is synthetic data from generative models ready for image recognition?

    Ruifei He, Shuyang Sun, Xin Yu +5

    cs.CVarXiv:2210.07574v22022
  60. Hierarchical Neural Architecture Search for Deep Stereo Matching

    Xuelian Cheng, Yiran Zhong, Mehrtash Harandi +5

    cs.CVarXiv:2010.13501v12020