Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

14,401 to 14,460 of 18,817

  1. Generative Image Modeling using Style and Structure Adversarial Networks

    Xiaolong Wang, Abhinav Gupta

    cs.CVarXiv:1603.05631v22016
  2. TractSeg - Fast and accurate white matter tract segmentation

    Jakob Wasserthal, Peter Neher, Klaus H. Maier-Hein

    cs.CVeess.IVarXiv:1805.07103v22018
  3. Learning to Explore using Active Neural SLAM

    Devendra Singh Chaplot, Dhiraj Gandhi, Saurabh Gupta +2

    cs.CVcs.AIcs.LGarXiv:2004.05155v12020
  4. UTNet: A Hybrid Transformer Architecture for Medical Image Segmentation

    Yunhe Gao, Mu Zhou, Dimitris Metaxas

    cs.CVarXiv:2107.00781v22021
  5. The state of the art in kidney and kidney tumor segmentation in contrast-enhanced CT imaging: Results of the KiTS19 Challenge

    Nicholas Heller, Fabian Isensee, Klaus H. Maier-Hein +38

    eess.IVcs.CVcs.LGarXiv:1912.01054v22019
  6. HDR image reconstruction from a single exposure using deep CNNs

    Gabriel Eilertsen, Joel Kronander, Gyorgy Denes +2

    cs.CVcs.GRcs.LGarXiv:1710.07480v12017
  7. Cross-view Action Modeling, Learning and Recognition

    Jiang wang, Xiaohan Nie, Yin Xia +2

    cs.CVarXiv:1405.2941v12014
  8. ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language

    Dave Zhenyu Chen, Angel X. Chang, Matthias Nießner

    cs.CVcs.CLcs.LGarXiv:1912.08830v32019
  9. Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

    Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis +2

    cs.CVarXiv:2608.23869v12026
  10. Ask Your Neurons: A Neural-based Approach to Answering Questions about Images

    Mateusz Malinowski, Marcus Rohrbach, Mario Fritz

    cs.CVcs.AIcs.CLarXiv:1505.01121v32015
  11. ResNet strikes back: An improved training procedure in timm

    Ross Wightman, Hugo Touvron, Hervé Jégou

    cs.CVcs.LGarXiv:2110.00476v12021
  12. Real-Time User-Guided Image Colorization with Learned Deep Priors

    Richard Zhang, Jun-Yan Zhu, Phillip Isola +4

    cs.CVcs.GRarXiv:1705.02999v12017
  13. Cross-Domain Weakly-Supervised Object Detection through Progressive Domain Adaptation

    Naoto Inoue, Ryosuke Furuta, Toshihiko Yamasaki +1

    cs.CVarXiv:1803.11365v12018
  14. Understanding image representations by measuring their equivariance and equivalence

    Karel Lenc, Andrea Vedaldi

    cs.CVcs.LGcs.NEarXiv:1411.5908v22014
  15. Deep Marching Tetrahedra: a Hybrid Representation for High-Resolution 3D Shape Synthesis

    Tianchang Shen, Jun Gao, Kangxue Yin +2

    cs.CVcs.LGarXiv:2111.04276v12021
  16. Learning Enriched Features for Fast Image Restoration and Enhancement

    Syed Waqas Zamir, Aditya Arora, Salman Khan +4

    eess.IVcs.CVarXiv:2205.01649v12022
  17. DCAN: Deep Contour-Aware Networks for Accurate Gland Segmentation

    Hao Chen, Xiaojuan Qi, Lequan Yu +1

    cs.CVarXiv:1604.02677v12016
  18. Deep Learning is Robust to Massive Label Noise

    David Rolnick, Andreas Veit, Serge Belongie +1

    cs.LGcs.AIcs.CVarXiv:1705.10694v32017
  19. Spatiotemporal Distillation via Recurrent Bottlenecks for Aortic Tracking

    Dexter Wen Jie Teo, Nairouz Shehata, Herve Lombaert

    eess.IVcs.CVcs.LGarXiv:2608.23879v12026
  20. GAN Inversion: A Survey

    Weihao Xia, Yulun Zhang, Yujiu Yang +3

    cs.CVarXiv:2101.05278v52021
  21. P-CNN: Pose-based CNN Features for Action Recognition

    Guilhem Chéron, Ivan Laptev, Cordelia Schmid

    cs.CVarXiv:1506.03607v22015
  22. Deep Visual Attention Prediction

    Wenguan Wang, Jianbing Shen

    cs.CVarXiv:1705.02544v32017
  23. Learning to Detect Human-Object Interactions

    Yu-Wei Chao, Yunfan Liu, Xieyang Liu +2

    cs.CVarXiv:1702.05448v22017
  24. Spatio-Temporal Graph Transformer Networks for Pedestrian Trajectory Prediction

    Cunjun Yu, Xiao Ma, Jiawei Ren +2

    cs.CVcs.LGcs.ROarXiv:2005.08514v22020
  25. VizAnchor: Decoding Manipulation Intent from Tampering Visualizations via Dual-Anchor Reasoning

    Xiaotian Zhang, Huayuan Ye, Haiyang Zhang +3

    cs.CVcs.HCarXiv:2608.24535v12026
  26. Unbox the Black-box for the Medical Explainable AI via Multi-modal and Multi-centre Data Fusion: A Mini-Review, Two Showcases and Beyond

    Guang Yang, Qinghao Ye, Jun Xia

    cs.AIcs.CVcs.ITarXiv:2102.01998v12021
  27. SimpleNet: A Simple Network for Image Anomaly Detection and Localization

    Zhikang Liu, Yiming Zhou, Yuansheng Xu +1

    cs.CVarXiv:2303.15140v22023
  28. A Short Note about Kinetics-600

    Joao Carreira, Eric Noland, Andras Banki-Horvath +2

    cs.CVarXiv:1808.01340v12018
  29. Medical image denoising using convolutional denoising autoencoders

    Lovedeep Gondara

    cs.CVstat.MLarXiv:1608.04667v22016
  30. Deep Learning for Deepfakes Creation and Detection: A Survey

    Thanh Thi Nguyen, Quoc Viet Hung Nguyen, Dung Tien Nguyen +6

    cs.CVcs.LGeess.IVarXiv:1909.11573v52019
  31. Building Change Detection for Remote Sensing Images Using a Dual Task Constrained Deep Siamese Convolutional Network Model

    Yi Liu, Chao Pang, Zongqian Zhan +2

    cs.CVarXiv:1909.07726v12019
  32. Unifying Vision-and-Language Tasks via Text Generation

    Jaemin Cho, Jie Lei, Hao Tan +1

    cs.CLcs.AIcs.CVarXiv:2102.02779v22021
  33. Native-Space 3D CarveMix for Multi-Site T1w Stroke Segmentation

    Dexter Wen Jie Teo, Kumaradevan Punithakumar

    eess.IVcs.CVarXiv:2608.23882v12026
  34. Robust Scene Text Recognition with Automatic Rectification

    Baoguang Shi, Xinggang Wang, Pengyuan Lyu +2

    cs.CVarXiv:1603.03915v22016
  35. Tip-Adapter: Training-free Adaption of CLIP for Few-shot Classification

    Renrui Zhang, Zhang Wei, Rongyao Fang +5

    cs.CVcs.AIcs.CLarXiv:2207.09519v12022
  36. Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

    Jaemoo Choi, Wei Guo, Yuchen Zhu +4

    cs.CVcs.LGarXiv:2608.23664v12026
  37. PPFNet: Global Context Aware Local Features for Robust 3D Point Matching

    Haowen Deng, Tolga Birdal, Slobodan Ilic

    cs.CVcs.AIarXiv:1802.02669v22018
  38. Visual Language Maps for Robot Navigation

    Chenguang Huang, Oier Mees, Andy Zeng +1

    cs.ROcs.AIcs.CLarXiv:2210.05714v42022
  39. CoTracker: It is Better to Track Together

    Nikita Karaev, Ignacio Rocco, Benjamin Graham +3

    cs.CVarXiv:2307.07635v32023
  40. MoE-based Feature Adapter for Prompt-free Binary Coronary Artery Segmentation in X-ray Angiography

    Lin Xi, Yingliang Ma

    cs.CVarXiv:2608.24783v12026
  41. Zero-shot Recognition via Semantic Embeddings and Knowledge Graphs

    Xiaolong Wang, Yufei Ye, Abhinav Gupta

    cs.CVcs.CLarXiv:1803.08035v22018
  42. SandwichQuant: Which Parameters Matter Before and After Quantization?

    Peng Xia, Junbiao Pang

    cs.CVarXiv:2608.24173v12026
  43. X-Linear Attention Networks for Image Captioning

    Yingwei Pan, Ting Yao, Yehao Li +1

    cs.CVarXiv:2003.14080v12020
  44. Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors

    Oran Gafni, Adam Polyak, Oron Ashual +3

    cs.CVcs.AIcs.CLarXiv:2203.13131v12022
  45. Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

    Hayat Rajani, Nuno Gracias, Rafael Garcia

    cs.CVcs.LGarXiv:2608.24756v12026
  46. Putting NeRF on a Diet: Semantically Consistent Few-Shot View Synthesis

    Ajay Jain, Matthew Tancik, Pieter Abbeel

    cs.CVcs.AIcs.GRarXiv:2104.00677v12021
  47. MetaPruning: Meta Learning for Automatic Neural Network Channel Pruning

    Zechun Liu, Haoyuan Mu, Xiangyu Zhang +4

    cs.CVarXiv:1903.10258v32019
  48. RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

    Linzhe Jiang, Jiayuan Huang, Changhao Zhang +3

    cs.CVcs.AIarXiv:2608.23928v12026
  49. Learning What and Where to Draw

    Scott Reed, Zeynep Akata, Santosh Mohan +3

    cs.CVcs.NEarXiv:1610.02454v12016
  50. Unsupervised Embedding Learning via Invariant and Spreading Instance Feature

    Mang Ye, Xu Zhang, Pong C. Yuen +1

    cs.CVarXiv:1904.03436v12019
  51. Learning non-maximum suppression

    Jan Hosang, Rodrigo Benenson, Bernt Schiele

    cs.CVarXiv:1705.02950v22017
  52. HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

    Yuanhao Sun, Huawei Ji, Yuan Jin +3

    cs.CVarXiv:2608.23921v12026
  53. Neural Geometric Level of Detail: Real-time Rendering with Implicit 3D Shapes

    Towaki Takikawa, Joey Litalien, Kangxue Yin +6

    cs.CVcs.GRarXiv:2101.10994v12021
  54. Lips Don't Lie: A Generalisable and Robust Approach to Face Forgery Detection

    Alexandros Haliassos, Konstantinos Vougioukas, Stavros Petridis +1

    cs.CVarXiv:2012.07657v32020
  55. TEMOS: Generating diverse human motions from textual descriptions

    Mathis Petrovich, Michael J. Black, Gül Varol

    cs.CVcs.CLarXiv:2204.14109v22022
  56. High-Performance Large-Scale Image Recognition Without Normalization

    Andrew Brock, Soham De, Samuel L. Smith +1

    cs.CVcs.LGstat.MLarXiv:2102.06171v12021
  57. UnFlow: Unsupervised Learning of Optical Flow with a Bidirectional Census Loss

    Simon Meister, Junhwa Hur, Stefan Roth

    cs.CVarXiv:1711.07837v12017
  58. MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation

    Omer Bar-Tal, Lior Yariv, Yaron Lipman +1

    cs.CVarXiv:2302.08113v12023
  59. Reverse Attention for Salient Object Detection

    Shuhan Chen, Xiuli Tan, Ben Wang +1

    cs.CVarXiv:1807.09940v22018
  60. Neuralangelo: High-Fidelity Neural Surface Reconstruction

    Zhaoshuo Li, Thomas Müller, Alex Evans +4

    cs.CVarXiv:2306.03092v22023