Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

7,201 to 7,260 of 18,792

  1. Supervision-by-Registration: An Unsupervised Approach to Improve the Precision of Facial Landmark Detectors

    Xuanyi Dong, Shoou-I Yu, Xinshuo Weng +3

    cs.CVarXiv:1807.00966v22018
  2. What Would You Expect? Anticipating Egocentric Actions with Rolling-Unrolling LSTMs and Modality Attention

    Antonino Furnari, Giovanni Maria Farinella

    cs.CVcs.AIarXiv:1905.09035v22019
  3. Hierarchical Long Short-Term Concurrent Memory for Human Interaction Recognition

    Xiangbo Shu, Jinhui Tang, Guo-Jun Qi +2

    cs.CVarXiv:1811.00270v12018
  4. Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference

    Reza Heidari, Hamed R. Tavakoli, Juho Kannala

    cs.CVeess.IVarXiv:2609.01200v12026
  5. Motion Guided Attention for Video Salient Object Detection

    Haofeng Li, Guanqi Chen, Guanbin Li +1

    cs.CVarXiv:1909.07061v22019
  6. BS: Take the Hint - Interactive Multitracer PET/CT Lesion Segmentation with a Scribble-Conditioned ResEnc U-Net

    Marven Sherif, Amgad Elmasry, Youssef Ghazal +1

    cs.CVcs.AIarXiv:2609.01554v12026
  7. Grounded Video Description

    Luowei Zhou, Yannis Kalantidis, Xinlei Chen +2

    cs.CVarXiv:1812.06587v22018
  8. PointGPT: Auto-regressively Generative Pre-training from Point Clouds

    Guangyan Chen, Meiling Wang, Yi Yang +3

    cs.CVarXiv:2305.11487v22023
  9. WorldReward: Reward Modeling for Camera-Conditioned World Models

    Yibin Wang, Zehan Wang, Junshu Tang +13

    cs.CVarXiv:2609.03952v12026
  10. The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

    Yichen Liu, Quanwei Zhang, Haozhe Wang +7

    cs.MMcs.CVarXiv:2609.02367v12026
  11. CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

    Tingyu Song, Mingxin Li, Yanzhao Zhang +5

    cs.CVcs.AIcs.CLarXiv:2609.04083v12026
  12. GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions

    Junjie Wang, Jiemin Fang, Xiaopeng Zhang +2

    cs.CVcs.GRarXiv:2311.16037v22023
  13. Self-Supervised Learning for Cardiac MR Image Segmentation by Anatomical Position Prediction

    Wenjia Bai, Chen Chen, Giacomo Tarroni +6

    cs.CVarXiv:1907.02757v12019
  14. Sparse Representation-based Open Set Recognition

    He Zhang, Vishal M. Patel

    cs.CVarXiv:1705.02431v12017
  15. Fast Multi-class Dictionaries Learning with Geometrical Directions in MRI Reconstruction

    Zhifang Zhan, Jian-Feng Cai, Di Guo +3

    cs.CVmath.OCphysics.med-pharXiv:1503.02945v22015
  16. ORB-SVM : An Innovative Hybrid Framework for Efficient Brain Tumor Detection from MRI Scans

    Amirhosein Azarpour

    cs.CVcs.AIarXiv:2609.02333v12026
  17. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

    Chuyan Chen, Haoxing Chen, Kun Chen +27

    cs.CVcs.AIarXiv:2609.03796v12026
  18. Improved Stereo Matching with Constant Highway Networks and Reflective Confidence Learning

    Amit Shaked, Lior Wolf

    cs.CVarXiv:1701.00165v12016
  19. Just How Toxic is Data Poisoning? A Unified Benchmark for Backdoor and Data Poisoning Attacks

    Avi Schwarzschild, Micah Goldblum, Arjun Gupta +2

    cs.LGcs.CRcs.CVarXiv:2006.12557v32020
  20. TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation

    Liao Qu, Huichao Zhang, Yiheng Liu +7

    cs.CVcs.AIarXiv:2412.03069v22024
  21. World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models

    Chuhan Zhang, Seiji Ito, Kenta Hoshino +2

    cs.CVarXiv:2609.02159v12026
  22. SemanticAdv: Generating Adversarial Examples via Attribute-conditional Image Editing

    Haonan Qiu, Chaowei Xiao, Lei Yang +3

    cs.LGcs.CRcs.CVarXiv:1906.07927v42019
  23. HUGS: Human Gaussian Splats

    Muhammed Kocabas, Jen-Hao Rick Chang, James Gabriel +2

    cs.CVcs.GRarXiv:2311.17910v12023
  24. Editable Free-viewpoint Video Using a Layered Neural Representation

    Jiakai Zhang, Xinhang Liu, Xinyi Ye +6

    cs.CVcs.GRarXiv:2104.14786v12021
  25. Handwriting Trajectory Recovery via Autoregressive Ordered Stroke Instance Prediction

    En-Guang Wang, Yan-Ming Zhang, Fei Yin +1

    cs.CVarXiv:2609.02251v12026
  26. Debugging Tests for Model Explanations

    Julius Adebayo, Michael Muelly, Ilaria Liccardi +1

    cs.CVcs.LGarXiv:2011.05429v12020
  27. The Riemannian Geometry of Deep Generative Models

    Hang Shao, Abhishek Kumar, P. Thomas Fletcher

    cs.LGcs.CVstat.MLarXiv:1711.08014v12017
  28. Contrastive Learning for Image Captioning

    Bo Dai, Dahua Lin

    cs.CVarXiv:1710.02534v12017
  29. LoFi RADIO: A Distilled In-Domain Backbone Applied for Artifact-Severity Grading of Ultra-Low-Field Neonatal Brain MR

    Jonathan B. Martin, Yashwant Kurmi, Charlotte R. Sappo

    eess.IVcs.CVarXiv:2609.02676v12026
  30. Divide-and-Assemble: Learning Block-wise Memory for Unsupervised Anomaly Detection

    Jinlei Hou, Yingying Zhang, Qiaoyong Zhong +3

    cs.CVarXiv:2107.13118v12021
  31. Federated LoRA Adaptation of BiomedCLIP Across Four International Chest X-Ray Cohorts

    Sanjaya Poudel, Nirajan Kunwor, Manish Dhakal +2

    cs.LGcs.AIcs.CVarXiv:2609.02101v12026
  32. Few-Shot Learning via Saliency-guided Hallucination of Samples

    Hongguang Zhang, Jing Zhang, Piotr Koniusz

    cs.CVarXiv:1904.03472v12019
  33. Distance Metric Learning using Graph Convolutional Networks: Application to Functional Brain Networks

    Sofia Ira Ktena, Sarah Parisot, Enzo Ferrante +4

    cs.CVcs.LGarXiv:1703.02161v22017
  34. Learning End-to-End Lossy Image Compression: A Benchmark

    Yueyu Hu, Wenhan Yang, Zhan Ma +1

    eess.IVcs.CVarXiv:2002.03711v42020
  35. Memory-Efficient Incremental Learning Through Feature Adaptation

    Ahmet Iscen, Jeffrey Zhang, Svetlana Lazebnik +1

    cs.CVarXiv:2004.00713v22020
  36. 3D Object Reconstruction from a Single Depth View with Adversarial Learning

    Bo Yang, Hongkai Wen, Sen Wang +3

    cs.CVcs.AIcs.LGarXiv:1708.07969v12017
  37. Conditional Channel Gated Networks for Task-Aware Continual Learning

    Davide Abati, Jakub Tomczak, Tijmen Blankevoort +3

    cs.CVcs.LGstat.MLarXiv:2004.00070v12020
  38. MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning

    Ke Wang, Houxing Ren, Aojun Zhou +7

    cs.CLcs.AIcs.CVarXiv:2310.03731v12023
  39. MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI

    Kaining Ying, Fanqing Meng, Jin Wang +19

    cs.CVarXiv:2404.16006v12024
  40. Exploiting Image-trained CNN Architectures for Unconstrained Video Classification

    Shengxin Zha, Florian Luisier, Walter Andrews +2

    cs.CVarXiv:1503.04144v32015
  41. Re-initialization Free Level Set Evolution via Reaction Diffusion

    Kaihua Zhang, Lei Zhang, Huihui Song +1

    cs.CVarXiv:1112.1496v32011
  42. Learning Progressive Modality-shared Transformers for Effective Visible-Infrared Person Re-identification

    Hu Lu, Xuezhang Zou, Pingping Zhang

    cs.CVcs.IRcs.MMarXiv:2212.00226v12022
  43. VanillaNet: the Power of Minimalism in Deep Learning

    Hanting Chen, Yunhe Wang, Jianyuan Guo +1

    cs.CVarXiv:2305.12972v22023
  44. RenderDiffusion: Image Diffusion for 3D Reconstruction, Inpainting and Generation

    Titas Anciukevičius, Zexiang Xu, Matthew Fisher +4

    cs.CVcs.LGarXiv:2211.09869v42022
  45. Retrosynthesis of Synthetic Media for Explainable AI Provenance Forensics

    Yijie Lin, Ching-Chun Chang, Isao Echizen +2

    cs.CRcs.AIcs.CVarXiv:2609.02268v12026
  46. Learning Feature Descriptors using Camera Pose Supervision

    Qianqian Wang, Xiaowei Zhou, Bharath Hariharan +1

    cs.CVarXiv:2004.13324v32020
  47. Syn2Real Transfer Learning for Image Deraining using Gaussian Processes

    Rajeev Yasarla, Vishwanath A. Sindagi, Vishal M. Patel

    cs.CVarXiv:2006.05580v12020
  48. FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation

    Zhiqi Li, Zhiding Yu, David Austin +4

    cs.CVcs.ROarXiv:2307.01492v12023
  49. FasterSeg: Searching for Faster Real-time Semantic Segmentation

    Wuyang Chen, Xinyu Gong, Xianming Liu +3

    cs.CVcs.LGarXiv:1912.10917v22019
  50. Unified Image and Video Saliency Modeling

    Richard Droste, Jianbo Jiao, J. Alison Noble

    cs.CVcs.LGarXiv:2003.05477v32020
  51. Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers

    Haifeng Huang, Yilun Chen, Zehan Wang +8

    cs.CVarXiv:2312.08168v42023
  52. VideoPhy: Evaluating Physical Commonsense for Video Generation

    Hritik Bansal, Zongyu Lin, Tianyi Xie +7

    cs.CVcs.AIcs.LGarXiv:2406.03520v22024
  53. A Dataset for Developing and Benchmarking Active Vision

    Phil Ammirato, Patrick Poirson, Eunbyung Park +2

    cs.CVarXiv:1702.08272v22017
  54. DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

    Yujie Wei, Shiwei Zhang, Zhiwu Qing +6

    cs.CVarXiv:2312.04433v12023
  55. Cross-Modal and Hierarchical Modeling of Video and Text

    Bowen Zhang, Hexiang Hu, Fei Sha

    cs.CVarXiv:1810.07212v12018
  56. IA-RED$^2$: Interpretability-Aware Redundancy Reduction for Vision Transformers

    Bowen Pan, Rameswar Panda, Yifan Jiang +3

    cs.CVarXiv:2106.12620v22021
  57. VFHQ: A High-Quality Dataset and Benchmark for Video Face Super-Resolution

    Liangbin Xie. Xintao Wang, Honglun Zhang, Chao Dong +1

    eess.IVcs.AIcs.CVarXiv:2205.03409v12022
  58. A Reproducible Study on Remote Heart Rate Measurement

    Guillaume Heusch, André Anjos, Sébastien Marcel

    cs.CVarXiv:1709.00962v12017
  59. SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote Sensing

    Zhecheng Wang, Rajanie Prabha, Tianyuan Huang +2

    cs.CVcs.AIcs.LGarXiv:2312.12856v12023
  60. Overcoming Data Limitation in Medical Visual Question Answering

    Binh D. Nguyen, Thanh-Toan Do, Binh X. Nguyen +3

    cs.CVarXiv:1909.11867v12019