Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

841 to 900 of 18,867

  1. Observation-Conditioned Latent Energy Priors for Sparse Implicit Neural Shape Completion

    Paul Büschl, Ezequiel de la Rosa, Julia Wolleb +3

    cs.CVarXiv:2609.03694v12026
  2. LayerD: Decomposing Raster Graphic Designs into Layers

    Tomoyuki Suzuki, Kang-Jun Liu, Naoto Inoue +1

    cs.GRcs.CVarXiv:2509.25134v12025
  3. V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models

    Yang Luo, Xuanlei Zhao, Baijiong Lin +7

    cs.CVarXiv:2511.16668v12025
  4. Mixture of Horizons in Action Chunking

    Dong Jing, Gang Wang, Jiaqi Liu +7

    cs.ROcs.AIcs.CVarXiv:2511.19433v22025
  5. Learning Formation of Physically-Based Face Attributes

    Ruilong Li, Karl Bladin, Yajie Zhao +8

    cs.CVarXiv:2004.03458v22020
  6. BorderDet: Border Feature for Dense Object Detection

    Han Qiu, Yuchen Ma, Zeming Li +2

    cs.CVarXiv:2007.11056v32020
  7. N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

    Yuxin Wang, Lei Ke, Boqiang Zhang +6

    cs.CVarXiv:2512.16561v12025
  8. Preserving Color in Neural Artistic Style Transfer

    Leon A. Gatys, Matthias Bethge, Aaron Hertzmann +1

    cs.CVarXiv:1606.05897v12016
  9. OmniNWM: Omniscient Driving Navigation World Models

    Bohan Li, Zhuang Ma, Dalong Du +10

    cs.CVarXiv:2510.18313v62025
  10. Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

    Jiacheng Ye, Shansan Gong, Jiahui Gao +6

    cs.CVcs.CLarXiv:2512.22615v22025
  11. End-to-End Image Super-Resolution via Deep and Shallow Convolutional Networks

    Yifan Wang, Lijun Wang, Hongyu Wang +1

    cs.CVarXiv:1607.07680v12016
  12. VISTA: A Test-Time Self-Improving Video Generation Agent

    Do Xuan Long, Xingchen Wan, Hootan Nakhost +3

    cs.CVarXiv:2510.15831v12025
  13. Generative Neural Video Compression via Video Diffusion Prior

    Qi Mao, Hao Cheng, Tinghan Yang +2

    cs.CVarXiv:2512.05016v22025
  14. Code2Video: A Code-centric Paradigm for Educational Video Generation

    Yanzhe Chen, Kevin Qinghong Lin, Mike Zheng Shou

    cs.CVcs.AIcs.CLarXiv:2510.01174v12025
  15. COCO-GAN: Generation by Parts via Conditional Coordinating

    Chieh Hubert Lin, Chia-Che Chang, Yu-Sheng Chen +3

    cs.LGcs.CVstat.MLarXiv:1904.00284v42019
  16. Few-Shot Object Detection via Variational Feature Aggregation

    Jiaming Han, Yuqiang Ren, Jian Ding +2

    cs.CVarXiv:2301.13411v12023
  17. CUHK & ETHZ & SIAT Submission to ActivityNet Challenge 2016

    Yuanjun Xiong, Limin Wang, Zhe Wang +7

    cs.CVarXiv:1608.00797v12016
  18. VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

    Xinlei Yu, Chengming Xu, Guibin Zhang +7

    cs.CVcs.AIcs.LGarXiv:2511.11007v22025
  19. IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

    Yinan Chen, Jiangning Zhang, Teng Hu +7

    cs.CVarXiv:2510.11647v22025
  20. Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

    Chengzhi Liu, Yuzhe Yang, Yue Fan +3

    cs.CVcs.CLarXiv:2512.12623v32025
  21. RarePlanes: Synthetic Data Takes Flight

    Jacob Shermeyer, Thomas Hossler, Adam Van Etten +3

    cs.CVcs.DBarXiv:2006.02963v22020
  22. BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

    Zhaoyang Li, Dongjun Qian, Kai Su +6

    cs.CVarXiv:2510.00438v22025
  23. LITA: Language Instructed Temporal-Localization Assistant

    De-An Huang, Shijia Liao, Subhashree Radhakrishnan +4

    cs.CVcs.AIarXiv:2403.19046v12024
  24. Visual Jigsaw Post-Training Improves MLLMs

    Penghao Wu, Yushan Zhang, Haiwen Diao +3

    cs.CVarXiv:2509.25190v12025
  25. PUGeo-Net: A Geometry-centric Network for 3D Point Cloud Upsampling

    Yue Qian, Junhui Hou, Sam Kwong +1

    cs.CVarXiv:2002.10277v22020
  26. Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

    Teng Hu, Zhentao Yu, Guozhen Zhang +6

    cs.CVarXiv:2511.21579v22025
  27. Paper2Video: Automatic Video Generation from Scientific Papers

    Zeyu Zhu, Kevin Qinghong Lin, Mike Zheng Shou

    cs.CVcs.AIcs.CLarXiv:2510.05096v22025
  28. SegEarth-OV3: Exploring SAM 3 for Open-Vocabulary Semantic Segmentation in Remote Sensing Images

    Kaiyu Li, Shengqi Zhang, Yujie Wang +4

    cs.CVarXiv:2512.08730v22025
  29. OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents

    Hongrui Jia, Jitong Liao, Xi Zhang +7

    cs.CVarXiv:2510.24563v22025
  30. LaPred: Lane-Aware Prediction of Multi-Modal Future Trajectories of Dynamic Agents

    ByeoungDo Kim, Seong Hyeon Park, Seokhwan Lee +5

    cs.CVcs.LGarXiv:2104.00249v12021
  31. Activate or Not: Learning Customized Activation

    Ningning Ma, Xiangyu Zhang, Ming Liu +1

    cs.CVarXiv:2009.04759v22020
  32. pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation

    Hansheng Chen, Kai Zhang, Hao Tan +3

    cs.LGcs.AIcs.CVarXiv:2510.14974v32025
  33. Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

    Bowen Wen, Shaurya Dewan, Stan Birchfield

    cs.CVcs.ROarXiv:2512.11130v22025
  34. VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory

    Yifei Yu, Xiaoshan Wu, Xinting Hu +8

    cs.CVarXiv:2512.04519v12025
  35. OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation

    Henry Herzog, Favyen Bastani, Yawen Zhang +23

    cs.CVcs.LGarXiv:2511.13655v12025
  36. Single-Perspective Warps in Natural Image Stitching

    Tianli Liao, Nan Li

    cs.CVarXiv:1802.04645v22018
  37. Temporal Complementary Learning for Video Person Re-Identification

    Ruibing Hou, Hong Chang, Bingpeng Ma +2

    cs.CVarXiv:2007.09357v12020
  38. Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

    Sherwin Bahmani, Tianchang Shen, Jiawei Ren +10

    cs.CVcs.GRarXiv:2509.19296v12025
  39. Skeleton Image Representation for 3D Action Recognition based on Tree Structure and Reference Joints

    Carlos Caetano, François Brémond, William Robson Schwartz

    cs.CVcs.LGarXiv:1909.05704v12019
  40. Deep Homography Estimation for Dynamic Scenes

    Hoang Le, Feng Liu, Shu Zhang +1

    cs.CVarXiv:2004.02132v12020
  41. Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts

    Ellis Brown, Jihan Yang, Shusheng Yang +2

    cs.CVarXiv:2511.04655v12025
  42. Distributed Mapping with Privacy and Communication Constraints: Lightweight Algorithms and Object-based Models

    Siddharth Choudhary, Luca Carlone, Carlos Nieto +3

    cs.ROcs.CVarXiv:1702.03435v12017
  43. ReasonEdit: Towards Reasoning-Enhanced Image Editing Models

    Fukun Yin, Shiyu Liu, Yucheng Han +12

    cs.CVarXiv:2511.22625v22025
  44. CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization

    Xinhai Hou, Shaoyuan Xu, Manan Biyani +4

    cs.CVarXiv:2511.19661v22025
  45. TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

    Zheng Ding, Weirui Ye

    cs.LGcs.AIcs.CVarXiv:2512.08153v12025
  46. Parsimonious Black-Box Adversarial Attacks via Efficient Combinatorial Optimization

    Seungyong Moon, Gaon An, Hyun Oh Song

    cs.LGcs.CRcs.CVarXiv:1905.06635v22019
  47. Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model

    Jing He, Haodong Li, Mingzhi Sheng +1

    cs.CVarXiv:2512.01030v32025
  48. UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

    Shuo Cao, Jiayang Li, Xiaohui Li +12

    cs.CVarXiv:2512.21675v12025
  49. Towards Scalable Pre-training of Visual Tokenizers for Generation

    Jingfeng Yao, Yuda Song, Yucong Zhou +1

    cs.CVarXiv:2512.13687v22025
  50. State-Relabeling Adversarial Active Learning

    Beichen Zhang, Liang Li, Shijie Yang +3

    cs.CVcs.LGarXiv:2004.04943v12020
  51. Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

    Yiyu Wang, Xuyang Liu, Xiyan Gui +5

    cs.CVarXiv:2512.00891v22025
  52. Parallax Attention for Unsupervised Stereo Correspondence Learning

    Longguang Wang, Yulan Guo, Yingqian Wang +4

    cs.CVarXiv:2009.08250v22020
  53. Borrow from Anywhere: Pseudo Multi-modal Object Detection in Thermal Imagery

    Chaitanya Devaguptapu, Ninad Akolekar, Manuj M Sharma +1

    cs.CVarXiv:1905.08789v22019
  54. Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning

    Long Qian, Juncheng Li, Yu Wu +5

    cs.CVarXiv:2402.11435v22024
  55. KeyPose: Multi-View 3D Labeling and Keypoint Estimation for Transparent Objects

    Xingyu Liu, Rico Jonschkowski, Anelia Angelova +1

    cs.CVcs.LGcs.ROarXiv:1912.02805v22019
  56. IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction

    Hao Li, Zhengyu Zou, Fangfu Liu +8

    cs.CVarXiv:2510.22706v32025
  57. One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

    Yuan Gao, Chen Chen, Tianrong Chen +1

    cs.CVcs.AIarXiv:2512.07829v22025
  58. Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering

    Yuyang Hong, Jiaqi Gu, Qi Yang +6

    cs.CVcs.AIarXiv:2510.14605v22025
  59. EDTER: Edge Detection with Transformer

    Mengyang Pu, Yaping Huang, Yuming Liu +2

    cs.CVarXiv:2203.08566v12022
  60. Line Segment Detection Using Transformers without Edges

    Yifan Xu, Weijian Xu, David Cheung +1

    cs.CVarXiv:2101.01909v22021