Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
841 to 900 of 18,867
Observation-Conditioned Latent Energy Priors for Sparse Implicit Neural Shape Completion
Paul Büschl, Ezequiel de la Rosa, Julia Wolleb +3
cs.CVarXiv:2609.03694v12026LayerD: Decomposing Raster Graphic Designs into Layers
Tomoyuki Suzuki, Kang-Jun Liu, Naoto Inoue +1
cs.GRcs.CVarXiv:2509.25134v12025V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
Yang Luo, Xuanlei Zhao, Baijiong Lin +7
cs.CVarXiv:2511.16668v12025Mixture of Horizons in Action Chunking
Dong Jing, Gang Wang, Jiaqi Liu +7
cs.ROcs.AIcs.CVarXiv:2511.19433v22025Learning Formation of Physically-Based Face Attributes
Ruilong Li, Karl Bladin, Yajie Zhao +8
cs.CVarXiv:2004.03458v22020BorderDet: Border Feature for Dense Object Detection
Han Qiu, Yuchen Ma, Zeming Li +2
cs.CVarXiv:2007.11056v32020N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
Yuxin Wang, Lei Ke, Boqiang Zhang +6
cs.CVarXiv:2512.16561v12025Preserving Color in Neural Artistic Style Transfer
Leon A. Gatys, Matthias Bethge, Aaron Hertzmann +1
cs.CVarXiv:1606.05897v12016OmniNWM: Omniscient Driving Navigation World Models
Bohan Li, Zhuang Ma, Dalong Du +10
cs.CVarXiv:2510.18313v62025Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
Jiacheng Ye, Shansan Gong, Jiahui Gao +6
cs.CVcs.CLarXiv:2512.22615v22025End-to-End Image Super-Resolution via Deep and Shallow Convolutional Networks
Yifan Wang, Lijun Wang, Hongyu Wang +1
cs.CVarXiv:1607.07680v12016VISTA: A Test-Time Self-Improving Video Generation Agent
Do Xuan Long, Xingchen Wan, Hootan Nakhost +3
cs.CVarXiv:2510.15831v12025Generative Neural Video Compression via Video Diffusion Prior
Qi Mao, Hao Cheng, Tinghan Yang +2
cs.CVarXiv:2512.05016v22025Code2Video: A Code-centric Paradigm for Educational Video Generation
Yanzhe Chen, Kevin Qinghong Lin, Mike Zheng Shou
cs.CVcs.AIcs.CLarXiv:2510.01174v12025COCO-GAN: Generation by Parts via Conditional Coordinating
Chieh Hubert Lin, Chia-Che Chang, Yu-Sheng Chen +3
cs.LGcs.CVstat.MLarXiv:1904.00284v42019Few-Shot Object Detection via Variational Feature Aggregation
Jiaming Han, Yuqiang Ren, Jian Ding +2
cs.CVarXiv:2301.13411v12023CUHK & ETHZ & SIAT Submission to ActivityNet Challenge 2016
Yuanjun Xiong, Limin Wang, Zhe Wang +7
cs.CVarXiv:1608.00797v12016VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
Xinlei Yu, Chengming Xu, Guibin Zhang +7
cs.CVcs.AIcs.LGarXiv:2511.11007v22025IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
Yinan Chen, Jiangning Zhang, Teng Hu +7
cs.CVarXiv:2510.11647v22025Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
Chengzhi Liu, Yuzhe Yang, Yue Fan +3
cs.CVcs.CLarXiv:2512.12623v32025RarePlanes: Synthetic Data Takes Flight
Jacob Shermeyer, Thomas Hossler, Adam Van Etten +3
cs.CVcs.DBarXiv:2006.02963v22020BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
Zhaoyang Li, Dongjun Qian, Kai Su +6
cs.CVarXiv:2510.00438v22025LITA: Language Instructed Temporal-Localization Assistant
De-An Huang, Shijia Liao, Subhashree Radhakrishnan +4
cs.CVcs.AIarXiv:2403.19046v12024Visual Jigsaw Post-Training Improves MLLMs
Penghao Wu, Yushan Zhang, Haiwen Diao +3
cs.CVarXiv:2509.25190v12025PUGeo-Net: A Geometry-centric Network for 3D Point Cloud Upsampling
Yue Qian, Junhui Hou, Sam Kwong +1
cs.CVarXiv:2002.10277v22020Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
Teng Hu, Zhentao Yu, Guozhen Zhang +6
cs.CVarXiv:2511.21579v22025Paper2Video: Automatic Video Generation from Scientific Papers
Zeyu Zhu, Kevin Qinghong Lin, Mike Zheng Shou
cs.CVcs.AIcs.CLarXiv:2510.05096v22025SegEarth-OV3: Exploring SAM 3 for Open-Vocabulary Semantic Segmentation in Remote Sensing Images
Kaiyu Li, Shengqi Zhang, Yujie Wang +4
cs.CVarXiv:2512.08730v22025OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
Hongrui Jia, Jitong Liao, Xi Zhang +7
cs.CVarXiv:2510.24563v22025LaPred: Lane-Aware Prediction of Multi-Modal Future Trajectories of Dynamic Agents
ByeoungDo Kim, Seong Hyeon Park, Seokhwan Lee +5
cs.CVcs.LGarXiv:2104.00249v12021Activate or Not: Learning Customized Activation
Ningning Ma, Xiangyu Zhang, Ming Liu +1
cs.CVarXiv:2009.04759v22020pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
Hansheng Chen, Kai Zhang, Hao Tan +3
cs.LGcs.AIcs.CVarXiv:2510.14974v32025Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching
Bowen Wen, Shaurya Dewan, Stan Birchfield
cs.CVcs.ROarXiv:2512.11130v22025VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
Yifei Yu, Xiaoshan Wu, Xinting Hu +8
cs.CVarXiv:2512.04519v12025OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation
Henry Herzog, Favyen Bastani, Yawen Zhang +23
cs.CVcs.LGarXiv:2511.13655v12025Single-Perspective Warps in Natural Image Stitching
Tianli Liao, Nan Li
cs.CVarXiv:1802.04645v22018Temporal Complementary Learning for Video Person Re-Identification
Ruibing Hou, Hong Chang, Bingpeng Ma +2
cs.CVarXiv:2007.09357v12020Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation
Sherwin Bahmani, Tianchang Shen, Jiawei Ren +10
cs.CVcs.GRarXiv:2509.19296v12025Skeleton Image Representation for 3D Action Recognition based on Tree Structure and Reference Joints
Carlos Caetano, François Brémond, William Robson Schwartz
cs.CVcs.LGarXiv:1909.05704v12019Deep Homography Estimation for Dynamic Scenes
Hoang Le, Feng Liu, Shu Zhang +1
cs.CVarXiv:2004.02132v12020Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
Ellis Brown, Jihan Yang, Shusheng Yang +2
cs.CVarXiv:2511.04655v12025Distributed Mapping with Privacy and Communication Constraints: Lightweight Algorithms and Object-based Models
Siddharth Choudhary, Luca Carlone, Carlos Nieto +3
cs.ROcs.CVarXiv:1702.03435v12017ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
Fukun Yin, Shiyu Liu, Yucheng Han +12
cs.CVarXiv:2511.22625v22025CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization
Xinhai Hou, Shaoyuan Xu, Manan Biyani +4
cs.CVarXiv:2511.19661v22025TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
Zheng Ding, Weirui Ye
cs.LGcs.AIcs.CVarXiv:2512.08153v12025Parsimonious Black-Box Adversarial Attacks via Efficient Combinatorial Optimization
Seungyong Moon, Gaon An, Hyun Oh Song
cs.LGcs.CRcs.CVarXiv:1905.06635v22019Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model
Jing He, Haodong Li, Mingzhi Sheng +1
cs.CVarXiv:2512.01030v32025UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
Shuo Cao, Jiayang Li, Xiaohui Li +12
cs.CVarXiv:2512.21675v12025Towards Scalable Pre-training of Visual Tokenizers for Generation
Jingfeng Yao, Yuda Song, Yucong Zhou +1
cs.CVarXiv:2512.13687v22025State-Relabeling Adversarial Active Learning
Beichen Zhang, Liang Li, Shijie Yang +3
cs.CVcs.LGarXiv:2004.04943v12020Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
Yiyu Wang, Xuyang Liu, Xiyan Gui +5
cs.CVarXiv:2512.00891v22025Parallax Attention for Unsupervised Stereo Correspondence Learning
Longguang Wang, Yulan Guo, Yingqian Wang +4
cs.CVarXiv:2009.08250v22020Borrow from Anywhere: Pseudo Multi-modal Object Detection in Thermal Imagery
Chaitanya Devaguptapu, Ninad Akolekar, Manuj M Sharma +1
cs.CVarXiv:1905.08789v22019Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
Long Qian, Juncheng Li, Yu Wu +5
cs.CVarXiv:2402.11435v22024KeyPose: Multi-View 3D Labeling and Keypoint Estimation for Transparent Objects
Xingyu Liu, Rico Jonschkowski, Anelia Angelova +1
cs.CVcs.LGcs.ROarXiv:1912.02805v22019IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction
Hao Li, Zhengyu Zou, Fangfu Liu +8
cs.CVarXiv:2510.22706v32025One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
Yuan Gao, Chen Chen, Tianrong Chen +1
cs.CVcs.AIarXiv:2512.07829v22025Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
Yuyang Hong, Jiaqi Gu, Qi Yang +6
cs.CVcs.AIarXiv:2510.14605v22025EDTER: Edge Detection with Transformer
Mengyang Pu, Yaping Huang, Yuming Liu +2
cs.CVarXiv:2203.08566v12022Line Segment Detection Using Transformers without Edges
Yifan Xu, Weijian Xu, David Cheung +1
cs.CVarXiv:2101.01909v22021