Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
961 to 1,020 of 18,825
MedSAM3: Delving into Segment Anything with Medical Concepts
Anglin Liu, Rundong Xue, Xu R. Cao +5
cs.CVcs.AIarXiv:2511.19046v12025A 3D Coarse-to-Fine Framework for Volumetric Medical Image Segmentation
Zhuotun Zhu, Yingda Xia, Wei Shen +2
cs.CVarXiv:1712.00201v22017Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
Chuhan Zhang, Guillaume Le Moing, Skanda Koppula +11
cs.CVarXiv:2512.08924v22025AnyUp: Universal Feature Upsampling
Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona +4
cs.CVcs.LGarXiv:2510.12764v22025MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
Weikang Shi, Aldrich Yu, Rongyao Fang +11
cs.CVcs.CLarXiv:2510.14958v12025DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
Xu Guo, Fulong Ye, Xinghui Li +6
cs.CVarXiv:2601.01425v12026Particle Filter Networks with Application to Visual Localization
Peter Karkus, David Hsu, Wee Sun Lee
cs.ROcs.AIcs.CVarXiv:1805.08975v32018Multi-Scale Attention with Dense Encoder for Handwritten Mathematical Expression Recognition
Jianshu Zhang, Jun Du, Lirong Dai
cs.CVarXiv:1801.03530v22018Brain-PACE: A Deep Siamese MRI Framework for Modelling Longitudinal Brain Acceleration
Samuel Maddox, Jacob Newman, Saber Sami +4
cs.CVarXiv:2609.11378v12026Vision Transformer with Attentive Pooling for Robust Facial Expression Recognition
Fanglei Xue, Qiangchang Wang, Zichang Tan +2
cs.CVarXiv:2212.05463v12022DINO-Med: A Unified Patch-Based Adaptation Framework for Multi-Modal Medical Image Analysis Applied to Liver Fibrosis Staging
Boya Wang, Ruizhe Li, Chao Chen +1
cs.CVarXiv:2609.11380v12026Vision Transformer-Based Multi-Level Feature Fusion for Multi-Label Sewer Defect Classification
Xu Fang, Zhuoran Wang, Qing Li +4
cs.CVarXiv:2609.11375v12026Identity-Preserving Talking Face Generation with Landmark and Appearance Priors
Weizhi Zhong, Chaowei Fang, Yinqi Cai +4
cs.CVcs.MMarXiv:2305.08293v12023Multi-Modal Controlled Coherent Motion Generation
Yifei Liu, Qiong Cao, Hongwei Yi +2
cs.CVarXiv:2609.11439v12026BruNet: A Cross-Domain Transfer Framework for Bruise Segmentation
Qiming Wang, Richard J. Motley, Ebube E. Obi +2
cs.CVarXiv:2609.11463v12026Generating Long Videos of Dynamic Scenes
Brooks, Tim, Hellsten, Janne, Aittala, Miika +6
cs.CVcs.AIcs.LGarXiv:2206.03429v22022Order-Aware 2.5D Multiple Instance Learning for Preoperative MRI-Based Perineural Invasion Risk Assessment in Intrahepatic Cholangiocarcinoma
Go, Hyunsu, Han, Youngung, Kim, Kyeonghun +11
cs.CVarXiv:2609.11271v12026Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
Yin, Shengming, Zhang, Zekai, Tang, Zecheng +11
cs.CVarXiv:2512.15603v12025Summaries:한국어GRIPNet: Gaussian Radial Intensity Prior Guided Architecture for Pulmonary Nodule Detection in CT
Yang, Haojie, Su, Ran
cs.CVcs.AIarXiv:2609.11312v12026SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views
Zhao, Langxu, Gu, Zuan, Zhang, Yingdan +2
cs.CVarXiv:2609.11279v12026Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness
Konrad Reuter, Suresh Guttikonda, Chaitali Uday Karekar +2
cs.CVarXiv:2609.11330v12026Recurrent Neural Network Transducer for Audio-Visual Speech Recognition
Takaki Makino, Hank Liao, Yannis Assael +4
eess.AScs.CLcs.CVarXiv:1911.04890v12019R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds
Xinghui Tao, Zehao Ye, Guangming Wang +2
cs.CVarXiv:2609.11360v12026HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA
Syed Mohaiminul Hoque, Md Sakhawat Hossain
cs.CVcs.AIarXiv:2609.11236v12026UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
Ye Liu, Zongyang Ma, Junfu Pu +4
cs.CVcs.AIarXiv:2509.18094v42025SCINTILLA-SNN: A Spiking Multi-Scale Selective Aggregation Network for Perineural Invasion Prediction
Youngung Han, Yului Jeong, Kyeonghun Kim +11
cs.CVarXiv:2609.11237v12026Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation
Zixuan Duan, Xunzhi Xiang, Yabo Chen +6
cs.CVarXiv:2609.11265v12026From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models
Meng Luo, Yicheng Liu, Jiahao Wang +5
cs.CVcs.AIarXiv:2609.11242v12026Fast and Accurate Monomodal 3D High Resolution Deep Registration of Drosophila Larval Brain Volumes
Daniel Reisenbüchler, Yousef Sadegheih, Michael Dittrich +3
cs.CVarXiv:2609.11240v12026TILT: Transform Invariant Low-rank Textures
Zhengdong Zhang, Arvind Ganesh, Xiao Liang +1
cs.CVarXiv:1012.3216v12010Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization
Kui Jiang, Yang Gu, Jiacheng Liu +3
cs.CVarXiv:2609.11223v12026CEM-TUDASR: Computationally efficient multi-modality transformer based unsupervised domain adaptive super-resolution approach
Anjali Sarvaiya, Jay Kadel, Kishor Upla +1
cs.CVarXiv:2609.11201v12026PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
Ziang Cao, Fangzhou Hong, Zhaoxi Chen +2
cs.CVcs.ROarXiv:2511.13648v12025When is Test-Time Adaptation Identifiable From Unlabeled Evidence?
Kartik Jhawar, Lipo Wang
cs.CVarXiv:2609.11235v12026DreamOmni2: Multimodal Instruction-based Editing and Generation
Bin Xia, Bohao Peng, Yuechen Zhang +10
cs.CVarXiv:2510.06679v12025A Multi-View and Confusion-Guided Ensemble Framework for Robust Synthetic Image Attribution
Zuomin Qu
cs.CVarXiv:2609.11188v12026Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval
Yilin Long, Chenming Zhu, Zitang Gou +2
cs.CVcs.AIarXiv:2609.11172v12026MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
Qinghe Wang, Xiaoyu Shi, Baolu Li +7
cs.CVarXiv:2512.03041v12025Human3R: Everyone Everywhere All at Once
Yue Chen, Xingyu Chen, Yuxuan Xue +3
cs.CVarXiv:2510.06219v22025ReconPlusGen: Injecting Reconstruction Prior into Multi-view 3D Generation through Noise Inversion and Modulation
Jiarui Liu, Heng Li, Weiyu Li +7
cs.CVarXiv:2609.11129v12026LAION-Mobile: Evaluating Deepfake Detectors On One Million Smartphone Photos
Achim von Stryk, Janis Keuper
cs.CVarXiv:2609.11134v12026Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions
Dieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3
cs.CVcs.AIcs.ETarXiv:2609.11126v12026Toward Interpretable Multimodal Fusion: Heat Conduction Modeling for Hyperspectral and LiDAR Joint Classification
Kan Wei, Jiahui Cui, Jing Yao +3
cs.CVcs.AIarXiv:2609.11040v12026GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
Jing Wang, Jiajun Liang, Jie Liu +10
cs.CVcs.LGarXiv:2510.22319v22025CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation
Yang Wu, Stefano Petrangeli, Ishita Dasgupta +1
cs.CVarXiv:2609.10943v12026Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
Dongyang Liu, Peng Gao, David Liu +8
cs.CVarXiv:2511.22677v12025TrajFusionNet+: Transformer-Based Prediction of Pedestrian Crossing Intention via Fusion of Trajectory Representations and Scene Graphs
François G. Landry, Moulay A. Akhloufi
cs.CVarXiv:2609.10806v12026StoryMem: Multi-shot Long Video Storytelling with Memory
Kaiwen Zhang, Liming Jiang, Angtian Wang +6
cs.CVarXiv:2512.19539v12025Overpainting: Localized Context-aware Diffusion Image Editing
Sam Sartor, Iliyan Georgiev, Michael Fischer +2
cs.CVarXiv:2609.10811v12026HiPerViT: A Hierarchical Perceiver-Vision Transformer Architecture for Multi-Scale Texture Recognition
João Pedro C. A. de Sá, Odemir Martinez Bruno
cs.CVarXiv:2609.10917v12026Evaluation of Vision-Language Models Across Diverse Coastal Environments
Seth Knoop, Chad R. Samuelson, Gabriel R. Slade +2
cs.CVcs.ROarXiv:2609.10855v12026Spotlight on Token Perception for Multimodal Reinforcement Learning
Siyuan Huang, Xiaoye Qu, Yafu Li +4
cs.CVarXiv:2510.09285v22025MixFormer: Mixing Features across Windows and Dimensions
Qiang Chen, Qiman Wu, Jian Wang +5
cs.CVarXiv:2204.02557v22022Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration
Mohammadjavad Matinkia, Nilanjan Ray
cs.CVarXiv:2609.10789v12026FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution
Junhao Zhuang, Shi Guo, Xin Cai +4
cs.CVarXiv:2510.12747v12025Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models
Justine Giroux, Jack Oliver Hilliard, Yannick Hold-Geoffroy +2
cs.CVarXiv:2609.10787v12026GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation
Bin Zhao, Patrick Chiou, Nakul Garg
cs.CVcs.ROarXiv:2609.10756v12026MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery
Boshu Jia, Rongyu Chen, Linlin Yang +9
cs.CVarXiv:2609.10743v12026Rethinking Handwritten Character Recognition
Ranjit Raut, Aarav Subedi, Ashim Shrestha
cs.CVeess.IVarXiv:2609.10572v120263D Point Splatting for mmWave Radar Novel View Synthesis
Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar
cs.CVcs.GRcs.LGarXiv:2609.11894v12026