Every paper with a summary
Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
60,541 to 60,600 of 61,306
Rank-Then-Act: Reward-Free Control from Frame-Order Progress
Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1
cs.LGcs.AIarXiv:2607.01897v12026Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment
Anisha Pattanayak, Hanie Kang, Huang-Cheng Chou +2
eess.ASarXiv:2607.02920v12026Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
Xinyin Ma, Julius Berner, Chao Liu +3
cs.CVarXiv:2607.03509v12026Spectral Rewiring for Exploration, Purification, and Model Merging
Zhilong Zhang, Hongli Yu, Huan-ang Gao +5
cs.LGcs.AIarXiv:2607.03065v12026PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction
Zhuoqun Li, Boxi Cao, Jiawei Chen +11
cs.CLarXiv:2607.02881v12026Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study
Anisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan +1
eess.ASarXiv:2607.02904v12026MentalThink: Shaping Thoughts in Mental SVG World
Kangheng Lin, Jisheng Yin, Dingming Li +11
cs.AIarXiv:2607.03530v12026CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation
Zhenyu Sun, Xiaohan Zhang, Qi Liu +1
cs.GRcs.AIarXiv:2607.03819v32026Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing
Nilesh Jain
cs.DLcs.ETarXiv:2607.05435v12026Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
Ruchit Rawal, Reza Shirkavand, Sayak Paul +5
cs.CVarXiv:2607.04461v12026Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models
Julian Killingback, Varad Ingale, Hamed Zamani +1
cs.IRarXiv:2607.05803v12026CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
Xuyao Huang, Zelai Deng, Xu Wang +2
cs.CVcs.AIarXiv:2607.03803v12026Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs
Kareem Elozeiri, Mervat Abassy, Omar Kallas +4
cs.CLarXiv:2607.03936v12026dOPSD: On-Policy Self-Distillation for Diffusion Language Models
Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.CLcs.AIarXiv:2607.04428v12026AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes
Matteo Fasulo, Antonio Gravina, Luca Tedeschini +1
cs.CLarXiv:2607.04410v12026LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
Yujin Kim, Namgyu Ho, Sangmin Hwang +7
cs.AIarXiv:2607.04412v22026MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.CVcs.GRarXiv:2607.05376v12026Benchmarking Sensor Robustness in Plasma Diagnostic Models: A Systematic Evaluation on TokaMark
Neerav Gupta
physics.plasm-phcs.LGarXiv:2607.11915v12026GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
Kaiyuan Chen, Shuangyu Xie, Letian Fu +21
cs.ROcs.AIcs.CLarXiv:2607.05369v12026Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
Suhyeong Park, Junha Jung, Jungwoo Park +1
cs.IRcs.AIcs.CLarXiv:2607.04605v22026Unified Audio Intelligence Without Regressing on Text Intelligence
Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17
cs.CLcs.AIcs.LGarXiv:2607.05196v22026Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
Chang Nie, Jiaju Wei, Junlan Feng +2
cs.CVarXiv:2607.05511v12026Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES
Hunter Heidenreich
cs.CLcs.LGq-bio.BMarXiv:2607.05691v12026CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training
Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1
cs.CVcs.AIcs.LGarXiv:2607.02998v22026CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
Hairui Zhu, Yiying Yang, Tengjin Weng +5
cs.CVcs.AIarXiv:2607.05465v12026TREK: Distill to Explore, Reinforce to Refine
Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10
cs.LGcs.AIstat.MLarXiv:2607.05339v12026SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
Changti Wu, Bin Yu, Zhaolong Shen +6
cs.ROarXiv:2607.06442v12026Vision as Unified Multimodal Generation
Xiaoyang Han, Jianhua Li, Kewang Deng +14
cs.CVarXiv:2607.06560v12026RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
Haoyu Zhao, Xingyue Zhao, Hangyu Li +6
cs.ROarXiv:2607.06558v22026Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.CVcs.AIarXiv:2607.06309v12026VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
Jiazi Wang, Nonghai Zhang, Qiushi Xie +5
cs.CVarXiv:2607.06374v12026PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution
Lihua Wei, Huatong Gao, Jia Gong +4
cs.CVarXiv:2607.06238v12026UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
Chongyu Fan, Pengfei Liu, Jingjia Huang +2
cs.LGarXiv:2607.06987v12026Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies
Barkha Rani
cs.CRarXiv:2607.06815v12026Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
Tommaso Cerruti, Tim Rieder, George Rowlands +2
cs.LGcs.AIarXiv:2607.07953v12026Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
Haozhan Tang, Zerui Wang, Yuxian Gu +2
cs.LGcs.AIarXiv:2607.07740v22026Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation
Seulbin Hwang, Kiyoung Om, Daejung Kim +1
cs.ROcs.LGarXiv:2607.06957v12026MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
Hyunjae Kim, Dain Kim, Pan Xiao +25
cs.CVcs.LGarXiv:2607.07673v12026Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
Haoran Feng, Ruiyang Zhang, Longyi Zhang +2
cs.CVarXiv:2607.08765v22026From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
Ying Chang, Jiahang Xu, Xuan Feng +3
cs.CLarXiv:2607.07702v12026DrugGen 2: A disease-aware language model for enhancing drug discovery
Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami +4
q-bio.QMcs.AIcs.LGarXiv:2607.08404v12026SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
Ruiqi Shen, Chang Liu, Henghui Ding
cs.CVarXiv:2607.08688v12026Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
Ezgi Korkmaz
cs.LGcs.AIarXiv:2607.07769v12026Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
Matteo Santelmo, Xiuying Wei, Israa Fakih +5
cs.AIarXiv:2607.08317v12026OpenCoF: Learning to Reason Through Video Generation
Xinyan Chen, Ziyu Guo, Renrui Zhang +2
cs.CVcs.AIarXiv:2607.08763v12026From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models
Zanyi Wang, Xin Lin, Haodong Li +2
cs.CVarXiv:2607.06553v22026Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
Vladislav Beliaev
cs.LGcs.AIcs.CLarXiv:2607.07690v12026Phone Segmentation and Recognition through Phonological Activation Mapping
Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8
eess.AScs.AIcs.CLarXiv:2607.09020v12026MuScriptor: An Open Model for Multi-Instrument Music Transcription
Simon Rouard, Michael Krause, Axel Roebel +2
cs.SDcs.LGarXiv:2607.08168v22026CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation
Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1
cs.CVcs.AIarXiv:2607.09362v12026MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models
Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan +2
cs.AIcs.GRarXiv:2607.11594v12026ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
Jiayi Tian, Shiao Liu, Yuting Xu +30
cs.AIcs.ROarXiv:2607.10350v32026On Locality and Length Generalization in Visual Reasoning
Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3
cs.CVcs.AIcs.LGarXiv:2607.09061v12026Evidence-Backed Video Question Answering
Shijie Wang, Honglu Zhou, Ziyang Wang +5
cs.CVcs.AIarXiv:2607.11862v12026Towards Autonomous and Auditable Medical Imaging Model Development
Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng +8
cs.CVcs.AIarXiv:2607.10522v12026MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
Yufei Cai, Xuesong Niu, Hao Lu +3
cs.CVarXiv:2607.12000v22026AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification
Lingkai Kong, Zijian Wu, Yuzhe Gu +10
cs.CLarXiv:2607.11849v12026LightMem-Ego: Your AI Memory for Everyday Life
Yijun Chen, Boyi Xiao, Yixian Zhao +10
cs.CLcs.AIcs.CVarXiv:2607.11487v12026Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists
Chuhan Shi, Xiaoquan Ren, Sicheng Song +3
cs.AIarXiv:2607.11079v12026Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
Runhui Huang, Qihui Zhang, Zhe Liu +3
cs.CVarXiv:2607.11886v12026