Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

60,541 to 60,600 of 61,306

  1. Rank-Then-Act: Reward-Free Control from Frame-Order Progress

    Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1

    cs.LGcs.AIarXiv:2607.01897v12026
  2. Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment

    Anisha Pattanayak, Hanie Kang, Huang-Cheng Chou +2

    eess.ASarXiv:2607.02920v12026
  3. Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

    Xinyin Ma, Julius Berner, Chao Liu +3

    cs.CVarXiv:2607.03509v12026
  4. Spectral Rewiring for Exploration, Purification, and Model Merging

    Zhilong Zhang, Hongli Yu, Huan-ang Gao +5

    cs.LGcs.AIarXiv:2607.03065v12026
  5. PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction

    Zhuoqun Li, Boxi Cao, Jiawei Chen +11

    cs.CLarXiv:2607.02881v12026
  6. Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study

    Anisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan +1

    eess.ASarXiv:2607.02904v12026
  7. MentalThink: Shaping Thoughts in Mental SVG World

    Kangheng Lin, Jisheng Yin, Dingming Li +11

    cs.AIarXiv:2607.03530v12026
  8. CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation

    Zhenyu Sun, Xiaohan Zhang, Qi Liu +1

    cs.GRcs.AIarXiv:2607.03819v32026
  9. Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing

    Nilesh Jain

    cs.DLcs.ETarXiv:2607.05435v12026
  10. Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

    Ruchit Rawal, Reza Shirkavand, Sayak Paul +5

    cs.CVarXiv:2607.04461v12026
  11. Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models

    Julian Killingback, Varad Ingale, Hamed Zamani +1

    cs.IRarXiv:2607.05803v12026
  12. CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

    Xuyao Huang, Zelai Deng, Xu Wang +2

    cs.CVcs.AIarXiv:2607.03803v12026
  13. Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

    Kareem Elozeiri, Mervat Abassy, Omar Kallas +4

    cs.CLarXiv:2607.03936v12026
  14. dOPSD: On-Policy Self-Distillation for Diffusion Language Models

    Phuong Tuan Dat, Qi Li, Xinchao Wang

    cs.CLcs.AIarXiv:2607.04428v12026
  15. AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes

    Matteo Fasulo, Antonio Gravina, Luca Tedeschini +1

    cs.CLarXiv:2607.04410v12026
  16. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

    Yujin Kim, Namgyu Ho, Sangmin Hwang +7

    cs.AIarXiv:2607.04412v22026
  17. MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

    Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

    cs.CVcs.GRarXiv:2607.05376v12026
  18. Benchmarking Sensor Robustness in Plasma Diagnostic Models: A Systematic Evaluation on TokaMark

    Neerav Gupta

    physics.plasm-phcs.LGarXiv:2607.11915v12026
  19. GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

    Kaiyuan Chen, Shuangyu Xie, Letian Fu +21

    cs.ROcs.AIcs.CLarXiv:2607.05369v12026
  20. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Suhyeong Park, Junha Jung, Jungwoo Park +1

    cs.IRcs.AIcs.CLarXiv:2607.04605v22026
  21. Unified Audio Intelligence Without Regressing on Text Intelligence

    Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17

    cs.CLcs.AIcs.LGarXiv:2607.05196v22026
  22. Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

    Chang Nie, Jiaju Wei, Junlan Feng +2

    cs.CVarXiv:2607.05511v12026
  23. Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES

    Hunter Heidenreich

    cs.CLcs.LGq-bio.BMarXiv:2607.05691v12026
  24. CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

    Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1

    cs.CVcs.AIcs.LGarXiv:2607.02998v22026
  25. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Hairui Zhu, Yiying Yang, Tengjin Weng +5

    cs.CVcs.AIarXiv:2607.05465v12026
  26. TREK: Distill to Explore, Reinforce to Refine

    Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10

    cs.LGcs.AIstat.MLarXiv:2607.05339v12026
  27. SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

    Changti Wu, Bin Yu, Zhaolong Shen +6

    cs.ROarXiv:2607.06442v12026
  28. Vision as Unified Multimodal Generation

    Xiaoyang Han, Jianhua Li, Kewang Deng +14

    cs.CVarXiv:2607.06560v12026
  29. RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

    Haoyu Zhao, Xingyue Zhao, Hangyu Li +6

    cs.ROarXiv:2607.06558v22026
  30. Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification

    Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi

    cs.CVcs.AIarXiv:2607.06309v12026
  31. VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

    Jiazi Wang, Nonghai Zhang, Qiushi Xie +5

    cs.CVarXiv:2607.06374v12026
  32. PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

    Lihua Wei, Huatong Gao, Jia Gong +4

    cs.CVarXiv:2607.06238v12026
  33. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Chongyu Fan, Pengfei Liu, Jingjia Huang +2

    cs.LGarXiv:2607.06987v12026
  34. Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies

    Barkha Rani

    cs.CRarXiv:2607.06815v12026
  35. Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

    Tommaso Cerruti, Tim Rieder, George Rowlands +2

    cs.LGcs.AIarXiv:2607.07953v12026
  36. Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

    Haozhan Tang, Zerui Wang, Yuxian Gu +2

    cs.LGcs.AIarXiv:2607.07740v22026
  37. Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

    Seulbin Hwang, Kiyoung Om, Daejung Kim +1

    cs.ROcs.LGarXiv:2607.06957v12026
  38. MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

    Hyunjae Kim, Dain Kim, Pan Xiao +25

    cs.CVcs.LGarXiv:2607.07673v12026
  39. Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

    Haoran Feng, Ruiyang Zhang, Longyi Zhang +2

    cs.CVarXiv:2607.08765v22026
  40. From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

    Ying Chang, Jiahang Xu, Xuan Feng +3

    cs.CLarXiv:2607.07702v12026
  41. DrugGen 2: A disease-aware language model for enhancing drug discovery

    Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami +4

    q-bio.QMcs.AIcs.LGarXiv:2607.08404v12026
  42. SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

    Ruiqi Shen, Chang Liu, Henghui Ding

    cs.CVarXiv:2607.08688v12026
  43. Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms

    Ezgi Korkmaz

    cs.LGcs.AIarXiv:2607.07769v12026
  44. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Matteo Santelmo, Xiuying Wei, Israa Fakih +5

    cs.AIarXiv:2607.08317v12026
  45. OpenCoF: Learning to Reason Through Video Generation

    Xinyan Chen, Ziyu Guo, Renrui Zhang +2

    cs.CVcs.AIarXiv:2607.08763v12026
  46. From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

    Zanyi Wang, Xin Lin, Haodong Li +2

    cs.CVarXiv:2607.06553v22026
  47. Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

    Vladislav Beliaev

    cs.LGcs.AIcs.CLarXiv:2607.07690v12026
  48. Phone Segmentation and Recognition through Phonological Activation Mapping

    Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8

    eess.AScs.AIcs.CLarXiv:2607.09020v12026
  49. MuScriptor: An Open Model for Multi-Instrument Music Transcription

    Simon Rouard, Michael Krause, Axel Roebel +2

    cs.SDcs.LGarXiv:2607.08168v22026
  50. CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

    Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1

    cs.CVcs.AIarXiv:2607.09362v12026
  51. MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

    Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan +2

    cs.AIcs.GRarXiv:2607.11594v12026
  52. ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

    Jiayi Tian, Shiao Liu, Yuting Xu +30

    cs.AIcs.ROarXiv:2607.10350v32026
  53. On Locality and Length Generalization in Visual Reasoning

    Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3

    cs.CVcs.AIcs.LGarXiv:2607.09061v12026
  54. Evidence-Backed Video Question Answering

    Shijie Wang, Honglu Zhou, Ziyang Wang +5

    cs.CVcs.AIarXiv:2607.11862v12026
  55. Towards Autonomous and Auditable Medical Imaging Model Development

    Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng +8

    cs.CVcs.AIarXiv:2607.10522v12026
  56. MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

    Yufei Cai, Xuesong Niu, Hao Lu +3

    cs.CVarXiv:2607.12000v22026
  57. AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

    Lingkai Kong, Zijian Wu, Yuzhe Gu +10

    cs.CLarXiv:2607.11849v12026
  58. LightMem-Ego: Your AI Memory for Everyday Life

    Yijun Chen, Boyi Xiao, Yixian Zhao +10

    cs.CLcs.AIcs.CVarXiv:2607.11487v12026
  59. Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

    Chuhan Shi, Xiaoquan Ren, Sicheng Song +3

    cs.AIarXiv:2607.11079v12026
  60. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Runhui Huang, Qihui Zhang, Zhe Liu +3

    cs.CVarXiv:2607.11886v12026