Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

60,421 to 60,480 of 61,181

  1. Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study

    Anisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan +1

    eess.ASarXiv:2607.02904v12026
  2. MentalThink: Shaping Thoughts in Mental SVG World

    Kangheng Lin, Jisheng Yin, Dingming Li +11

    cs.AIarXiv:2607.03530v12026
  3. CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation

    Zhenyu Sun, Xiaohan Zhang, Qi Liu +1

    cs.GRcs.AIarXiv:2607.03819v32026
  4. Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing

    Nilesh Jain

    cs.DLcs.ETarXiv:2607.05435v12026
  5. Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

    Ruchit Rawal, Reza Shirkavand, Sayak Paul +5

    cs.CVarXiv:2607.04461v12026
  6. Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models

    Julian Killingback, Varad Ingale, Hamed Zamani +1

    cs.IRarXiv:2607.05803v12026
  7. CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

    Xuyao Huang, Zelai Deng, Xu Wang +2

    cs.CVcs.AIarXiv:2607.03803v12026
  8. Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

    Kareem Elozeiri, Mervat Abassy, Omar Kallas +4

    cs.CLarXiv:2607.03936v12026
  9. dOPSD: On-Policy Self-Distillation for Diffusion Language Models

    Phuong Tuan Dat, Qi Li, Xinchao Wang

    cs.CLcs.AIarXiv:2607.04428v12026
  10. AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes

    Matteo Fasulo, Antonio Gravina, Luca Tedeschini +1

    cs.CLarXiv:2607.04410v12026
  11. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

    Yujin Kim, Namgyu Ho, Sangmin Hwang +7

    cs.AIarXiv:2607.04412v22026
  12. MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

    Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

    cs.CVcs.GRarXiv:2607.05376v12026
  13. Benchmarking Sensor Robustness in Plasma Diagnostic Models: A Systematic Evaluation on TokaMark

    Neerav Gupta

    physics.plasm-phcs.LGarXiv:2607.11915v12026
  14. GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

    Kaiyuan Chen, Shuangyu Xie, Letian Fu +21

    cs.ROcs.AIcs.CLarXiv:2607.05369v12026
  15. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Suhyeong Park, Junha Jung, Jungwoo Park +1

    cs.IRcs.AIcs.CLarXiv:2607.04605v22026
  16. Unified Audio Intelligence Without Regressing on Text Intelligence

    Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17

    cs.CLcs.AIcs.LGarXiv:2607.05196v22026
  17. Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

    Chang Nie, Jiaju Wei, Junlan Feng +2

    cs.CVarXiv:2607.05511v12026
  18. Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES

    Hunter Heidenreich

    cs.CLcs.LGq-bio.BMarXiv:2607.05691v12026
  19. CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

    Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1

    cs.CVcs.AIcs.LGarXiv:2607.02998v22026
  20. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Hairui Zhu, Yiying Yang, Tengjin Weng +5

    cs.CVcs.AIarXiv:2607.05465v12026
  21. TREK: Distill to Explore, Reinforce to Refine

    Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10

    cs.LGcs.AIstat.MLarXiv:2607.05339v12026
  22. SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

    Changti Wu, Bin Yu, Zhaolong Shen +6

    cs.ROarXiv:2607.06442v12026
  23. Vision as Unified Multimodal Generation

    Xiaoyang Han, Jianhua Li, Kewang Deng +14

    cs.CVarXiv:2607.06560v12026
  24. RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

    Haoyu Zhao, Xingyue Zhao, Hangyu Li +6

    cs.ROarXiv:2607.06558v22026
  25. Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification

    Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi

    cs.CVcs.AIarXiv:2607.06309v12026
  26. VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

    Jiazi Wang, Nonghai Zhang, Qiushi Xie +5

    cs.CVarXiv:2607.06374v12026
  27. PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

    Lihua Wei, Huatong Gao, Jia Gong +4

    cs.CVarXiv:2607.06238v12026
  28. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Chongyu Fan, Pengfei Liu, Jingjia Huang +2

    cs.LGarXiv:2607.06987v12026
  29. Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies

    Barkha Rani

    cs.CRarXiv:2607.06815v12026
  30. Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

    Tommaso Cerruti, Tim Rieder, George Rowlands +2

    cs.LGcs.AIarXiv:2607.07953v12026
  31. Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

    Haozhan Tang, Zerui Wang, Yuxian Gu +2

    cs.LGcs.AIarXiv:2607.07740v22026
  32. Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

    Seulbin Hwang, Kiyoung Om, Daejung Kim +1

    cs.ROcs.LGarXiv:2607.06957v12026
  33. MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

    Hyunjae Kim, Dain Kim, Pan Xiao +25

    cs.CVcs.LGarXiv:2607.07673v12026
  34. Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

    Haoran Feng, Ruiyang Zhang, Longyi Zhang +2

    cs.CVarXiv:2607.08765v22026
  35. From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

    Ying Chang, Jiahang Xu, Xuan Feng +3

    cs.CLarXiv:2607.07702v12026
  36. DrugGen 2: A disease-aware language model for enhancing drug discovery

    Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami +4

    q-bio.QMcs.AIcs.LGarXiv:2607.08404v12026
  37. SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

    Ruiqi Shen, Chang Liu, Henghui Ding

    cs.CVarXiv:2607.08688v12026
  38. Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms

    Ezgi Korkmaz

    cs.LGcs.AIarXiv:2607.07769v12026
  39. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Matteo Santelmo, Xiuying Wei, Israa Fakih +5

    cs.AIarXiv:2607.08317v12026
  40. OpenCoF: Learning to Reason Through Video Generation

    Xinyan Chen, Ziyu Guo, Renrui Zhang +2

    cs.CVcs.AIarXiv:2607.08763v12026
  41. From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

    Zanyi Wang, Xin Lin, Haodong Li +2

    cs.CVarXiv:2607.06553v22026
  42. Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

    Vladislav Beliaev

    cs.LGcs.AIcs.CLarXiv:2607.07690v12026
  43. Phone Segmentation and Recognition through Phonological Activation Mapping

    Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8

    eess.AScs.AIcs.CLarXiv:2607.09020v12026
  44. MuScriptor: An Open Model for Multi-Instrument Music Transcription

    Simon Rouard, Michael Krause, Axel Roebel +2

    cs.SDcs.LGarXiv:2607.08168v22026
  45. CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

    Seungyong Lee, Hyun Jun Jang, Sangoh Kim +1

    cs.CVcs.AIarXiv:2607.09362v12026
  46. MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

    Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan +2

    cs.AIcs.GRarXiv:2607.11594v12026
  47. ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

    Jiayi Tian, Shiao Liu, Yuting Xu +30

    cs.AIcs.ROarXiv:2607.10350v32026
  48. On Locality and Length Generalization in Visual Reasoning

    Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3

    cs.CVcs.AIcs.LGarXiv:2607.09061v12026
  49. Evidence-Backed Video Question Answering

    Shijie Wang, Honglu Zhou, Ziyang Wang +5

    cs.CVcs.AIarXiv:2607.11862v12026
  50. Towards Autonomous and Auditable Medical Imaging Model Development

    Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng +8

    cs.CVcs.AIarXiv:2607.10522v12026
  51. MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

    Yufei Cai, Xuesong Niu, Hao Lu +3

    cs.CVarXiv:2607.12000v22026
  52. AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

    Lingkai Kong, Zijian Wu, Yuzhe Gu +10

    cs.CLarXiv:2607.11849v12026
  53. LightMem-Ego: Your AI Memory for Everyday Life

    Yijun Chen, Boyi Xiao, Yixian Zhao +10

    cs.CLcs.AIcs.CVarXiv:2607.11487v12026
  54. Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

    Chuhan Shi, Xiaoquan Ren, Sicheng Song +3

    cs.AIarXiv:2607.11079v12026
  55. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Runhui Huang, Qihui Zhang, Zhe Liu +3

    cs.CVarXiv:2607.11886v12026
  56. Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

    Haotian Lin, Silin Chen, Xiaodong Gu +8

    cs.SEarXiv:2607.11111v12026
  57. AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling

    Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou +4

    cs.CVarXiv:2607.10995v12026
  58. See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

    Byungkun Lee, Dongyoon Hwang, Dongjin Kim +3

    cs.ROcs.AIarXiv:2607.11498v12026
  59. SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

    Mingyuan Wu, Jingcheng Yang, Shengyi Qian +11

    cs.AIarXiv:2607.10966v12026
  60. Qwen-Music Technical Report

    Jin Xu, Kangdi Wang, Ruibin Yuan +24

    cs.SDarXiv:2607.11699v22026