Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

60,661 to 60,720 of 61,222

  1. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

    Junsong Chen, Jincheng Yu, Yitong Li +11

    cs.CVarXiv:2607.21553v12026
  2. Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

    Jiaxin Bai, Jiaxuan Xiong

    cs.CLcs.ROarXiv:2607.25337v22026
  3. O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

    Mei Yuan, Qi Long, Qifeng Wu +5

    cs.CVcs.AIcs.CLarXiv:2607.18142v12026
  4. TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

    Debottam Dutta, Jaehoon Hahm, Jianchong Chen +1

    cs.AIarXiv:2607.21606v12026
  5. Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

    Alexey Gavrilov, Alan-Barsag Gazzaev, Sergey Muravyov

    cs.CLcs.LGarXiv:2607.24176v12026
  6. Robostral Navigate

    Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra +273

    cs.ROcs.AIarXiv:2607.20785v32026
  7. GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

    Xingyu Xiang, Shuang Hao, Fan Wang +2

    cs.CVarXiv:2607.22135v22026
  8. OpenForgeRL: Train Harness-native Agents in Any Environment

    Xiao Yu, Baolin Peng, Ruize Xu +7

    cs.AIcs.CLarXiv:2607.21557v32026
  9. A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

    Sietse Schelpe

    cs.CLcs.AIcs.IRarXiv:2607.23806v12026
  10. Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

    Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

    cs.CLcs.CYcs.LGarXiv:2607.28319v12026
  11. H$^2$SD: Hybrid Hindsight Self-Distillation

    Qiye Cai, Yichuan Ma, Peiji Li +6

    cs.LGcs.CLarXiv:2607.18955v42026
  12. WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

    Sen Wang, R. Gnana Praveen, Bidhan Roy +1

    cs.LGcs.ROarXiv:2607.23909v22026
  13. Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

    Nuemaan Malik

    cs.LGcs.AIarXiv:2607.19058v22026
  14. OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

    Zihan Li, Feiyang Liu, Dandan Shan +2

    cs.CVcs.AIcs.LGarXiv:2607.25108v12026
  15. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4

    cs.CVarXiv:2607.23373v12026
  16. LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

    Tianzhu Ye, Li Dong, Guanheng Chen +4

    cs.LGcs.CLarXiv:2607.18110v12026
  17. Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model

    Markus J. Buehler

    cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2607.20058v12026
  18. LAMAR: An Open Language-Aware Multilingual Alignment Reranker

    Seongtae Hong, Youngjoon Jang, Jungseob Lee +2

    cs.IRarXiv:2607.22042v22026
  19. SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

    Lehan Wang, Boli Chen, Ruixue Ding +7

    cs.CRcs.AIcs.CLarXiv:2607.26791v12026
  20. Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

    Sicheng Mo, Yuheng Li, Ziyang Leng +2

    cs.CVarXiv:2607.21594v12026
  21. Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

    Yong Liu, Xiaolong Fu, Zihang Xu +10

    cs.CVarXiv:2607.21694v12026
  22. Distilled Reinforcement Learning for LLM Post-training

    Chen Wang, Zhaochun Li, Jionghao Bai +4

    cs.LGcs.AIarXiv:2607.17247v12026
  23. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35

    cs.CLcs.SEarXiv:2607.20911v12026
  24. Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

    Gabeen Kim, Kyeongpil Kang

    cs.CLarXiv:2607.21936v12026
  25. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Qiangqiang He, Zhongheng Wu, ZiJian Wang

    cs.AIarXiv:2607.27888v12026
  26. CriPO: Enhancing Rubric-based RL via Self-Distillation

    Mingxuan Xia, Yuhang Yang, Chao Ye +7

    cs.LGcs.AIarXiv:2607.18082v32026
  27. ShotPlan: Cinematic Video Generation with Learnable Planning Token

    Su Guo, Guangce Liu, Haosen Yang +7

    cs.CVarXiv:2607.17675v12026
  28. WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

    Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3

    cs.AIcs.CLcs.LGarXiv:2607.18084v12026
  29. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    Jiazhen Jiang, Boxi Cao, Lingyong Yan +6

    cs.AIcs.CLcs.LGarXiv:2607.19865v12026
  30. AutoIndex: Learning Representation Programs for Retrieval

    Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy +3

    cs.IRcs.AIcs.CLarXiv:2607.18603v12026
  31. Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

    Zheng Wu, Chenhao Xue, Shijie Zheng +3

    cs.CLarXiv:2607.28478v12026
  32. Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm

    Ming Wang, Jiaqi Wu Young, Wenfang Wu +2

    cs.CLcs.HCcs.SIarXiv:2607.27851v12026
  33. Codifying the Judge: Scalable Evaluation via Program Distillation

    Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

    cs.AIcs.LGarXiv:2607.22561v12026
  34. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Haoyang Huang, Wenjie Huang, Tianqi Xu +14

    cs.AIarXiv:2607.25669v12026
  35. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

    cs.AIcs.CLcs.LGarXiv:2607.25091v12026
  36. DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

    Hao Liang, Qifeng Cai, Yibo Lin +11

    cs.LGcs.CLarXiv:2607.20465v12026
  37. SceneActBench: Can Agents Act on the 3D Scenes They See?

    Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11

    cs.AIcs.CVarXiv:2607.22393v12026
  38. dRAE: Representation Autoencoder with Hyper-Spherical Codes

    Tianren Ma, Lin Long, Chuyan Chen +4

    cs.CVcs.AIarXiv:2607.22148v12026
  39. Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

    Nischay Dhankhar, Dos Baha, Abulhair Saparov

    cs.CLcs.LGarXiv:2607.19604v12026
  40. Scaling Native Multimodal Pre-Training From Scratch

    Haoyuan Wu, Aoqi Wu, Hai Wang +3

    cs.CLcs.CVarXiv:2607.22043v12026
  41. Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion

    Cédric Bonhomme, Alexandre Dulaunoy

    cs.CRarXiv:2607.25572v12026
  42. One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA

    Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

    cs.ROarXiv:2607.28443v32026
  43. TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs

    Sai Shruthi Sistla, Ashutosh Hathidara, Christopher Toukmaji +2

    cs.AIarXiv:2607.22639v12026
  44. LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

    Enjun Du, Hange Zhou, Chenxu Du +4

    cs.LGarXiv:2607.28374v12026
  45. CORAL: Curriculum-Optimized Reward Adaptation for LiDAR-Based Goal-Directed Urban Driving

    Anisa Saleem, Duksu Kim

    cs.ROcs.LGarXiv:2608.14332v12026
  46. Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

    Xinjie Zhang, Peng Zhang, Shicheng Zheng +21

    cs.CVcs.AIcs.LGarXiv:2607.19064v22026
  47. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

    Pingyu Wu, Lingyao Zhu, Weiming Zhang +1

    cs.CRcs.AIarXiv:2607.27951v12026
  48. Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems

    Ali Zahid Raja

    cs.AIcs.MAarXiv:2607.24117v12026
  49. StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

    Ads Dawson, Adrian Wood

    cs.CRcs.AIarXiv:2607.26314v12026
  50. Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling

    Hengyuan Cao, Shizhuo Cheng, Mingxuan Liu +5

    cs.LGq-bio.BMarXiv:2607.23518v12026
  51. GPT-Red: Automated Red Teaming via Self-Play at Scale

    Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15

    cs.CRcs.AIcs.CLarXiv:2607.26115v12026
  52. StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

    Yan Yang, Xiangru Jian, Ziyang Luo +7

    cs.SEcs.CVarXiv:2607.22798v12026
  53. Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

    Maohua Li, Qirui Li, Yanke Zhou +10

    cs.CVarXiv:2607.19139v22026
  54. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

    Sizhe Zhou, Sheldon Yu, Hui Wei +8

    cs.CLcs.AIarXiv:2607.26637v12026
  55. IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

    Varun Gumma, Navonil Majumder, Soumitra Sinhahajari +1

    cs.AIarXiv:2607.22375v12026
  56. Wonder: Video World Model Done Better

    Jiacong Xu, Hanwen Jiang, Zhixin Shu +3

    cs.CVcs.GRarXiv:2607.26037v12026
  57. Self-Supervised Learning of Structured Dynamics from Videos

    Lukas Knobel, Andrew Zisserman, Yuki M. Asano

    cs.CVarXiv:2607.21576v12026
  58. Human-in-the-Loop Signature Bootstrapping for UAV Hyperspectral PFM-1 Mine Detection

    Sagar Lekhak, Prasanna Reddy Pulakurthi, Emmett J. Ientilucci

    cs.CVeess.IVarXiv:2607.25310v12026
  59. RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

    Kehan Li, Bohan Hou, Minghao Zhu +28

    cs.ROarXiv:2607.17977v22026
  60. PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

    Zichao Lin, Yifeng Xie, Bowen Qu +30

    cs.CVarXiv:2607.24957v12026