Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

54,721 to 54,780 of 61,351

  1. T5Gemma-TTS Technical Report

    Chihiro Arata, Kiyoshi Kurihara

    eess.ASarXiv:2604.01760v12026
  2. Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models

    Jiawei Chen, Simin Huang, Jiawei Du +5

    cs.CVcs.AIarXiv:2604.01618v12026
  3. Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

    Chongjie Ye, Cheng Cao, Chuanyu Pan +4

    cs.CVcs.AIarXiv:2604.02289v12026
  4. UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

    Yongkang Li, Lijun Zhou, Sixu Yan +11

    cs.CVcs.ROarXiv:2604.02190v12026
  5. Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory

    Jiaqi Liu, Zipeng Ling, Shi Qiu +9

    cs.AIarXiv:2604.01007v22026
  6. GPA: Learning GUI Process Automation from Demonstrations

    Zirui Zhao, Jun Hao Liew, Yan Yang +5

    cs.CVcs.AIcs.SEarXiv:2604.01676v22026
  7. LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

    Jiachun Jin, Zetong Zhou, Xiao Yang +4

    cs.CVcs.LGarXiv:2604.02097v12026
  8. Therefore I am. I Think

    Esakkivel Esakkiraja, Sai Rajeswar, Denis Akhiyarov +1

    cs.AIarXiv:2604.01202v32026
  9. Steerable Visual Representations

    Jona Ruthardt, Manu Gaur, Deva Ramanan +2

    cs.CVcs.AIarXiv:2604.02327v22026
  10. The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook

    Xinlei Yu, Zhangquan Chen, Yongbo He +36

    cs.AIarXiv:2604.02029v22026
  11. DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

    Yang Zhou, Xiaofeng Wang, Hao Shao +8

    cs.CVcs.AIcs.ROarXiv:2604.01765v12026
  12. SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

    Zhengxi Lu, Zhiyuan Yao, Jinyang Wu +7

    cs.LGarXiv:2604.02268v22026
  13. Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression

    Ruoling Qi, Yirui Liu, Xuaner Wu +6

    cs.CLarXiv:2604.01609v22026
  14. A Simple Baseline for Streaming Video Understanding

    Yujiao Shen, Shulin Tian, Jingkang Yang +1

    cs.CVarXiv:2604.02317v12026
  15. Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing

    Gengsheng Li, Tianyu Yang, Junfeng Fang +6

    cs.LGcs.AIarXiv:2604.02288v12026
  16. ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement

    Difan Jiao, Qianfeng Wen, Blair Yang +2

    cs.AIarXiv:2604.01591v22026
  17. Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

    Xingtong Ge, Yi Zhang, Yushi Huang +6

    cs.CVeess.IVarXiv:2604.03118v22026
  18. Large Language Models Align with the Human Brain during Creative Thinking

    Mete Ismayilzada, Simone A. Luchini, Abdulkadir Gokce +5

    q-bio.NCcs.AIcs.CLarXiv:2604.03480v22026
  19. BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs

    Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef +2

    cs.CLcs.AIarXiv:2604.02045v12026
  20. Adam's Law: Textual Frequency Law on Large Language Models

    Hongyuan Adam Lu, Z. L., Victor Wei +5

    cs.CLarXiv:2604.02176v32026
  21. Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models

    Shuibai Zhang, Caspian Zhuang, Chihan Cui +8

    cs.LGcs.CLarXiv:2604.01622v22026
  22. Token Warping Helps MLLMs Look from Nearby Viewpoints

    Phillip Y. Lee, Chanho Park, Mingue Park +3

    cs.CVarXiv:2604.02870v12026
  23. AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

    Yunhao Feng, Yifan Ding, Yingshui Tan +6

    cs.AIarXiv:2604.02947v12026
  24. The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

    Prashant C. Raju

    cs.LGcs.ITq-bio.QMarXiv:2604.04155v12026
  25. Significance and Stability Analysis of Genotype-Environment Interaction using GxEStat

    Meng'en Qin, Zhe Li, Hui Huang +1

    cs.CVstat.AParXiv:2604.03337v32026
  26. Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

    Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee +7

    cs.CVarXiv:2606.11180v12026
  27. Disentangling by Factorising

    Hyunjik Kim, Andriy Mnih

    stat.MLcs.LGarXiv:1802.05983v32018
  28. Addressable Memory for Video World Models

    Xindi Wu, Sven Elflein, James Lucas +5

    cs.CVcs.LGarXiv:2608.07408v12026
  29. Certifying and removing disparate impact

    Michael Feldman, Sorelle Friedler, John Moeller +2

    stat.MLcs.CYarXiv:1412.3756v32014
  30. Born Again Neural Networks

    Tommaso Furlanello, Zachary C. Lipton, Michael Tschannen +2

    stat.MLcs.AIcs.LGarXiv:1805.04770v22018
  31. Lost in Translation? Exploring the Shift in Grammatical Gender from Latin to Occitan

    Ahan Chatterjee, Matthias Schöffel, Matthias Aßenmacher +2

    cs.CLcs.AIarXiv:2605.09156v22026
  32. PLUME: Latent Reasoning Based Universal Multimodal Embedding

    Chenwei He, Xiangzhao Hao, Tianyu Yang +6

    cs.CVarXiv:2604.02073v32026
    Summaries:한국어
  33. ClawArena: Benchmarking AI Agents in Evolving Information Environments

    Haonian Ji, Kaiwen Xiong, Siwei Han +9

    cs.LGcs.AIcs.CLarXiv:2604.04202v22026
  34. GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning

    Ornith Team, Xiaoya Li, Guoyin Wang +3

    cs.AIarXiv:2604.02721v32026
  35. Watch Before You Answer: Learning from Visually Grounded Post-Training

    Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang +8

    cs.CVcs.AIcs.CLarXiv:2604.05117v12026
  36. SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing

    Yicheng Xiao, Wenhu Zhang, Lin Song +10

    cs.CVarXiv:2604.04911v22026
  37. General Multimodal Protein Design Enables DNA-Encoding of Chemistry

    Jarrid Rector-Brooks, Théophile Lambert, Marta Skreta +15

    cs.LGarXiv:2604.05181v12026
  38. SciLT: Long-tailed Image Classification under Scientific Image Domains

    Jiahao Chen, Bing Su

    cs.CVarXiv:2604.03687v32026
  39. QEIL v2: Heterogeneous Computing for Edge Intelligence via Roofline-Derived Pareto-Optimal Energy Modeling and Multi-Objective Orchestration

    Satyam Kumar, Saurabh Jha

    cs.DCarXiv:2602.06057v32026
  40. Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems

    Justin Chih-Yao Chen, Archiki Prasad, Zaid Khan +4

    cs.LGcs.AIcs.CLarXiv:2604.04767v12026
  41. SkillX: Automatically Constructing Skill Knowledge Bases for Agents

    Chenxi Wang, Zhuoyun Yu, Xin Xie +8

    cs.CLcs.AIcs.IRarXiv:2604.04804v22026
  42. TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

    Weian Mao, Xi Lin, Wei Huang +5

    cs.CLcs.CVarXiv:2604.04921v12026
  43. Synthetic Sandbox for Training Machine Learning Engineering Agents

    Yuhang Zhou, Lizhu Zhang, Yifan Wu +4

    cs.CLcs.LGarXiv:2604.04872v12026
  44. InCoder-32B-Thinking: Industrial Code World Model for Thinking

    Jian Yang, Wei Zhang, Jiajun Wu +22

    cs.ARcs.AIcs.CLarXiv:2604.03144v12026
  45. Do Audio-Visual Large Language Models Really See and Hear?

    Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi +3

    cs.AIcs.SDarXiv:2604.02605v12026
  46. Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models

    Sarath Shekkizhar, Romain Cosentino, Adam Earle

    cs.AIarXiv:2604.02315v22026
  47. LightThinker++: From Reasoning Compression to Memory Management

    Yuqi Zhu, Jintian Zhang, Zhenjie Wan +7

    cs.CLcs.AIcs.IRarXiv:2604.03679v12026
  48. POEMetric: The Last Stanza of Humanity

    Bingru Li, Han Wang, Hazel Wilkinson

    cs.CLarXiv:2604.03695v12026
  49. Training a Student Expert via Semi-Supervised Foundation Model Distillation

    Pardis Taghavi, Tian Liu, Renjie Li +2

    cs.CVarXiv:2604.03841v12026
  50. Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling?

    Peter Yongho Kim, Juhyeon Park, Jungwoo Park +4

    cs.CVarXiv:2604.03619v12026
  51. Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents

    Ádám Kovács

    cs.SEcs.AIarXiv:2604.04979v12026
  52. Can LLMs Learn to Reason Robustly under Noisy Supervision?

    Shenzhi Yang, Guangcheng Zhu, Bowen Song +7

    cs.LGcs.AIarXiv:2604.03993v12026
  53. AURA: Always-On Understanding and Real-Time Assistance via Video Streams

    Xudong Lu, Yang Bo, Jinpeng Chen +9

    cs.CVarXiv:2604.04184v12026
  54. DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

    Jingyi Yang, Yuxian Jiang, Xuhao Hu +3

    cs.CLarXiv:2604.04215v12026
  55. A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

    Tianle Chen, Deepti Ghadiyaram

    cs.CVcs.SDarXiv:2604.03995v12026
  56. HDP: A Lightweight Cryptographic Protocol for Human Delegation Provenance in Agentic AI Systems

    Asiri Dalugoda

    cs.CRcs.MAarXiv:2604.04522v12026
  57. CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models

    Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang +6

    cs.CVarXiv:2604.04780v12026
  58. AvatarPointillist: AutoRegressive 4D Gaussian Avatarization

    Hongyu Liu, Xuan Wang, Zijian Wu +7

    cs.CVarXiv:2604.04787v22026
  59. Vero: An Open RL Recipe for General Visual Reasoning

    Gabriel Sarch, Linrong Cai, Qunzhong Wang +3

    cs.CVcs.AIcs.CLarXiv:2604.04917v32026
  60. Paper Espresso: From Paper Overload to Research Insight

    Mingzhe Du, Luu Anh Tuan, Dong Huang +1

    cs.DLcs.AIarXiv:2604.04562v12026