Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

60,301 to 60,360 of 61,181

  1. TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

    Jiaqi Wang, Wenhao Zhang, Weijie Shi +2

    cs.LGcs.AIarXiv:2604.24005v32026
  2. World Action Models: The Next Frontier in Embodied AI

    Siyin Wang, Junhao Shi, Zhaoyang Fu +11

    cs.ROcs.CLcs.CVarXiv:2605.12090v12026
  3. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

    Qiuyue Wang, Mingsheng Li, Jian Guan +37

    cs.ROcs.AIcs.CLarXiv:2605.30280v22026
  4. Self-Distilled Agentic Reinforcement Learning

    Zhengxi Lu, Zhiyuan Yao, Zhuowen Han +8

    cs.LGcs.AIcs.CLarXiv:2605.15155v12026
  5. LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

    Jialei Chen, Kai Wang, Kang Chen +9

    cs.ROcs.AIarXiv:2606.15768v12026
  6. AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration

    Jiaqi Liu, Shi Qiu, Mairui Li +33

    cs.AIarXiv:2605.20025v22026
  7. WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

    Kaining Ying, Hengrui Hu, Siyu Ren +6

    cs.CVarXiv:2605.25874v12026
  8. D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

    Dengyang Jiang, Xin Jin, Dongyang Liu +9

    cs.CVarXiv:2605.05204v32026
  9. UniPET: a universal network for high-quality PET image denoising across varied dose reduction factors

    Zhiwen Yang, Yang Zhou, Haowei Chen +4

    cs.CVarXiv:2606.11131v12026
  10. Code as Agent Harness

    Xuying Ning, Katherine Tieu, Dongqi Fu +39

    cs.CLcs.AIarXiv:2605.18747v12026
  11. STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

    Hanxiang Chao, Yihan Bai, Rui Sheng +2

    cs.CLarXiv:2605.06527v12026
  12. Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation

    Yuying Li, Leqi Zheng, Yongzi Yu +6

    cs.LGcs.AIcs.CLarXiv:2606.02684v22026
  13. MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

    Huawei Lin, Peng Li, Jie Song +2

    cs.AIcs.CLcs.LGarXiv:2605.27366v22026
  14. From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

    Jinghao Luo, Yuchen Tian, Chuxue Cao +6

    cs.AIcs.CLarXiv:2605.06716v12026
  15. minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

    Min Zhao, Hongzhou Zhu, Bokai Yan +9

    cs.CVarXiv:2605.30263v12026
  16. Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

    Jun Guo, Qiwei Li, Peiyan Li +7

    cs.ROcs.AIcs.CVarXiv:2604.26694v22026
  17. World Model for Robot Learning: A Comprehensive Survey

    Bohan Hou, Gen Li, Jindou Jia +15

    cs.ROcs.CVarXiv:2605.00080v12026
  18. PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training

    Zelun Zhang, Hongen Liu, Suyin Liang +12

    cs.CVarXiv:2606.03264v12026
  19. From Context to Skills: Can Language Models Learn from Context Skillfully?

    Shuzheng Si, Haozhe Zhao, Yu Lei +10

    cs.AIarXiv:2604.27660v42026
  20. DreamX-World 1.0: A General-Purpose Interactive World Model

    DreamX Team, Yancheng Bai, Rui Chen +20

    cs.CVarXiv:2606.16993v12026
  21. SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors

    Rui Xu, Wenyue Chen, Jiepeng Wang +7

    cs.CVcs.GRcs.MMarXiv:2411.18966v22024
  22. WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

    Shuangrui Ding, Xuanlang Dai, Long Xing +14

    cs.CLarXiv:2605.10912v12026
  23. SkillOpt: Executive Strategy for Self-Evolving Agent Skills

    Yifan Yang, Ziyang Gong, Weiquan Huang +12

    cs.AIcs.CLarXiv:2605.23904v22026
  24. MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

    Junbo Cui, Bokai Xu, Chongyi Wang +33

    cs.CLarXiv:2604.27393v12026
  25. AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation

    Yuchao Gu, Guian Fang, Yuxin Jiang +4

    cs.CVcs.AIarXiv:2605.13724v12026
  26. RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

    Huashuo Lei, Wenxuan Song, Huarui Zhang +10

    cs.ROarXiv:2605.10921v12026
  27. AI co-mathematician: Accelerating mathematicians with agentic AI

    Daniel Zheng, Ingrid von Glehn, Yori Zwols +15

    cs.AIarXiv:2605.06651v22026
  28. Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

    Jianuo Huang, Yaojie Zhang, Qituan Zhang +3

    cs.CLarXiv:2605.29707v12026
  29. KL for a KL: On-Policy Distillation with Control Variate Baseline

    Minjae Oh, Sangjun Song, Gyubin Choi +2

    cs.LGcs.AIcs.CLarXiv:2605.07865v12026
  30. GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

    GLM-V Team, :, Wenyi Hong +95

    cs.CVarXiv:2604.26752v32026
    Summaries:简体中文
  31. Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

    Zhuofeng Li, Haoxiang Zhang, Cong Wei +16

    cs.IRcs.AIarXiv:2605.05242v12026
    Summaries:한국어
  32. ELF: Embedded Language Flows

    Keya Hu, Linlu Qiu, Yiyang Lu +5

    cs.CLcs.AIcs.LGarXiv:2605.10938v22026
  33. SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

    Haiwen Diao, Penghao Wu, Hanming Deng +55

    cs.CVarXiv:2605.12500v12026
  34. MolmoAct2: Action Reasoning Models for Real-world Deployment

    Haoquan Fang, Jiafei Duan, Donovan Clay +26

    cs.ROarXiv:2605.02881v22026
  35. A Survey on LLM-based Conversational User Simulation

    Bo Ni, Leyao Wang, Yu Wang +27

    cs.CLcs.HCarXiv:2604.24977v12026
  36. How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models

    Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis

    cs.LGcs.CLarXiv:2604.21106v32026
  37. ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

    Yuyang Zhang, Wenyao Zhang, Zekun Qi +7

    cs.CVcs.ROarXiv:2606.19531v12026
  38. ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

    Vernon Toh, Navonil Majumder, Zhengyuan Liu +2

    cs.CLarXiv:2608.02358v12026
  39. LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

    Yukang Chen, Luozhou Wang, Wei Huang +13

    cs.CVcs.DCarXiv:2605.18739v22026
  40. SkillGrad: Optimizing Agent Skills Like Gradient Descent

    Hanyu Wang, Yifan Lan, Bochuan Cao +2

    cs.AIarXiv:2605.27760v12026
  41. MiniMax Sparse Attention

    Xunhao Lai, Weiqi Xu, Yufeng Yang +14

    cs.AIarXiv:2606.13392v22026
  42. AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

    Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4

    cs.SEcs.AIarXiv:2605.12925v32026
  43. Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

    Min Zhao, Hongzhou Zhu, Kaiwen Zheng +6

    cs.CVarXiv:2605.15141v32026
  44. Cosmos 3: Omnimodal World Models for Physical AI

    NVIDIA, :, Aditi +293

    cs.CVcs.AIcs.LGarXiv:2606.02800v42026
  45. Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

    Glenn Jocher, Jing Qiu, Mengyu Liu +3

    cs.CVcs.AIarXiv:2606.03748v12026
  46. What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

    Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1

    cs.CLcs.AIcs.LGarXiv:2606.25182v12026
  47. RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets

    Peter Pak, Jesse Barkley, Rumi Loghmani +3

    cs.ROcs.MAarXiv:2606.00097v32026
  48. Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

    Guoheng Sun, Kaixi Feng, Shwai He +8

    cs.ROcs.AIarXiv:2606.27755v12026
  49. Critique of Agent Model

    Eric Xing, Mingkai Deng, Jinyu Hou

    cs.AIcs.LGcs.MAarXiv:2606.23991v12026
  50. SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

    SingGuard Team

    cs.CVcs.CLarXiv:2606.22873v32026
  51. Mind the Heads: Topological Representation Alignment for Multimodal LLMs

    Davide Caffagni, Alberto Compagnoni, Federico Melis +5

    cs.CVcs.AIcs.CLarXiv:2606.23885v12026
    Summaries:한국어
  52. InSight: Self-Guided Skill Acquisition via Steerable VLAs

    Maggie Wang, Lars Osterberg, Stephen Tian +3

    cs.ROcs.AIcs.LGarXiv:2606.24884v12026
  53. ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

    Chenhao Dang, Dantong Zhu, Jun Yang +2

    cs.AIarXiv:2606.24112v22026
  54. AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning

    Honglin Guo, Qi Zhang, Yu Zhang +7

    cs.CLarXiv:2606.24526v12026
  55. Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

    Jiayi Lei, Yuandong Pu, Xingyu Han +8

    cs.CVarXiv:2606.24548v32026
  56. Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning

    Chenhao Dang, Jing Ma, Mingjie Liao

    cs.LGcs.CLarXiv:2606.24133v12026
  57. DREAM: Dense Retrieval Embeddings via Autoregressive Modeling

    Yixuan Tang, Yi Yang

    cs.CLarXiv:2606.24667v12026
  58. Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching

    Junpeng Jing, Ronglai Zuo, Zhelun Shen +5

    cs.CVarXiv:2606.24457v12026
  59. MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

    JoungBin Lee, Jaewoo Jung, Jongmin Lee +8

    cs.CVarXiv:2606.26087v12026
  60. Trimming the Long-Tail of Visual World Modeling Evaluation

    Bingxuan Li, Yining Hong, Cheng Qian +6

    cs.CVarXiv:2606.24256v12026