Every paper with a summary
Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
60,301 to 60,360 of 61,181
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
Jiaqi Wang, Wenhao Zhang, Weijie Shi +2
cs.LGcs.AIarXiv:2604.24005v32026World Action Models: The Next Frontier in Embodied AI
Siyin Wang, Junhao Shi, Zhaoyang Fu +11
cs.ROcs.CLcs.CVarXiv:2605.12090v12026Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
Qiuyue Wang, Mingsheng Li, Jian Guan +37
cs.ROcs.AIcs.CLarXiv:2605.30280v22026Self-Distilled Agentic Reinforcement Learning
Zhengxi Lu, Zhiyuan Yao, Zhuowen Han +8
cs.LGcs.AIcs.CLarXiv:2605.15155v12026LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies
Jialei Chen, Kai Wang, Kang Chen +9
cs.ROcs.AIarXiv:2606.15768v12026AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration
Jiaqi Liu, Shi Qiu, Mairui Li +33
cs.AIarXiv:2605.20025v22026WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation
Kaining Ying, Hengrui Hu, Siyu Ren +6
cs.CVarXiv:2605.25874v12026D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
Dengyang Jiang, Xin Jin, Dongyang Liu +9
cs.CVarXiv:2605.05204v32026UniPET: a universal network for high-quality PET image denoising across varied dose reduction factors
Zhiwen Yang, Yang Zhou, Haowei Chen +4
cs.CVarXiv:2606.11131v12026Code as Agent Harness
Xuying Ning, Katherine Tieu, Dongqi Fu +39
cs.CLcs.AIarXiv:2605.18747v12026STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?
Hanxiang Chao, Yihan Bai, Rui Sheng +2
cs.CLarXiv:2605.06527v12026Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation
Yuying Li, Leqi Zheng, Yongzi Yu +6
cs.LGcs.AIcs.CLarXiv:2606.02684v22026MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
Huawei Lin, Peng Li, Jie Song +2
cs.AIcs.CLcs.LGarXiv:2605.27366v22026From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms
Jinghao Luo, Yuchen Tian, Chuxue Cao +6
cs.AIcs.CLarXiv:2605.06716v12026minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
Min Zhao, Hongzhou Zhu, Bokai Yan +9
cs.CVarXiv:2605.30263v12026Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
Jun Guo, Qiwei Li, Peiyan Li +7
cs.ROcs.AIcs.CVarXiv:2604.26694v22026World Model for Robot Learning: A Comprehensive Survey
Bohan Hou, Gen Li, Jindou Jia +15
cs.ROcs.CVarXiv:2605.00080v12026PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training
Zelun Zhang, Hongen Liu, Suyin Liang +12
cs.CVarXiv:2606.03264v12026From Context to Skills: Can Language Models Learn from Context Skillfully?
Shuzheng Si, Haozhe Zhao, Yu Lei +10
cs.AIarXiv:2604.27660v42026DreamX-World 1.0: A General-Purpose Interactive World Model
DreamX Team, Yancheng Bai, Rui Chen +20
cs.CVarXiv:2606.16993v12026SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors
Rui Xu, Wenyue Chen, Jiepeng Wang +7
cs.CVcs.GRcs.MMarXiv:2411.18966v22024WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
Shuangrui Ding, Xuanlang Dai, Long Xing +14
cs.CLarXiv:2605.10912v12026SkillOpt: Executive Strategy for Self-Evolving Agent Skills
Yifan Yang, Ziyang Gong, Weiquan Huang +12
cs.AIcs.CLarXiv:2605.23904v22026MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
Junbo Cui, Bokai Xu, Chongyi Wang +33
cs.CLarXiv:2604.27393v12026AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
Yuchao Gu, Guian Fang, Yuxin Jiang +4
cs.CVcs.AIarXiv:2605.13724v12026RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
Huashuo Lei, Wenxuan Song, Huarui Zhang +10
cs.ROarXiv:2605.10921v12026AI co-mathematician: Accelerating mathematicians with agentic AI
Daniel Zheng, Ingrid von Glehn, Yori Zwols +15
cs.AIarXiv:2605.06651v22026Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
Jianuo Huang, Yaojie Zhang, Qituan Zhang +3
cs.CLarXiv:2605.29707v12026KL for a KL: On-Policy Distillation with Control Variate Baseline
Minjae Oh, Sangjun Song, Gyubin Choi +2
cs.LGcs.AIcs.CLarXiv:2605.07865v12026GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
GLM-V Team, :, Wenyi Hong +95
cs.CVarXiv:2604.26752v32026Summaries:简体中文Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction
Zhuofeng Li, Haoxiang Zhang, Cong Wei +16
cs.IRcs.AIarXiv:2605.05242v12026Summaries:한국어ELF: Embedded Language Flows
Keya Hu, Linlu Qiu, Yiyang Lu +5
cs.CLcs.AIcs.LGarXiv:2605.10938v22026SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
Haiwen Diao, Penghao Wu, Hanming Deng +55
cs.CVarXiv:2605.12500v12026MolmoAct2: Action Reasoning Models for Real-world Deployment
Haoquan Fang, Jiafei Duan, Donovan Clay +26
cs.ROarXiv:2605.02881v22026A Survey on LLM-based Conversational User Simulation
Bo Ni, Leyao Wang, Yu Wang +27
cs.CLcs.HCarXiv:2604.24977v12026How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models
Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis
cs.LGcs.CLarXiv:2604.21106v32026ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
Yuyang Zhang, Wenyao Zhang, Zekun Qi +7
cs.CVcs.ROarXiv:2606.19531v12026ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step
Vernon Toh, Navonil Majumder, Zhengyuan Liu +2
cs.CLarXiv:2608.02358v12026LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
Yukang Chen, Luozhou Wang, Wei Huang +13
cs.CVcs.DCarXiv:2605.18739v22026SkillGrad: Optimizing Agent Skills Like Gradient Descent
Hanyu Wang, Yifan Lan, Bochuan Cao +2
cs.AIarXiv:2605.27760v12026MiniMax Sparse Attention
Xunhao Lai, Weiqi Xu, Yufeng Yang +14
cs.AIarXiv:2606.13392v22026AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4
cs.SEcs.AIarXiv:2605.12925v32026Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
Min Zhao, Hongzhou Zhu, Kaiwen Zheng +6
cs.CVarXiv:2605.15141v32026Cosmos 3: Omnimodal World Models for Physical AI
NVIDIA, :, Aditi +293
cs.CVcs.AIcs.LGarXiv:2606.02800v42026Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Glenn Jocher, Jing Qiu, Mengyu Liu +3
cs.CVcs.AIarXiv:2606.03748v12026What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics
Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1
cs.CLcs.AIcs.LGarXiv:2606.25182v12026RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets
Peter Pak, Jesse Barkley, Rumi Loghmani +3
cs.ROcs.MAarXiv:2606.00097v32026Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
Guoheng Sun, Kaixi Feng, Shwai He +8
cs.ROcs.AIarXiv:2606.27755v12026Critique of Agent Model
Eric Xing, Mingkai Deng, Jinyu Hou
cs.AIcs.LGcs.MAarXiv:2606.23991v12026SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning
SingGuard Team
cs.CVcs.CLarXiv:2606.22873v32026Mind the Heads: Topological Representation Alignment for Multimodal LLMs
Davide Caffagni, Alberto Compagnoni, Federico Melis +5
cs.CVcs.AIcs.CLarXiv:2606.23885v12026Summaries:한국어InSight: Self-Guided Skill Acquisition via Steerable VLAs
Maggie Wang, Lars Osterberg, Stephen Tian +3
cs.ROcs.AIcs.LGarXiv:2606.24884v12026ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection
Chenhao Dang, Dantong Zhu, Jun Yang +2
cs.AIarXiv:2606.24112v22026AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning
Honglin Guo, Qi Zhang, Yu Zhang +7
cs.CLarXiv:2606.24526v12026Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning
Jiayi Lei, Yuandong Pu, Xingyu Han +8
cs.CVarXiv:2606.24548v32026Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning
Chenhao Dang, Jing Ma, Mingjie Liao
cs.LGcs.CLarXiv:2606.24133v12026DREAM: Dense Retrieval Embeddings via Autoregressive Modeling
Yixuan Tang, Yi Yang
cs.CLarXiv:2606.24667v12026Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching
Junpeng Jing, Ronglai Zuo, Zhelun Shen +5
cs.CVarXiv:2606.24457v12026MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
JoungBin Lee, Jaewoo Jung, Jongmin Lee +8
cs.CVarXiv:2606.26087v12026Trimming the Long-Tail of Visual World Modeling Evaluation
Bingxuan Li, Yining Hong, Cheng Qian +6
cs.CVarXiv:2606.24256v12026