Every paper with a summary

Every arXiv paper Paperlayer has summarized so far. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

60,241 to 60,300 of 61,278

  1. AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery

    Guiyao Tie, Jiawen Shi, Dingjie Song +20

    cs.AIarXiv:2605.23204v12026
  2. Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

    Ziang Li, Dongzhou Cheng, Yibin Wang +5

    cs.CVarXiv:2606.08242v12026
  3. An Adaptive Gradient Clipping and Noise Injection Mechanism for Differentially Private Federated Learning

    Wenjing Wei, Alla Jammine, Farid Nait-Abdesselam

    cs.CRcs.LGarXiv:2608.15153v12026
  4. FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

    Bin Yu, Shijie Lian, Xiaopeng Lin +8

    cs.ROarXiv:2605.13757v12026
  5. AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

    Yuyuan Liu, Yuanhong Chen, Chong Wang +6

    cs.CVarXiv:2506.01015v22025
  6. PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World

    Yunhan Yang, Chunshi Wang, Junliang Ye +7

    cs.CVarXiv:2605.05163v12026
  7. OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

    Yuwen Du, Rui Ye, Shuo Tang +4

    cs.AIcs.CLarXiv:2605.04036v12026
  8. Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

    NVIDIA, :, Amala Sanjay Deshmukh +216

    cs.LGcs.AIcs.CVarXiv:2604.24954v22026
  9. HumanNet: Scaling Human-centric Video Learning to One Million Hours

    Yufan Deng, Daquan Zhou

    cs.CVcs.ROarXiv:2605.06747v12026
  10. Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning

    Benhao Huang, Zhengyang Geng, Zico Kolter

    cs.LGarXiv:2605.21488v12026
  11. Harnessing LLM Agents with Skill Programs

    Hongjun Liu, Yifei Ming, Shafiq Joty +1

    cs.AIarXiv:2605.17734v12026
  12. ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering

    Akrin Zheng, Alexander Wu, Alaia Liu

    cs.IRcs.AIcs.CLarXiv:2608.10679v22026
  13. On the Geometry of On-Policy Distillation

    Zhennan Shen, Yanshu Li, Qingyu Yin +6

    cs.LGcs.AIarXiv:2606.07082v32026
  14. L2P: Unlocking Latent Potential for Pixel Generation

    Zhennan Chen, Junwei Zhu, Xu Chen +7

    cs.CVcs.AIarXiv:2605.12013v12026
  15. Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

    Hayate Iso, Tiyasa Mitra, Sudipta Mondal +15

    cs.LGcs.CLarXiv:2604.26779v12026
  16. World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

    Weijie Wang, Xiaoxuan He, Youping Gu +9

    cs.CVarXiv:2604.24764v42026
  17. MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery

    Shangheng Du, Xiangchao Yan, Jinxin Shi +11

    cs.AIcs.CLarXiv:2606.06473v12026
  18. WALL-WM: Carving World Action Modeling at the Event Joints

    Shalfun Li, Victor Yao, Charles Yang +28

    cs.ROcs.CVarXiv:2606.01955v12026
  19. Useful Memories Become Faulty When Continuously Updated by LLMs

    Dylan Zhang, Yanshan Lin, Zhengkun Wu +4

    cs.AIarXiv:2605.12978v12026
  20. Model Merging Scaling Laws in Large Language Models

    Yuanyi Wang, Yanggan Gu, Yiming Zhang +6

    cs.AIarXiv:2509.24244v42025
  21. ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

    Yiming Zhang, Jiacheng Chen, Jiaqi Tan +3

    cs.CVarXiv:2604.24300v22026
  22. CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities

    Daoyu Wang, Qingchuan Li, Mingyue Cheng +6

    cs.CLarXiv:2604.18401v52026
  23. AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models

    Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov +6

    cs.ROcs.AIarXiv:2603.10126v22026
  24. SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?

    Sy-Tuyen Ho, Minghui Liu, Huy Nghiem +1

    cs.LGarXiv:2605.30329v12026
  25. Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

    NVIDIA, :, Aaron Blakeman +571

    cs.CLcs.AIcs.LGarXiv:2606.15007v12026
  26. Qwen-Image-2.0 Technical Report

    Bing Zhao, Chenfei Wu, Deqing Li +72

    cs.CVarXiv:2605.10730v12026
  27. Reward Hacking in Rubric-Based Reinforcement Learning

    Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3

    cs.AIarXiv:2605.12474v12026
  28. Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

    Guobin Shen, Xiang Cheng, Chenxiao Zhao +4

    cs.LGcs.AIcs.CLarXiv:2605.11609v12026
  29. SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents

    Bingchen Zhao, Dhruv Srikanth, Yuxiang Wu +1

    cs.SEcs.AIcs.CLarXiv:2605.21384v12026
  30. MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction

    Jianing Zhang, Chenhao Zheng, Yajun Yang +10

    cs.CVarXiv:2606.18558v12026
  31. MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

    Minghao Guo, Qingyue Jiao, Zeru Shi +14

    cs.CVcs.CLcs.IRarXiv:2605.15128v12026
  32. ECHO: Terminal Agents Learn World Models for Free

    Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah +1

    cs.LGcs.CLarXiv:2605.24517v12026
  33. HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

    Tu Trinh, Mohamed Elfeki, Guangze Luo +9

    cs.AIarXiv:2604.09408v42026
  34. Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO

    Yu Tian, Jiawei Chen, Lifan Zheng +5

    cs.CLarXiv:2604.27488v12026
  35. From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

    Shangding Gu

    cs.AIcs.LGarXiv:2605.26112v12026
  36. Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

    Chuan Xiao, Zhengbo Jiao, Shaobo Wang +5

    cs.SEcs.AIarXiv:2606.07412v12026
  37. MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

    Shengjun Zhang, Zhang Zhang, Simin Huang +11

    cs.CVarXiv:2606.00793v22026
  38. TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

    Zhaoyang Chu, Jiarui Hu, Xingyu Jiang +8

    cs.AIarXiv:2605.22535v12026
  39. $τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

    Pengfei Zhou, Shengcong Chen, Di Chen +17

    cs.ROarXiv:2606.01027v12026
  40. When to Trust Imagination: Adaptive Action Execution for World Action Models

    Rui Wang, Yue Zhang, Jiehong Lin +4

    cs.ROcs.AIarXiv:2605.06222v22026
  41. KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels

    Han Wang, Jintao Zhang, Kai Jiang +3

    cs.LGcs.PFarXiv:2605.04956v22026
  42. No One Knows the State of the Art in Geospatial Foundation Models

    Isaac Corley, Nils Lehmann, Caleb Robinson +6

    cs.CVcs.CYarXiv:2605.12678v22026
  43. Next Forcing: Causal World Modeling with Multi-Chunk Prediction

    Gangwei Xu, Qihang Zhang, Jiaming Zhou +4

    cs.CVarXiv:2606.11187v12026
  44. Explainability Boosted Anomaly Detection Framework for O-RAN based NextG Networks

    Nurullah Aksu, Ali Fuat Sahin, Semiha Tedik Başaran

    eess.SPcs.CRcs.LGarXiv:2608.14826v12026
  45. OpenComputer: Verifiable Software Worlds for Computer-Use Agents

    Jinbiao Wei, Qianran Ma, Yilun Zhao +4

    cs.AIcs.SEarXiv:2605.19769v12026
  46. SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning

    Wenhao Yan, Fengjia Guo, Zhuoyi Yang +1

    cs.CVarXiv:2606.10804v32026
  47. HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

    Mingju Chen, Can Lv, Guibin Zhang +2

    cs.CLarXiv:2606.01779v12026
  48. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Zhiheng Liu, Weiming Ren, Xiaoke Huang +12

    cs.CVarXiv:2604.24763v22026
  49. Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

    Chenxin Li, Zhengyang Tang, Mingxin Huang +8

    cs.SEcs.AIarXiv:2604.28139v22026
  50. From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

    Qiliang Liang, Hansi Wang, Zhong Liang +1

    cs.CLcs.AIarXiv:2604.24026v42026
  51. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    Xiang An, Yin Xie, Feilong Tang +27

    cs.CVarXiv:2605.25979v12026
  52. Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

    Yaorui Shi, Yuxin Chen, Zhengxi Lu +6

    cs.AIarXiv:2605.06130v32026
  53. PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments

    Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler +10

    cs.AIarXiv:2605.02240v12026
  54. ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

    Yining Hong, Jiageng Liu, Han Yin +5

    cs.CVcs.AIcs.CLarXiv:2605.18746v22026
  55. SWE-Explore: Benchmarking How Coding Agents Explore Repositories

    Shaoqiu Zhang, Yuhang Wang, Jialiang Liang +8

    cs.SEcs.CLarXiv:2606.07297v12026
  56. iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework

    Jianjie Fang, Yingshan Lei, Qin Wan +8

    cs.CVcs.AIarXiv:2605.03941v22026
  57. AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

    Jisong Cai, Long Ling, Shiwei Chu +10

    cs.ROcs.AIcs.CVarXiv:2606.09811v12026
  58. Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form

    Parsa Mazaheri

    cs.AIcs.CLarXiv:2608.15022v12026
  59. NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

    Peng Cai, Zhaofan Zou, Shifa Liu +6

    cs.CVcs.AIarXiv:2608.12898v12026
  60. WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

    Xiaojie Xu, Zhengyuan Lin, Runyi Li +3

    cs.CVcs.GRarXiv:2608.15659v12026