Machine Learning

Papers filed under cs.LG on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

17,701 to 17,760 of 20,192

  1. Self-Distillation Enables Continual Learning

    Idan Shenfeld, Mehul Damani, Jonas Hübotter +1

    cs.LGarXiv:2601.19897v22026
    Summaries:한국어
  2. SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning

    Peng Xia, Jianwen Chen, Hanyang Wang +10

    cs.LGarXiv:2602.08234v12026
  3. CRISP: Compressed Reasoning via Iterative Self-Policy Distillation

    Hejian Sang, Yuanda Xu, Zhengze Zhou +3

    cs.LGarXiv:2603.05433v72026
  4. CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation

    Weinan Dai, Hanlin Wu, Qiying Yu +13

    cs.LGcs.AIarXiv:2602.24286v12026
  5. SkillNet: Create, Evaluate, and Connect AI Skills

    Yuan Liang, Ruobin Zhong, Haoming Xu +47

    cs.AIcs.CLcs.CVarXiv:2603.04448v22026
  6. OpenClaw-RL: Train Any Agent Simply by Talking

    Yinjie Wang, Xuyang Chen, Xiaolong Jin +2

    cs.CLcs.AIcs.CVarXiv:2603.10165v22026
  7. MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents

    Haozhen Zhang, Quanyu Long, Jianzhu Bao +4

    cs.CLcs.AIcs.LGarXiv:2602.02474v22026
  8. DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

    Shenyuan Gao, William Liang, Kaiyuan Zheng +27

    cs.ROcs.AIcs.CVarXiv:2602.06949v12026
  9. World Action Models are Zero-shot Policies

    Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng +33

    cs.ROcs.CVcs.LGarXiv:2602.15922v12026
  10. Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

    Jeonghye Kim, Xufang Luo, Minbeom Kim +5

    cs.CLcs.LGarXiv:2603.24472v42026
  11. GLM-5: from Vibe Coding to Agentic Engineering

    GLM-5-Team, :, Aohan Zeng +184

    cs.LGcs.CLarXiv:2602.15763v22026
  12. Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time

    Razvan Mihai Popescu, David Gros, Andrei Botocan +3

    cs.SEcs.AIcs.LGarXiv:2604.00917v12026
  13. Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

    Deepak Nathani, Cheng Zhang, Chang Huan +7

    cs.AIcs.LGcs.MAarXiv:2604.00842v12026
  14. Do Phone-Use Agents Respect Your Privacy?

    Zhengyang Tang, Ke Ji, Xidong Wang +19

    cs.CRcs.AIcs.CLarXiv:2604.00986v22026
  15. Woosh: A Sound Effects Foundation Model

    Gaëtan Hadjeres, Marc Ferras, Khaled Koutini +7

    cs.SDcs.AIcs.LGarXiv:2604.01929v32026
  16. Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning

    Rafael Pardinas, Ehsan Kamalloo, David Vazquez +1

    cs.LGarXiv:2604.02007v22026
  17. Forecasting Supply Chain Disruptions with Foresight Learning

    Benjamin Turtel, Paul Wilczewski, Kris Skotheim

    cs.LGarXiv:2604.01298v12026
  18. Learning to Learn-at-Test-Time: Language Agents with Learnable Adaptation Policies

    Zhanzhi Lou, Hui Chen, Yibo Li +2

    cs.LGcs.AIarXiv:2604.00830v32026
  19. Test-Time Scaling Makes Overtraining Compute-Optimal

    Nicholas Roberts, Sungjun Cho, Zhiqi Gao +7

    cs.LGcs.CLstat.MLarXiv:2604.01411v12026
  20. A Survey of On-Policy Distillation for Large Language Models

    Mingyang Song, Mao Zheng

    cs.LGcs.CLarXiv:2604.00626v42026
  21. Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers

    Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao +3

    cs.CLcs.AIcs.LGarXiv:2604.01128v12026
  22. Reasoning Shift: How Context Silently Shortens LLM Reasoning

    Gleb Rodionov, Roman Garipov, George Yakushev

    cs.LGarXiv:2604.01161v22026
  23. ActionParty: Multi-Subject Action Binding in Generative Video Games

    Alexander Pondaven, Ziyi Wu, Igor Gilitschenski +4

    cs.CVcs.AIcs.LGarXiv:2604.02330v22026
  24. LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

    Jiachun Jin, Zetong Zhou, Xiao Yang +4

    cs.CVcs.LGarXiv:2604.02097v12026
  25. SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

    Zhengxi Lu, Zhiyuan Yao, Jinyang Wu +7

    cs.LGarXiv:2604.02268v22026
  26. Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing

    Gengsheng Li, Tianyu Yang, Junfeng Fang +6

    cs.LGcs.AIarXiv:2604.02288v12026
  27. Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models

    Shuibai Zhang, Caspian Zhuang, Chihan Cui +8

    cs.LGcs.CLarXiv:2604.01622v22026
  28. The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

    Prashant C. Raju

    cs.LGcs.ITq-bio.QMarXiv:2604.04155v12026
  29. Disentangling by Factorising

    Hyunjik Kim, Andriy Mnih

    stat.MLcs.LGarXiv:1802.05983v32018
  30. Addressable Memory for Video World Models

    Xindi Wu, Sven Elflein, James Lucas +5

    cs.CVcs.LGarXiv:2608.07408v12026
  31. Born Again Neural Networks

    Tommaso Furlanello, Zachary C. Lipton, Michael Tschannen +2

    stat.MLcs.AIcs.LGarXiv:1805.04770v22018
  32. ClawArena: Benchmarking AI Agents in Evolving Information Environments

    Haonian Ji, Kaiwen Xiong, Siwei Han +9

    cs.LGcs.AIcs.CLarXiv:2604.04202v22026
  33. General Multimodal Protein Design Enables DNA-Encoding of Chemistry

    Jarrid Rector-Brooks, Théophile Lambert, Marta Skreta +15

    cs.LGarXiv:2604.05181v12026
  34. Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems

    Justin Chih-Yao Chen, Archiki Prasad, Zaid Khan +4

    cs.LGcs.AIcs.CLarXiv:2604.04767v12026
  35. SkillX: Automatically Constructing Skill Knowledge Bases for Agents

    Chenxi Wang, Zhuoyun Yu, Xin Xie +8

    cs.CLcs.AIcs.IRarXiv:2604.04804v22026
  36. Synthetic Sandbox for Training Machine Learning Engineering Agents

    Yuhang Zhou, Lizhu Zhang, Yifan Wu +4

    cs.CLcs.LGarXiv:2604.04872v12026
  37. LightThinker++: From Reasoning Compression to Memory Management

    Yuqi Zhu, Jintian Zhang, Zhenjie Wan +7

    cs.CLcs.AIcs.IRarXiv:2604.03679v12026
  38. Can LLMs Learn to Reason Robustly under Noisy Supervision?

    Shenzhi Yang, Guangcheng Zhu, Bowen Song +7

    cs.LGcs.AIarXiv:2604.03993v12026
  39. REAM: Merging Improves Pruning of Experts in LLMs

    Saurav Jha, Maryam Hashemzadeh, Ali Saheb Pasand +3

    cs.AIcs.CLcs.LGarXiv:2604.04356v12026
  40. Neural Computers

    Mingchen Zhuge, Changsheng Zhao, Haozhe Liu +16

    cs.LGcs.AIarXiv:2604.06425v22026
  41. R3PM-Net: Real-time, Robust, Real-world Point Matching Network

    Yasaman Kashefbahrami, Erkut Akdag, Panagiotis Meletis +3

    cs.CVcs.LGarXiv:2604.05060v22026
  42. FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

    Xiangru Jian, Hao Xu, Wei Pang +13

    cs.CVcs.AIcs.LGarXiv:2604.07413v22026
  43. CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

    Siddharth Jain, Venkat Narayan Vedam

    cs.IRcs.CLcs.LGarXiv:2604.05467v12026
  44. FactReview: Evidence-Grounded Peer Review with Execution-Based Claim Verification

    Ling Yue, Chaoqian Ouyang, Hang Xu +7

    cs.AIcs.LGarXiv:2604.04074v42026
  45. SkVM: Revisiting Language VM for Skills across Heterogenous LLMs and Harnesses

    Le Chen, Erhu Feng, Yubin Xia +1

    cs.SEcs.LGarXiv:2604.03088v32026
  46. RAGEN-2: Reasoning Collapse in Agentic RL

    Zihan Wang, Chi Gui, Xing Jin +13

    cs.LGarXiv:2604.06268v12026
  47. Target Policy Optimization

    Jean Kaddour

    cs.LGarXiv:2604.06159v12026
  48. The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment

    Rishab Balasubramanian, Pin-Jie Lin, Rituraj Sharma +6

    cs.LGcs.AIarXiv:2604.06377v32026
  49. The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning

    Yi Xu, Philipp Jettkant, Laura Ruis

    cs.LGcs.AIcs.CLarXiv:2604.06427v12026
  50. In-Place Test-Time Training

    Guhao Feng, Shengjie Luo, Kai Hua +4

    cs.LGcs.AIcs.CLarXiv:2604.06169v12026
  51. QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

    Changxin Ke, Rui Zhang, Jiaming Guo +10

    cs.SEcs.LGarXiv:2604.05963v12026
  52. MoRight: Motion Control Done Right

    Shaowei Liu, Xuanchi Ren, Tianchang Shen +5

    cs.CVcs.AIcs.GRarXiv:2604.07348v12026
  53. Fast Spatial Memory with Elastic Test-Time Training

    Ziqiao Ma, Xueyang Yu, Haoyu Zhen +3

    cs.CVcs.GRcs.LGarXiv:2604.07350v12026
  54. Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

    Qiyao Ma, Dechen Gao, Rui Cai +4

    cs.CLcs.LGarXiv:2604.07343v22026
  55. FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling

    Yitong Li, Junsong Chen, Shuchen Xue +8

    cs.LGcs.AIcs.CVarXiv:2604.06916v12026
  56. Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference

    Quantong Qiu, Zhiyi Hong, Yi Yang +5

    cs.LGcs.CLarXiv:2604.07394v12026
  57. Small Vision-Language Models are Smart Compressors for Long Video Understanding

    Junjie Fei, Jun Chen, Zechun Liu +13

    cs.CVcs.AIcs.CLarXiv:2604.08120v12026
  58. Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

    Jiawei Chen, Ruoxi Xu, Boxi Cao +11

    cs.CLcs.AIcs.LGarXiv:2604.08362v22026
  59. Structured Distillation of Web Agent Capabilities Enables Generalization

    Xing Han Lù, Siva Reddy

    cs.LGarXiv:2604.07776v12026
  60. Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding

    Mu Nan, Muquan Yu, Weijian Mai +12

    cs.LGq-bio.NCarXiv:2604.08537v12026