Machine Learning
Papers filed under cs.LG on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
17,701 to 17,760 of 20,192
Self-Distillation Enables Continual Learning
Idan Shenfeld, Mehul Damani, Jonas Hübotter +1
cs.LGarXiv:2601.19897v22026Summaries:한국어SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
Peng Xia, Jianwen Chen, Hanyang Wang +10
cs.LGarXiv:2602.08234v12026CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
Hejian Sang, Yuanda Xu, Zhengze Zhou +3
cs.LGarXiv:2603.05433v72026CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
Weinan Dai, Hanlin Wu, Qiying Yu +13
cs.LGcs.AIarXiv:2602.24286v12026SkillNet: Create, Evaluate, and Connect AI Skills
Yuan Liang, Ruobin Zhong, Haoming Xu +47
cs.AIcs.CLcs.CVarXiv:2603.04448v22026OpenClaw-RL: Train Any Agent Simply by Talking
Yinjie Wang, Xuyang Chen, Xiaolong Jin +2
cs.CLcs.AIcs.CVarXiv:2603.10165v22026MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
Haozhen Zhang, Quanyu Long, Jianzhu Bao +4
cs.CLcs.AIcs.LGarXiv:2602.02474v22026DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
Shenyuan Gao, William Liang, Kaiyuan Zheng +27
cs.ROcs.AIcs.CVarXiv:2602.06949v12026World Action Models are Zero-shot Policies
Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng +33
cs.ROcs.CVcs.LGarXiv:2602.15922v12026Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
Jeonghye Kim, Xufang Luo, Minbeom Kim +5
cs.CLcs.LGarXiv:2603.24472v42026GLM-5: from Vibe Coding to Agentic Engineering
GLM-5-Team, :, Aohan Zeng +184
cs.LGcs.CLarXiv:2602.15763v22026Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time
Razvan Mihai Popescu, David Gros, Andrei Botocan +3
cs.SEcs.AIcs.LGarXiv:2604.00917v12026Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
Deepak Nathani, Cheng Zhang, Chang Huan +7
cs.AIcs.LGcs.MAarXiv:2604.00842v12026Do Phone-Use Agents Respect Your Privacy?
Zhengyang Tang, Ke Ji, Xidong Wang +19
cs.CRcs.AIcs.CLarXiv:2604.00986v22026Woosh: A Sound Effects Foundation Model
Gaëtan Hadjeres, Marc Ferras, Khaled Koutini +7
cs.SDcs.AIcs.LGarXiv:2604.01929v32026Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
Rafael Pardinas, Ehsan Kamalloo, David Vazquez +1
cs.LGarXiv:2604.02007v22026Forecasting Supply Chain Disruptions with Foresight Learning
Benjamin Turtel, Paul Wilczewski, Kris Skotheim
cs.LGarXiv:2604.01298v12026Learning to Learn-at-Test-Time: Language Agents with Learnable Adaptation Policies
Zhanzhi Lou, Hui Chen, Yibo Li +2
cs.LGcs.AIarXiv:2604.00830v32026Test-Time Scaling Makes Overtraining Compute-Optimal
Nicholas Roberts, Sungjun Cho, Zhiqi Gao +7
cs.LGcs.CLstat.MLarXiv:2604.01411v12026A Survey of On-Policy Distillation for Large Language Models
Mingyang Song, Mao Zheng
cs.LGcs.CLarXiv:2604.00626v42026Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers
Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao +3
cs.CLcs.AIcs.LGarXiv:2604.01128v12026Reasoning Shift: How Context Silently Shortens LLM Reasoning
Gleb Rodionov, Roman Garipov, George Yakushev
cs.LGarXiv:2604.01161v22026ActionParty: Multi-Subject Action Binding in Generative Video Games
Alexander Pondaven, Ziyi Wu, Igor Gilitschenski +4
cs.CVcs.AIcs.LGarXiv:2604.02330v22026LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
Jiachun Jin, Zetong Zhou, Xiao Yang +4
cs.CVcs.LGarXiv:2604.02097v12026SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
Zhengxi Lu, Zhiyuan Yao, Jinyang Wu +7
cs.LGarXiv:2604.02268v22026Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
Gengsheng Li, Tianyu Yang, Junfeng Fang +6
cs.LGcs.AIarXiv:2604.02288v12026Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models
Shuibai Zhang, Caspian Zhuang, Chihan Cui +8
cs.LGcs.CLarXiv:2604.01622v22026The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models
Prashant C. Raju
cs.LGcs.ITq-bio.QMarXiv:2604.04155v12026Disentangling by Factorising
Hyunjik Kim, Andriy Mnih
stat.MLcs.LGarXiv:1802.05983v32018Addressable Memory for Video World Models
Xindi Wu, Sven Elflein, James Lucas +5
cs.CVcs.LGarXiv:2608.07408v12026Born Again Neural Networks
Tommaso Furlanello, Zachary C. Lipton, Michael Tschannen +2
stat.MLcs.AIcs.LGarXiv:1805.04770v22018ClawArena: Benchmarking AI Agents in Evolving Information Environments
Haonian Ji, Kaiwen Xiong, Siwei Han +9
cs.LGcs.AIcs.CLarXiv:2604.04202v22026General Multimodal Protein Design Enables DNA-Encoding of Chemistry
Jarrid Rector-Brooks, Théophile Lambert, Marta Skreta +15
cs.LGarXiv:2604.05181v12026Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems
Justin Chih-Yao Chen, Archiki Prasad, Zaid Khan +4
cs.LGcs.AIcs.CLarXiv:2604.04767v12026SkillX: Automatically Constructing Skill Knowledge Bases for Agents
Chenxi Wang, Zhuoyun Yu, Xin Xie +8
cs.CLcs.AIcs.IRarXiv:2604.04804v22026Synthetic Sandbox for Training Machine Learning Engineering Agents
Yuhang Zhou, Lizhu Zhang, Yifan Wu +4
cs.CLcs.LGarXiv:2604.04872v12026LightThinker++: From Reasoning Compression to Memory Management
Yuqi Zhu, Jintian Zhang, Zhenjie Wan +7
cs.CLcs.AIcs.IRarXiv:2604.03679v12026Can LLMs Learn to Reason Robustly under Noisy Supervision?
Shenzhi Yang, Guangcheng Zhu, Bowen Song +7
cs.LGcs.AIarXiv:2604.03993v12026REAM: Merging Improves Pruning of Experts in LLMs
Saurav Jha, Maryam Hashemzadeh, Ali Saheb Pasand +3
cs.AIcs.CLcs.LGarXiv:2604.04356v12026Neural Computers
Mingchen Zhuge, Changsheng Zhao, Haozhe Liu +16
cs.LGcs.AIarXiv:2604.06425v22026R3PM-Net: Real-time, Robust, Real-world Point Matching Network
Yasaman Kashefbahrami, Erkut Akdag, Panagiotis Meletis +3
cs.CVcs.LGarXiv:2604.05060v22026FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
Xiangru Jian, Hao Xu, Wei Pang +13
cs.CVcs.AIcs.LGarXiv:2604.07413v22026CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation
Siddharth Jain, Venkat Narayan Vedam
cs.IRcs.CLcs.LGarXiv:2604.05467v12026FactReview: Evidence-Grounded Peer Review with Execution-Based Claim Verification
Ling Yue, Chaoqian Ouyang, Hang Xu +7
cs.AIcs.LGarXiv:2604.04074v42026SkVM: Revisiting Language VM for Skills across Heterogenous LLMs and Harnesses
Le Chen, Erhu Feng, Yubin Xia +1
cs.SEcs.LGarXiv:2604.03088v32026RAGEN-2: Reasoning Collapse in Agentic RL
Zihan Wang, Chi Gui, Xing Jin +13
cs.LGarXiv:2604.06268v12026Target Policy Optimization
Jean Kaddour
cs.LGarXiv:2604.06159v12026The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment
Rishab Balasubramanian, Pin-Jie Lin, Rituraj Sharma +6
cs.LGcs.AIarXiv:2604.06377v32026The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
Yi Xu, Philipp Jettkant, Laura Ruis
cs.LGcs.AIcs.CLarXiv:2604.06427v12026In-Place Test-Time Training
Guhao Feng, Shengjie Luo, Kai Hua +4
cs.LGcs.AIcs.CLarXiv:2604.06169v12026QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
Changxin Ke, Rui Zhang, Jiaming Guo +10
cs.SEcs.LGarXiv:2604.05963v12026MoRight: Motion Control Done Right
Shaowei Liu, Xuanchi Ren, Tianchang Shen +5
cs.CVcs.AIcs.GRarXiv:2604.07348v12026Fast Spatial Memory with Elastic Test-Time Training
Ziqiao Ma, Xueyang Yu, Haoyu Zhen +3
cs.CVcs.GRcs.LGarXiv:2604.07350v12026Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
Qiyao Ma, Dechen Gao, Rui Cai +4
cs.CLcs.LGarXiv:2604.07343v22026FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
Yitong Li, Junsong Chen, Shuchen Xue +8
cs.LGcs.AIcs.CVarXiv:2604.06916v12026Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
Quantong Qiu, Zhiyi Hong, Yi Yang +5
cs.LGcs.CLarXiv:2604.07394v12026Small Vision-Language Models are Smart Compressors for Long Video Understanding
Junjie Fei, Jun Chen, Zechun Liu +13
cs.CVcs.AIcs.CLarXiv:2604.08120v12026Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces
Jiawei Chen, Ruoxi Xu, Boxi Cao +11
cs.CLcs.AIcs.LGarXiv:2604.08362v22026Structured Distillation of Web Agent Capabilities Enables Generalization
Xing Han Lù, Siva Reddy
cs.LGarXiv:2604.07776v12026Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding
Mu Nan, Muquan Yu, Weijian Mai +12
cs.LGq-bio.NCarXiv:2604.08537v12026