Machine Learning

Papers filed under cs.LG on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

7,321 to 7,380 of 20,044

  1. Continual Evolution Strategies in Control Tasks

    Nicola Pitzalis, Eleni Nisioti, Antonio Carta +2

    cs.NEcs.LGarXiv:2608.13600v12026
  2. The Loss Does Not See the Basis, but Adam Does

    Devender Singh

    cs.LGmath.OCstat.MLarXiv:2608.05136v12026
  3. Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop

    Igor Itkin

    cs.AIcond-mat.stat-mechcs.CLarXiv:2608.11215v12026
  4. MemSFT: Mitigating Alignment Tax with an External Parametric Memory

    Jiarui Wang, Xiang Shi, Jiaqi Cao +8

    cs.LGcs.CLarXiv:2607.25614v12026
  5. Kimi Linear: An Expressive, Efficient Attention Architecture

    Kimi Team, Yu Zhang, Zongyu Lin +57

    cs.CLcs.LGarXiv:2510.26692v22025
  6. ISO: An RLVR-Native Optimization Stack

    Hanqing Zhu, Wenyan Cong, Zhizhou Sha +8

    cs.LGcs.AIarXiv:2607.19331v12026
  7. Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code

    Niels Mündler-Sasahara, Hristo Venev, Dawn Song +2

    cs.PLcs.AIcs.LGarXiv:2607.13921v22026
    Summaries:한국어
  8. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Donghyun Lee, Yuhang Li, Ruokai Yin +1

    cs.LGarXiv:2607.07964v22026
  9. Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings

    Jiangang Han

    math.STcs.AIcs.LGarXiv:2607.13918v12026
  10. UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

    Niu Lian, Tongbo Chen, Zhehao Yu +8

    cs.CLcs.AIcs.CVarXiv:2607.04425v22026
  11. Trust Region Policy Distillation

    Zhengpeng Xie, Li Lyna Zhang, Zeke Xie +1

    cs.LGcs.AIarXiv:2607.04751v12026
  12. MANCE: Manifold Aware Concept Erasure

    Matan Avitan, Yoav Goldberg, Yanai Elazar

    cs.LGarXiv:2607.03973v12026
  13. Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

    Koichi Namekata, Yash Kant, Zhizheng Liu +9

    cs.CVcs.LGarXiv:2606.20891v12026
  14. APPO: Agentic Procedural Policy Optimization

    Xucong Wang, Ziyu Ma, Yong Wang +5

    cs.LGcs.AIarXiv:2606.12384v22026
  15. Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

    Zhiyuan Zhou, Andy Peng, Charles Xu +4

    cs.LGcs.AIarXiv:2606.11087v12026
  16. Redesign Mixture-of-Experts Routers with Manifold Power Iteration

    Songhao Wu, Ang Lv, Ruobing Xie +1

    cs.LGcs.AIcs.CLarXiv:2606.12397v12026
  17. Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

    Renjie Mao, Xiangxin Zhou, Lvfang Tao +7

    cs.LGcs.AIarXiv:2606.10968v22026
  18. Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

    Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori +3

    cs.LGcs.AIcs.CLarXiv:2606.07379v22026
  19. Beyond Holistic Models: Systematic Component-level Benchmarking of Deep Multivariate Time-Series Forecasting

    Shuang Liang, Chaochuan Hou, Xu Yao +4

    cs.LGarXiv:2605.26562v12026
  20. OPRD: On-Policy Representation Distillation

    Shenzhi Yang, Guangcheng Zhu, Bowen Song +8

    cs.LGcs.AIarXiv:2606.06021v42026
  21. Why Muon Outperforms Adam: A Curvature Perspective

    Shuche Wang, Fengzhuo Zhang, Jiaxiang Li +2

    cs.LGcs.AIarXiv:2606.04662v12026
  22. Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

    Peter Chen, Xi Chen

    cs.LGcs.AIarXiv:2606.01708v12026
  23. OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification

    Yuhang Zhou, Lizhu Zhang, Yifan Wu +5

    cs.LGcs.CLarXiv:2606.01476v22026
  24. MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

    Xinle Deng, Ruobin Zhong, Hujin Peng +15

    cs.CLcs.AIcs.LGarXiv:2605.28732v32026
  25. Parallax: Parameterized Local Linear Attention for Language Modeling

    Yifei Zuo, Dhruv Pai, Zhichen Zeng +3

    cs.LGcs.AIcs.CLarXiv:2605.29157v12026
  26. GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

    Xiaohang Tang, Keyue Jiang, Che Liu +4

    cs.LGcs.AIarXiv:2605.29398v12026
  27. The Good, the Bad, and the Ugly of Markov Boundary for Tabular Prediction

    Shu Wan, Abhinav Gorantla, Huan Liu +1

    cs.LGcs.AIstat.MEarXiv:2605.29411v22026
  28. Automatic Construction and Natural-Language Description of Nonparametric Regression Models

    James Robert Lloyd, David Duvenaud, Roger Grosse +2

    stat.MLcs.LGarXiv:1402.4304v32014
  29. RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains

    Haoxiang Jiang, Zihan Dong, Tianci Liu +5

    cs.LGcs.CLarXiv:2605.29156v12026
  30. Trust Region Q Adjoint Matching

    Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2

    cs.LGcs.AIcs.ROarXiv:2605.27079v12026
  31. Pruning and Distilling Mixture-of-Experts into Dense Language Models

    Junhyuck Kim, Jihun Yun, Haechan Kim +3

    cs.CLcs.AIcs.LGarXiv:2605.28207v22026
  32. Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

    Yuanyi Wang, Su Lu, Yanggan Gu +6

    cs.LGarXiv:2605.26844v12026
  33. Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion

    Jaihoon Kim, Taehoon Yoon, Prin Phunyaphibarn +3

    cs.LGarXiv:2605.23346v12026
  34. When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs

    Yifan Zeng, Yiran Wu, Yaolun Zhang +4

    cs.AIcs.LGarXiv:2605.24202v22026
  35. Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers

    Tim Tsz-Kit Lau, Weijie Su

    math.OCcs.AIcs.LGarXiv:2605.18106v42026
  36. Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

    Nandan Kumar Jha, Brandon Reagen

    cs.LGarXiv:2605.21803v12026
  37. The Distillation Game: Adaptive Attacks & Efficient Defenses

    Youssef Allouah, Mahdi Haghifam, Sanmi Koyejo +1

    cs.LGcs.AIarXiv:2605.22737v32026
  38. OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantization

    Mark Boss, Vikram Voleti, Simon Donné +1

    cs.LGcs.AIarXiv:2605.21226v12026
  39. optimize_anything: A Universal API for Optimizing any Text Parameter

    Lakshya A Agrawal, Donghyun Lee, Shangyin Tan +11

    cs.CLcs.AIcs.LGarXiv:2605.19633v12026
  40. CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage

    Jiale Liu, Jungang Li, Jieming Yu +13

    cs.CVcs.GRcs.LGarXiv:2605.15597v12026
  41. Forgetting That Sticks: Quantization-Permanent Unlearning via Circuit Attribution

    Saisab Sadhu, Pratinav Seth, Vinay Kumar Sankarapu

    cs.LGcs.CLcs.ETarXiv:2605.15138v12026
  42. HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts

    Tao Zhong, Dongzhe Zheng, Christine Allen-Blanchette

    cs.LGcs.AIcs.CLarXiv:2605.13997v12026
  43. Holder Policy Optimisation

    Yuxiang Chen, Dingli Liang, Yihang Chen +8

    cs.LGcs.AIarXiv:2605.12058v22026
  44. Reliable Chain-of-Thought via Prefix Consistency

    Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar +1

    stat.MLcs.CLcs.LGarXiv:2605.07654v12026
  45. Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-Training

    Yuanyi Wang, Yifan Yang, Su Lu +9

    cs.LGcs.ITarXiv:2605.09608v12026
  46. G-Zero: Self-Play for Open-Ended Generation from Zero Data

    Chengsong Huang, Haolin Liu, Tong Zheng +7

    cs.LGcs.AIcs.CLarXiv:2605.09959v12026
  47. Multi-Step-Ahead Time Series Prediction using Multiple-Output Support Vector Regression

    Yukun Bao, Tao Xiong, Zhongyi Hu

    cs.LGstat.MLarXiv:1401.2504v12014
  48. Sub-JEPA: Subspace Gaussian Regularization for Stable End-to-End World Models

    Kai Zhao, Dongliang Nie, Yuchen Lin +4

    cs.LGcs.AIarXiv:2605.09241v12026
  49. Rethinking State Tracking in Recurrent Models Through Error Control Dynamics

    Jiwan Chung, Heechan Choi, Seon Joo Kim

    cs.LGcs.CLarXiv:2605.07755v12026
  50. Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

    Pengqi Lu

    cs.LGcs.CVarXiv:2605.06169v12026
  51. Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

    Bolian Li, Yifan Wang, Yi Ding +3

    cs.LGcs.CLstat.MLarXiv:2604.26326v22026
  52. Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

    Zhisong Qiu, Shuofei Qiao, Kewei Xu +4

    cs.CLcs.AIcs.CEarXiv:2604.24198v22026
  53. Sample Selection Using Multi-Task Autoencoders in Federated Learning with Non-IID Data

    Emre Ardıç, Yakup Genç

    cs.CVcs.LGarXiv:2604.26116v12026
  54. Convergent Evolution: How Different Language Models Learn Similar Number Representations

    Deqing Fu, Tianyi Zhou, Mikhail Belkin +2

    cs.CLcs.AIcs.LGarXiv:2604.20817v22026
  55. DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off

    Xiaofan Li, Ming Yang, Zhiyuan Ma +9

    cs.LGarXiv:2604.13902v12026
  56. Reinforcement Learning via Value Gradient Flow

    Haoran Xu, Kaiwen Hu, Somayeh Sojoudi +1

    cs.LGcs.AIarXiv:2604.14265v12026
  57. Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

    Yecheng Wu, Song Han, Hai Cai

    cs.LGcs.AIarXiv:2604.13010v22026
  58. Multi-Domain Riemannian Graph Gluing for Building Graph Foundation Models

    Li Sun, Zhenhao Huang, Silei Chen +4

    cs.LGarXiv:2603.00618v12026
  59. Steered LLM Activations are Non-Surjective

    Aayush Mishra, Daniel Khashabi, Anqi Liu

    cs.AIcs.LGarXiv:2604.09839v22026
  60. Tunable Soft Equivariance with Guarantees

    Md Ashiqur Rahman, Lim Jun Hao, Jeremiah Jiang +2

    cs.CVcs.LGarXiv:2603.26657v12026