Machine Learning

Papers filed under cs.LG on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

18,421 to 18,480 of 20,199

  1. Molecular Graph Convolutions: Moving Beyond Fingerprints

    Steven Kearnes, Kevin McCloskey, Marc Berndl +2

    stat.MLcs.LGarXiv:1603.00856v32016
  2. Reinforcement Learning with Deep Energy-Based Policies

    Tuomas Haarnoja, Haoran Tang, Pieter Abbeel +1

    cs.LGcs.AIarXiv:1702.08165v22017
  3. Efficient Transformers: A Survey

    Yi Tay, Mostafa Dehghani, Dara Bahri +1

    cs.LGcs.AIcs.CLarXiv:2009.06732v32020
  4. Learning to Plan Chemical Syntheses

    Marwin H. S. Segler, Mike Preuss, Mark P. Waller

    cs.AIcs.LGphysics.chem-pharXiv:1708.04202v12017
  5. Jailbreaking Black Box Large Language Models in Twenty Queries

    Patrick Chao, Alexander Robey, Edgar Dobriban +3

    cs.LGcs.AIarXiv:2310.08419v42023
  6. DeepGCNs: Can GCNs Go as Deep as CNNs?

    Guohao Li, Matthias Müller, Ali Thabet +1

    cs.CVcs.LGarXiv:1904.03751v22019
  7. Opening the Black Box of Deep Neural Networks via Information

    Ravid Shwartz-Ziv, Naftali Tishby

    cs.LGarXiv:1703.00810v32017
  8. XNLI: Evaluating Cross-lingual Sentence Representations

    Alexis Conneau, Guillaume Lample, Ruty Rinott +4

    cs.CLcs.AIcs.LGarXiv:1809.05053v12018
  9. AugMix: A Simple Data Processing Method to Improve Robustness and Uncertainty

    Dan Hendrycks, Norman Mu, Ekin D. Cubuk +3

    stat.MLcs.CVcs.LGarXiv:1912.02781v22019
  10. Domain Generalization: A Survey

    Kaiyang Zhou, Ziwei Liu, Yu Qiao +2

    cs.LGcs.AIcs.CVarXiv:2103.02503v72021
  11. Advancing Creative Physical Intelligence in Large Multimodal Models

    Cheng Qian, Hyeonjeong Ha, Jiayu Liu +10

    cs.AIcs.CLcs.LGarXiv:2605.26396v22026
  12. Learning Representations by Maximizing Mutual Information Across Views

    Philip Bachman, R Devon Hjelm, William Buchwalter

    cs.LGstat.MLarXiv:1906.00910v22019
  13. Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution

    Zixin Jessie Chen, Zhuo Chen, Archer Wang +4

    cs.CVcond-mat.stat-mechcs.AIarXiv:2605.26032v12026
  14. AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning

    Yuwei Guo, Ceyuan Yang, Anyi Rao +6

    cs.CVcs.GRcs.LGarXiv:2307.04725v22023
  15. Evidential Deep Learning to Quantify Classification Uncertainty

    Murat Sensoy, Lance Kaplan, Melih Kandemir

    cs.LGstat.MLarXiv:1806.01768v32018
  16. What Can We Learn Privately?

    Shiva Prasad Kasiviswanathan, Homin K. Lee, Kobbi Nissim +2

    cs.LGcs.CCcs.CRarXiv:0803.0924v32008
  17. Masked Autoregressive Flow for Density Estimation

    George Papamakarios, Theo Pavlakou, Iain Murray

    stat.MLcs.LGarXiv:1705.07057v42017
  18. Local Model Poisoning Attacks to Byzantine-Robust Federated Learning

    Minghong Fang, Xiaoyu Cao, Jinyuan Jia +1

    cs.CRcs.DCcs.LGarXiv:1911.11815v42019
  19. A Convergence Theory for Deep Learning via Over-Parameterization

    Zeyuan Allen-Zhu, Yuanzhi Li, Zhao Song

    cs.LGcs.DScs.NEarXiv:1811.03962v52018
  20. RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models

    Xing Cong, Hanlin Tang, Kan Liu +3

    cs.LGarXiv:2605.26632v32026
  21. Rethinking the Value of Network Pruning

    Zhuang Liu, Mingjie Sun, Tinghui Zhou +2

    cs.LGcs.CVstat.MLarXiv:1810.05270v22018
  22. How Can We Know What Language Models Know?

    Zhengbao Jiang, Frank F. Xu, Jun Araki +1

    cs.CLcs.LGarXiv:1911.12543v22019
  23. Octo: An Open-Source Generalist Robot Policy

    Octo Model Team, Dibya Ghosh, Homer Walke +16

    cs.ROcs.LGarXiv:2405.12213v22024
  24. HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face

    Yongliang Shen, Kaitao Song, Xu Tan +3

    cs.CLcs.AIcs.CVarXiv:2303.17580v42023
  25. Contrastive Multiview Coding

    Yonglong Tian, Dilip Krishnan, Phillip Isola

    cs.CVcs.LGarXiv:1906.05849v52019
  26. PRISM: Position-encoded Regressive Inverse Spectral Model for Multilayer Thin-Film Design

    Runtian Wang, Renhao Xue, Baige Chen +1

    cs.LGphysics.opticsarXiv:2605.26502v22026
  27. Deep Convolutional Networks on Graph-Structured Data

    Mikael Henaff, Joan Bruna, Yann LeCun

    cs.LGcs.CVcs.NEarXiv:1506.05163v12015
  28. An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks

    Ian J. Goodfellow, Mehdi Mirza, Da Xiao +2

    stat.MLcs.LGcs.NEarXiv:1312.6211v32013
  29. Which Training Methods for GANs do actually Converge?

    Lars Mescheder, Andreas Geiger, Sebastian Nowozin

    cs.LGcs.AIcs.GTarXiv:1801.04406v42018
  30. DropEdge: Towards Deep Graph Convolutional Networks on Node Classification

    Yu Rong, Wenbing Huang, Tingyang Xu +1

    cs.LGcs.NIstat.MLarXiv:1907.10903v42019
  31. Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

    Yi Jing, Zao Dai, Jinwu Hu +4

    cs.LGcs.AIcs.CLarXiv:2605.27354v12026
  32. Less is More: Early Stopping Rollout for On-Policy Distillation

    Zhou Ziheng, Jiaqi Li, Huacong Tang +2

    cs.LGcs.AIarXiv:2605.27028v12026
  33. Variational Dropout and the Local Reparameterization Trick

    Diederik P. Kingma, Tim Salimans, Max Welling

    stat.MLcs.LGstat.COarXiv:1506.02557v22015
  34. Not only where, But when: Temporal Scheduling for RLVR

    Jinghao Zhang, Ruilin Li, Feng Zhao +1

    cs.LGarXiv:2605.25381v12026
  35. RACE: Large-scale ReAding Comprehension Dataset From Examinations

    Guokun Lai, Qizhe Xie, Hanxiao Liu +2

    cs.CLcs.AIcs.LGarXiv:1704.04683v52017
  36. Recursive Flow Matching

    Jiahe Huang, Sihan Xu, Sharvaree Vadgama +1

    cs.LGcs.AIcs.CVarXiv:2605.26535v12026
  37. Text Summarization with Pretrained Encoders

    Yang Liu, Mirella Lapata

    cs.CLcs.LGarXiv:1908.08345v22019
  38. MobileMoE: Scaling On-Device Mixture of Experts

    Yanbei Chen, Hanxian Huang, Ernie Chang +5

    cs.LGcs.AIcs.CLarXiv:2605.27358v12026
  39. Measuring the Effects of Non-Identical Data Distribution for Federated Visual Classification

    Tzu-Ming Harry Hsu, Hang Qi, Matthew Brown

    cs.LGcs.CVstat.MLarXiv:1909.06335v12019
  40. Balancing Fidelity and Diversity in Diffusion Models via Symmetric Attention Decomposition: Hopfield Perspective

    Hyunmin Cho, Woo Kyoung Han, Kyong Hwan Jin

    cs.LGcs.AIarXiv:2605.27476v12026
  41. JLT: Clean-Latent Prediction in Latent Diffusion Transformers

    Funing Fu, Tenghui Wang, Guanyu Zhou +2

    cs.CVcs.LGarXiv:2605.27102v22026
  42. Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval

    Lee Xiong, Chenyan Xiong, Ye Li +5

    cs.IRcs.CLcs.LGarXiv:2007.00808v22020
  43. GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

    Joshua Ainslie, James Lee-Thorp, Michiel de Jong +3

    cs.CLcs.LGarXiv:2305.13245v32023
  44. Contrastive Learning for Unpaired Image-to-Image Translation

    Taesung Park, Alexei A. Efros, Richard Zhang +1

    cs.CVcs.LGarXiv:2007.15651v32020
  45. CoAtNet: Marrying Convolution and Attention for All Data Sizes

    Zihang Dai, Hanxiao Liu, Quoc V. Le +1

    cs.CVcs.LGarXiv:2106.04803v22021
  46. AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems

    Nicole Koenigstein

    cs.MAcs.AIcs.LGarXiv:2605.27466v12026
  47. How far are we from solving the 2D & 3D Face Alignment problem? (and a dataset of 230,000 3D facial landmarks)

    Adrian Bulat, Georgios Tzimiropoulos

    cs.CVcs.LGarXiv:1703.07332v32017
  48. Cascaded Diffusion Models for High Fidelity Image Generation

    Jonathan Ho, Chitwan Saharia, William Chan +3

    cs.CVcs.AIcs.LGarXiv:2106.15282v32021
  49. Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time

    Mitchell Wortsman, Gabriel Ilharco, Samir Yitzhak Gadre +8

    cs.LGcs.CLcs.CVarXiv:2203.05482v32022
  50. The Roadmap to 6G -- AI Empowered Wireless Networks

    Khaled B. Letaief, Wei Chen, Yuanming Shi +2

    cs.NIcs.LGarXiv:1904.11686v22019
  51. Junction Tree Variational Autoencoder for Molecular Graph Generation

    Wengong Jin, Regina Barzilay, Tommi Jaakkola

    cs.LGcs.NEstat.MLarXiv:1802.04364v42018
  52. M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation

    Jianlv Chen, Shitao Xiao, Peitian Zhang +3

    cs.CLcs.AIcs.LGarXiv:2402.03216v52024
  53. Pre-trained Models for Natural Language Processing: A Survey

    Xipeng Qiu, Tianxiang Sun, Yige Xu +3

    cs.CLcs.LGarXiv:2003.08271v42020
  54. Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms

    Kaiqing Zhang, Zhuoran Yang, Tamer Başar

    cs.LGcs.AIcs.MAarXiv:1911.10635v22019
  55. A simple neural network module for relational reasoning

    Adam Santoro, David Raposo, David G. T. Barrett +4

    cs.CLcs.LGarXiv:1706.01427v12017
  56. word2vec Explained: deriving Mikolov et al.'s negative-sampling word-embedding method

    Yoav Goldberg, Omer Levy

    cs.CLcs.LGstat.MLarXiv:1402.3722v12014
  57. Making Deep Neural Networks Robust to Label Noise: a Loss Correction Approach

    Giorgio Patrini, Alessandro Rozza, Aditya Menon +2

    stat.MLcs.LGarXiv:1609.03683v22016
  58. Wild Patterns: Ten Years After the Rise of Adversarial Machine Learning

    Battista Biggio, Fabio Roli

    cs.CVcs.CRcs.GTarXiv:1712.03141v22017
  59. Understanding intermediate layers using linear classifier probes

    Guillaume Alain, Yoshua Bengio

    stat.MLcs.LGarXiv:1610.01644v42016
  60. Learning Quadrupedal Locomotion over Challenging Terrain

    Joonho Lee, Jemin Hwangbo, Lorenz Wellhausen +2

    cs.ROcs.LGeess.SYarXiv:2010.11251v12020