Source-linked AI summary

Stein Variational Policy Gradient

Yang Liu, Prajit Ramachandran, Qiang Liu, Jian Peng

arXiv:1704.02399v1cs.LG

TL;DR

Policy gradient methods are limited by high variance, slow convergence, and inefficient exploration. The paper introduces an entropy-regularized Bayesian formulation and SVPG, which combines existing policy gradients with repulsion to maintain diverse policies. On continuous control tasks, SVPG improves return and data efficiency and is more robust to initialization.

  • Problem

    Policy gradient methods face high variance, slow convergence, and inefficient exploration, limiting their applicability to difficult reinforcement learning tasks.

  • Method

    SVPG optimizes an entropy-regularized distribution of policy parameters through Bayesian inference and Stein variational updates, combining policy gradients with repulsion across policies.

  • Results

    SVPG improves average return and data efficiency over existing policy-gradient methods on continuous control tasks, with stronger best returns and faster attainment of 95% return than Joint and Independent versions.

  • Takeaways & Limitations

    SVPG provides a generic, parallelizable approach for adding parameter exploration and diverse policies to existing policy optimization methods.

  • Takeaways & Limitations

    The method's kernel choice may be critical in high-dimensional reinforcement learning, and its fixed α leaves the exploration–exploitation trade-off for future study.

Abstract

from arXiv · show

Policy gradient methods have been successfully applied to many complex reinforcement learning problems. However, policy gradient methods suffer from high variance, slow convergence, and inefficient exploration. In this work, we introduce a maximum entropy policy optimization framework which explicitly encourages parameter exploration, and show that this framework can be reduced to a Bayesian inference problem. We then propose a novel Stein variational policy gradient method (SVPG) which combines existing policy gradient methods and a repulsive functional to generate a set of diverse but well-behaved policies. SVPG is robust to initialization and can easily be implemented in a parallel manner. On continuous control problems, we find that implementing SVPG on top of REINFORCE and advantage actor-critic algorithms improves both average return and data efficiency.

1 Introduction

Policy gradient methods address complex reinforcement learning problems but face high variance, slow convergence, and insufficient exploration. SVPG models a distribution of policies to combine exploration with exploitation, improving return and data efficiency on continuous control tasks.

  • 1 Introduction: Policy gradient methods have shown strong results on complex reinforcement learning problems, but high variance, slow convergence, and insufficient exploration limit their applicability to hard real-world tasks.
  • 1 Introduction: SVPG models a distribution of policy parameters rather than a single policy, enabling simultaneous exploitation and exploration across multiple policies.The framework uses entropy regularization to encourage parameter-space exploration and connects the optimization problem to Bayesian inference.
  • 1 Introduction: SVPG applied to REINFORCE and advantage actor-critic improves average return and data efficiency on continuous control problems while remaining more robust to initialization.

2 Preliminaries

The preliminaries define reinforcement learning as optimizing expected cumulative reward through a parameterized policy and review policy-gradient estimators. They cover finite-difference and likelihood-ratio methods, including variance reduction with baselines and advantage actor-critic.

  • 2 Preliminaries: Reinforcement learning seeks a policy that chooses actions from states to maximize expected cumulative rewards under environmental dynamics.
  • 2 Preliminaries: Policy-based methods parameterize a policy by θ and iteratively update θ to optimize the utility function J(θ).
  • 2 Preliminaries: Finite-difference methods approximate policy gradients using random perturbations, including rollout-efficient approaches that estimate all parameter gradients simultaneously.
  • 2 Preliminaries: Likelihood-ratio methods such as REINFORCE estimate policy gradients from rollout samples using the likelihood-ratio trick and accumulated returns.The resulting gradient estimate is described as unbiased.
  • 2 Preliminaries: Using a baseline preserves unbiasedness while reducing variance; choosing the value function yields an advantage estimate and the advantage actor-critic method.

3 Stein Variational Policy Gradient

The framework optimizes a distribution over policy parameters with entropy-based exploration and recasts it as Bayesian inference. SVPG then uses Stein variational updates and policy-gradient estimates to maintain diverse policy particles while improving return.

  • 3.1 Maximum Entropy Policy Optimization: The maximum-entropy formulation optimizes a distribution q(θ) over policy parameters rather than a single policy, with KL regularization toward a prior q0.With an uninformative prior, the KL term becomes entropy and explicitly encourages exploration in parameter space.
  • 3.1 Maximum Entropy Policy Optimization: The resulting parameter distribution has a Bayesian interpretation: q(θ) is the posterior, exp(J(θ)/α) the likelihood, q0(θ) the prior, and α controls exploration strength.As α approaches zero, samples concentrate around global optima of expected return.
  • 3.2 Stein Variational Gradient Descent: Each Stein update combines a policy-gradient term that attracts particles toward high-probability regions with a kernel-gradient term that repels them and diversifies policies.Without the repulsive term, particles can collapse to local modes and reduce to ordinary MAP gradient ascent.
  • 3.2 Stein Variational Gradient Descent: SVPG applies Stein variational gradient descent to policy-parameter inference, using existing policy-gradient estimates to update multiple policy particles.The method is designed for simultaneous exploitation and exploration of multiple policies.
  • 3.2 Stein Variational Gradient Descent: The temperature α trades off exploitation and exploration, while α approaching zero makes SVPG resemble independently initialized policy-gradient runs.The algorithm is presented as a simple extension that can be applied on top of existing policy-gradient methods.

4 Related Work

Related work covers policy-gradient optimization, exploration incentives, intrinsic motivation, and parallel experience collection. The supplied experimental materials emphasize learning curves, state-visitation diversity, and best-return/sample-efficiency comparisons.

  • Policy-gradient methods: Policy-gradient research includes trust-region optimization and asynchronous actor-critic methods, which motivate extensions for difficult deep reinforcement-learning environments.A3C trains actor-critic agents asynchronously in parallel.
  • Exploration methods: Exploration has been encouraged through entropy penalties, importance sampling of under-appreciated rewards, intrinsic rewards, and curiosity-driven novelty bonuses.These approaches target smoother action policies, rare rewards, or novel states through different mechanisms.
  • Parallel experience collection: Parallel-agent approaches collect experience using actors with asynchronous parameter differences or varied exploration hyperparameters.The cited examples include GORILA and parallel agents using different ε-greedy settings.
  • Experimental comparisons: Figure 1 compares training iteration against average return, with equal samples per iteration making the horizontal axis proportional to total training samples.The learning curves therefore support comparisons of both return and sample use.
  • Experimental comparisons: Figure 2 contrasts state-visitation landscapes for the best four SVPG and Independent policies after projecting 4D states into 2D with t-SNE.Parenthesized values report each policy’s average return.

5 Experiments

Experiments evaluate SVPG on REINFORCE and A2C across continuous-control tasks, focusing on convergence, data efficiency, policy quality and diversity, and exploration–exploitation balance. SVPG generally improves convergence and policy quality while producing diverse policies, with intermediate temperature performing best.

  • 5.2 Convergence and Data Efficiency: SVPG converges faster than corresponding baselines on Cartpole Swing-Up, while its variance remains close to Independent and below Joint versions.On easier tasks, nearly all algorithms solve the problems in around 20 iterations; SVPG's convergence advantage is most substantial on challenging tasks.
  • 5.3 SVPG learns strong, diverse policies: SVPG outperforms Joint and Independent versions in both best test returns and episodes needed to reach 95% of the best return.These measures jointly assess policy quality and how quickly policies approach their own best performance.
  • 5.3 SVPG learns strong, diverse policies: SVPG produces many good policies, whereas Independent training yields satisfactory performance mainly among its top policies.Average returns are computed from 50,000 test transitions and averaged across five training random seeds.
  • 5.3 SVPG learns strong, diverse policies: SVPG policies have different state-visitation landscapes, while several Independent policies are similar and far from the best average return.The authors caution that the two-dimensional projection may introduce visualization artifacts.
  • 5.4 Exploration and Exploitation: An intermediate temperature α = 10 balances exploration and exploitation and outperforms other temperatures for both actor-critic and REINFORCE.Very high temperatures overemphasize repulsion, whereas α →0 makes the method resemble independent policy training.

6 Conclusion

The paper introduces a maximum-entropy framework and SVPG for simultaneous exploration and exploitation across multiple policies. Experiments find improved performance and robustness, while future work targets broader domains, kernel choices, temperature adaptation, and additional policy-optimization methods.

  • 6 Conclusion: SVPG combines entropy-regularized policy-parameter distributions with Stein variational updates to improve existing policy-gradient methods.The framework explicitly encourages parameter-space exploration and supports simultaneous exploitation and exploration of multiple policies.
  • 6 Conclusion: SVPG improves REINFORCE and A2C on several continuous-control tasks and generates robust, diverse policies.The conclusion attributes these results to the method's simplicity and reports parallel implementation as attractive for distributed systems.
  • 6 Conclusion: Future work includes evaluating other reinforcement-learning domains, studying kernels and temperature annealing, and extending SVPG to natural or trust-region policy gradients.The paper specifically notes that kernel choices may be critical in high-dimensional reinforcement learning.
Loading 1704.02399v1…