Reward-Weighted Regression with Sample Reuse for Direct Policy Search in 
Reinforcement Learning

Hachiya, H; Peters, J; Sugiyama, M

doi:10.1162/NECO_a_00199

Local TagsRelease HistoryDetailsSummary

Reward-Weighted Regression with Sample Reuse for Direct Policy Search in Reinforcement Learning

Hachiya, H., Peters, J., & Sugiyama, M. (2011). Reward-Weighted Regression with Sample Reuse for Direct Policy Search in Reinforcement Learning. Neural computation, 23(11), 2798-2832. doi:10.1162/NECO_a_00199.

Item is Released

show all hide all

Basic

show hide

Item Permalink: https://hdl.handle.net/11858/00-001M-0000-0013-B90C-2 Version Permalink: https://hdl.handle.net/21.11116/0000-0001-AFCF-2

Genre: Journal Article

Files

show Files

Locators

show

hide

Locator:
https://www.mitpressjournals.org/doi/10.1162/NECO_a_00199 (Publisher version) Open Access status unknown

Description:
-

OA-Status:

Creators

show

hide

Creators:
Hachiya, H, Author
Peters, J^{1, 2}, Author
Sugiyama, M, Author

Affiliations:
1Department Empirical Inference, Max Planck Institute for Biological Cybernetics, Max Planck Society, ou_1497795
2Max Planck Institute for Biological Cybernetics, Max Planck Society, Spemannstrasse 38, 72076 Tübingen, DE, ou_1497794

Content

show

hide

Free keywords: -

Abstract: Direct policy search is a promising reinforcement learning framework, in particular for controlling continuous, high-dimensional systems. Policy search often requires a large number of samples for obtaining a stable policy update estimator, and this is prohibitive when the sampling cost is expensive. In this letter, we extend an expectation-maximization-based policy search method so that previously collected samples can be efficiently reused. The usefulness of the proposed method, reward-weighted regression with sample reuse (R), is demonstrated through robot learning experiments.

Details

show

hide

Language(s):

Dates: Date issued: 2011-11

Publication Status: Issued

Pages: -

Publishing info: -

Table of Contents: -

Rev. Type: -

Identifiers: DOI: 10.1162/NECO_a_00199
BibTex Citekey: HachiyaPS2011

Degree: -

Event

show

Legal Case

show

Project information

show

Source 1

show

hide

Title: Neural computation

Source Genre: Journal

Creator(s):

Affiliations:

Publ. Info: Cambridge, Mass. : MIT Press

Pages: - Volume / Issue: 23 (11) Sequence Number: - Start / End Page: 2798 - 2832 Identifier: ISSN: 0899-7667
CoNE: https://pure.mpg.de/cone/journals/resource/954925561591