← 上一篇 已在结尾

基于策略的强化学习方法

基于价值的强化学习方法最后无非就是D3QN。而基于策略的方法直接学习策略,并且由于LLM出现,顺带强化学习火了一把,常常被拷打这部分。 因此需要重新整理一下。

信任区域策略优化 TRPO

简介:TRPO(Trust Region Policy Optimization)是一种基于策略的强化学习算法,旨在通过限制每次更新的幅度来提高策略优化的稳定性。TRPO通过引入一个信任区域来确保新策略不会偏离旧策略太远,从而避免过大的性能下降。