SORQH

  • 理解Off-policy

    一、Off-policy是什么 Off-policy学习是强化学习中的一种算法,它是通过在一个策略下学习另一个策略进行决策问题。在这种情况下,Agent使用的策略通常称为行为策略,…

    编程 2025-02-01