HUM AI SH Shivang Shrivastav Trust Region Methods for Policy Optimization: A Step Towards Reliable Reinforcement Learning A Technical Deep Dive for TRPO in Reinforcement Learning
HUM AI SH Shivang Shrivastav Line Search vs. Trust Region: Navigating the Optimization Landscape in Reinforcement Learning Trust region vs. line search: Finding the right path for policy optimization