AI HUM DI Dixon Information Gain-Based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM… How dense intrinsic rewards could revolutionize agentic reinforcement learning for large language models.