← Roadmap 🎮 Reinforcement Learning Mind Map 38 knowledge points · click a node for its structured card Same color = same guide topic. Hover a node for its dependency chain. Drag and zoom canvas. Export PNG or go fullscreen from the top-right.
RL Theory Deep RL Algorithms Multi-Armed Bandit RL with Verifiable Rewards Offline Distribution Shift World Model Learning Embodied AI V-JEPA/Diffusio n (cross-module) GRPO (cross-module) CoT & Reasoning (cross-modul e) MDP & Bellman Equations MDP & Bellman Equations Click for definition & exam points Value vs Policy Iteration Value vs Policy Iteration Click for definition & exam points MC vs TD Learning MC vs TD Learning Click for definition & exam points Q-Learning (Off-Policy) Q-Learning (Off-Policy) Click for definition & exam points Exploration-Exploitation Exploration-Exploitation Click for definition & exam points Policy Gradient Theorem Policy Gradient Theorem Click for definition & exam points TRPO → PPO Lineage TRPO → PPO Lineage Click for definition & exam points DQN Trio DQN Trio Click for definition & exam points Actor-Critic Actor-Critic Click for definition & exam points PPO Clipped Objective PPO Clipped Objective Click for definition & exam points SAC Max-Entropy SAC Max-Entropy Click for definition & exam points Multi-Agent RL (CTDE) Multi-Agent RL (CTDE) Click for definition & exam points Multi-Armed Bandit Multi-Armed Bandit Click for definition & exam points UCB1 Optimistic UCB1 Optimistic Click for definition & exam points Thompson Sampling Thompson Sampling Click for definition & exam points Contextual Bandit Contextual Bandit Click for definition & exam points Slate / Combinatorial Bandit Slate / Combinatorial Bandit Click for definition & exam points Long-Term Retention RL Long-Term Retention RL Click for definition & exam points RL with Verifiable Rewards RL with Verifiable Rewards Click for definition & exam points Reward Design & Hacking Reward Design & Hacking Click for definition & exam points Process Reward Model (cross-module) Process Reward Model (cross-m odule) Click for definition & exam points MCTS Planning (cross-module) MCTS Planning (cross-module) Click for definition & exam points Offline Distribution Shift Offline Distribution Shift Click for definition & exam points Behavioral Cloning Behavioral Cloning Click for definition & exam points GAIL & Inverse RL GAIL & Inverse RL Click for definition & exam points Conservative Q-Learning Conservative Q-Learning Click for definition & exam points Implicit Q-Learning Implicit Q-Learning Click for definition & exam points Offline-to-Online Fine-Tuning Offline-to-Online Fine-Tunin g Click for definition & exam points World Model Learning World Model Learning Click for definition & exam points Dyna Architecture Dyna Architecture Click for definition & exam points Model Predictive Control Model Predictive Control Click for definition & exam points MuZero Latent Model MuZero Latent Model Click for definition & exam points Dreamer RSSM Dreamer RSSM Click for definition & exam points Model-Based vs Model-Free Model-Based vs Model-Free Click for definition & exam points Embodied AI V-JEPA/Diffusion (cross-module) Embodied AI V-JEPA/Diffusion (cross-module) Click for definition & exam points GRPO (cross-module) GRPO (cross-module) Click for definition & exam points DPO (cross-module) DPO (cross-module) Click for definition & exam points CoT & Reasoning (cross-module) CoT & Reasoning (cross-module ) Click for definition & exam points 🖱️ Drag to pan · Hover for dependency chain · Click for card
MDP & Bellman Equations Multi-Armed Bandit RL with Verifiable Rewards Offline Distribution Shift World Model Learning Embodied AI V-JEPA/Diffusion (cross-module) GRPO (cross-module) CoT & Reasoning (cross-module)