Roadmap

🎮 Reinforcement Learning Mind Map

38 knowledge points · click a node for its structured card

Same color = same guide topic. Hover a node for its dependency chain. Drag and zoom canvas. Export PNG or go fullscreen from the top-right.

RL TheoryDeep RL AlgorithmsMulti-Armed BanditRL with Verifiable RewardsOffline Distribution ShiftWorld Model LearningEmbodied AI V-JEPA/Diffusion (cross-module)GRPO (cross-module)CoT & Reasoning (cross-module)MDP & Bellman EquationsMDP & Bellman EquationsClick for definition & exam pointsValue vs Policy IterationValue vs Policy IterationClick for definition & exam pointsMC vs TD LearningMC vs TD LearningClick for definition & exam pointsQ-Learning (Off-Policy)Q-Learning (Off-Policy)Click for definition & exam pointsExploration-ExploitationExploration-ExploitationClick for definition & exam pointsPolicy Gradient TheoremPolicy Gradient TheoremClick for definition & exam pointsTRPO → PPO LineageTRPO → PPO LineageClick for definition & exam pointsDQN TrioDQN TrioClick for definition & exam pointsActor-CriticActor-CriticClick for definition & exam pointsPPO Clipped ObjectivePPO Clipped ObjectiveClick for definition & exam pointsSAC Max-EntropySAC Max-EntropyClick for definition & exam pointsMulti-Agent RL (CTDE)Multi-Agent RL (CTDE)Click for definition & exam pointsMulti-Armed BanditMulti-Armed BanditClick for definition & exam pointsUCB1 OptimisticUCB1 OptimisticClick for definition & exam pointsThompson SamplingThompson SamplingClick for definition & exam pointsContextual BanditContextual BanditClick for definition & exam pointsSlate / Combinatorial BanditSlate / Combinatorial BanditClick for definition & exam pointsLong-Term Retention RLLong-Term Retention RLClick for definition & exam pointsRL with Verifiable RewardsRL with Verifiable RewardsClick for definition & exam pointsReward Design & HackingReward Design & HackingClick for definition & exam pointsProcess Reward Model (cross-module)Process Reward Model (cross-module)Click for definition & exam pointsMCTS Planning (cross-module)MCTS Planning (cross-module)Click for definition & exam pointsOffline Distribution ShiftOffline Distribution ShiftClick for definition & exam pointsBehavioral CloningBehavioral CloningClick for definition & exam pointsGAIL & Inverse RLGAIL & Inverse RLClick for definition & exam pointsConservative Q-LearningConservative Q-LearningClick for definition & exam pointsImplicit Q-LearningImplicit Q-LearningClick for definition & exam pointsOffline-to-Online Fine-TuningOffline-to-Online Fine-TuningClick for definition & exam pointsWorld Model LearningWorld Model LearningClick for definition & exam pointsDyna ArchitectureDyna ArchitectureClick for definition & exam pointsModel Predictive ControlModel Predictive ControlClick for definition & exam pointsMuZero Latent ModelMuZero Latent ModelClick for definition & exam pointsDreamer RSSMDreamer RSSMClick for definition & exam pointsModel-Based vs Model-FreeModel-Based vs Model-FreeClick for definition & exam pointsEmbodied AI V-JEPA/Diffusion (cross-module)Embodied AI V-JEPA/Diffusion (cross-module)Click for definition & exam pointsGRPO (cross-module)GRPO (cross-module)Click for definition & exam pointsDPO (cross-module)DPO (cross-module)Click for definition & exam pointsCoT & Reasoning (cross-module)CoT & Reasoning (cross-module)Click for definition & exam points
100%
🖱️ Drag to pan · Hover for dependency chain · Click for card
MDP & Bellman EquationsMulti-Armed BanditRL with Verifiable RewardsOffline Distribution ShiftWorld Model LearningEmbodied AI V-JEPA/Diffusion (cross-module)GRPO (cross-module)CoT & Reasoning (cross-module)