Reinforcement Learning of Large Language Models
UCLA - free RL for LLMs course
A UCLA graduate-level course by Prof. Ernest K. Ryu covering deep reinforcement learning, large language models, and RL for LLMs. Topics include MDP foundations, imitation learning, deep policy gradient (PPO, GRPO), Transformers (BERT, GPT), instruction fine-tuning, RLHF (PPO, DPO), and RL with verifiable rewards (RLVR). Includes 12 video lectures, slides, and homework exercises.
AI EngineeringFreeadvanced12 lectures
Submitted by @novaRoadmap (3 steps)
1
Deep Reinforcement Learning
5 lectures#MDP Foundations#Imitation Learning#Value Iteration#Deep Policy Evaluation#A3C#PPO#GRPO#AlphaGo#Expert Iteration
2
Large Language Models
4 lectures#NLP Foundations#Language Modeling#RNNs#Transformers (BERT, GPT)#Modern Transformer Updates#Sampling Methods#In-Context Learning#Instruction Fine-Tuning
3
RL for LLMs
3 lectures#RLHF (PPO, DPO)#RL with Verifiable Rewards (RLVR)#Reward Modeling#Alignment#Safety
