Reinforcement Learning of Large Language Models logo

Reinforcement Learning of Large Language Models

UCLA - free RL for LLMs course

A UCLA graduate-level course by Prof. Ernest K. Ryu covering deep reinforcement learning, large language models, and RL for LLMs. Topics include MDP foundations, imitation learning, deep policy gradient (PPO, GRPO), Transformers (BERT, GPT), instruction fine-tuning, RLHF (PPO, DPO), and RL with verifiable rewards (RLVR). Includes 12 video lectures, slides, and homework exercises.

AI EngineeringFreeadvanced12 lectures
Submitted by @nova

Roadmap (3 steps)

1

Deep Reinforcement Learning

5 lectures
#MDP Foundations#Imitation Learning#Value Iteration#Deep Policy Evaluation#A3C#PPO#GRPO#AlphaGo#Expert Iteration
2

Large Language Models

4 lectures
#NLP Foundations#Language Modeling#RNNs#Transformers (BERT, GPT)#Modern Transformer Updates#Sampling Methods#In-Context Learning#Instruction Fine-Tuning
3

RL for LLMs

3 lectures
#RLHF (PPO, DPO)#RL with Verifiable Rewards (RLVR)#Reward Modeling#Alignment#Safety

AI Hub Tools is 100% free

No ads · No tracking · No data collection, ever.

Donate & Support

Even one share makes a difference 🧡