课程目录
开篇词 (1讲)
- 开篇词|让我们带你游览强化学习的游乐园
基础篇 (5讲)
- 01|强化学习概述:从马尔可夫决策过程到智能体与环境交互
- 02|基于价值的强化学习:从Q-learning到Deep Q-Network
- 03|基于策略的强化学习:从策略梯度到Actor-Critic
- 04|模型与规划:从动态规划到蒙特卡洛树搜索
- 05|探索与利用:从多臂赌博机到汤普森采样
进阶篇 (13讲)
- 06|深度强化学习:从DQN到A3C
- 07|基础策略梯度法:Policy Gradient
- 08|优势函数:涵盖Actor Critic_GAE_TRPO
- 09|重要性采样:On-policy vs. Off-policy
- 10|TRPO精读:涵盖自然梯度法、全变分约束以及最终导向PPO
- 11|TRPO的大语言模型时代扩展:PPO、DPO、GRPO(上)
- 12|TRPO的大语言模型时代扩展:PPO、DPO、GRPO(下)
- 13|大语言模型时代的RL工作流:以RLHF为代表的后训练方法
- 14|强化学习前沿:从模仿学习到逆向强化学习
- 15|强化学习前沿:从离散控制到连续控制
- 16|强化学习前沿:离线强化学习
- 17|强化学习前沿:离线强化学习之BCQ
- 18|强化学习前沿:离线强化学习之CQL
应用篇 (13讲)
- 19|推荐系统:从个性化推荐到广告投放(上)
- 20|推荐系统:从个性化推荐到广告投放(下)
- 21|机器人控制:从机械臂到自动驾驶(上)
- 22|机器人控制:从机械臂到自动驾驶(中)
- 23|机器人控制:从机械臂到自动驾驶(下)
- 24|金融交易:从股票交易到投资组合优化(上)
- 25|金融交易:从股票交易到投资组合优化(下)
- 26|资源调度:从云计算到物流配送
- 27|自然语言处理:从机器翻译到对话系统(上)
- 28|自然语言处理:从机器翻译到对话系统(下)
- 29|计算机视觉:从目标检测到图像生成
- 30|强化学习平台与工具:从OpenAI Gym到Ray
- 31|强化学习未来展望:从通用人工智能到人机协作
结束语 & 结课测试 (2讲)
- 结束语|共赴强化学习的未来征程
- 结课测试|来赴一场满分之约!





