课程目录

开篇词 (2讲)

  1. 开篇词|互联网公司故障频发,我们应该如何保障服务持续可靠?
  2. 导学|如何构建坚不可摧的服务可靠性体系?

元旦加餐 (1讲)

  1. 元旦加餐|2024年互联网大厂故障盘点

热点加餐 (2讲)

  1. 微软蓝屏事件:如何应对变更带来的问题?
  2. 网易云音乐故障猜想:如何避免迁移带来的问题?

基础篇 (6讲)

  1. 01|监控:如何从业务视角出发添加监控?
  2. 02| 容量:从业务视角看容量到底是什么?
  3. 03|变更:为什么说变更是可靠性的第一杀手?
  4. 04|预案:预案的三板斧指的是什么?
  5. 05|备份和恢复:可靠性的最后一道防线
  6. 06|可靠性文化和规范:人是万物的尺度

场景篇 (11讲)

  1. 07|监控场景:为什么所有故障都有监控的因素?
  2. 08|容量场景(一):12306为什么现在能扛住春节抢票了?
  3. 09|容量场景(二):一次让网盘雪崩的热点事件
  4. 10|容量场景(三):一条让新浪工程师们通宵加班的微博
  5. 11|变更场景(一):一条让Facebook蒸发百亿的指令
  6. 12|变更场景(二):一次简单升级竟然损失几千万
  7. 13|变更场景(三): 连续绊倒两个云厂商的故障
  8. 14|预案场景(一):B站最为深刻的一次自我剖析
  9. 15|预案场景(二):一次机房故障为何让多位高管被辞退?
  10. 16 |备份和恢复:一次误操作中断7小时
  11. 17 |可靠性意识:可靠性Oncall十大原则

AIOps篇 (8讲)

  1. 18|概述:AIOps涉及哪些领域和方向?
  2. 19|AIOps故障发现:我们如何看到肉眼看不到的故障?
  3. 20|AIOps问题定位:如何在报警风暴中找到暴风眼?
  4. 21|AIOps容量预测:如何准确地预估流量?
  5. 22|AIOps变更管理:如何进行更全面地检查与更精准地阻断?
  6. 23|AIOps智能决策:给故障处理安装一个大脑
  7. 24|AIOps数据可靠性:如何预测磁盘故障
  8. 25|可靠性基础科学:可靠性背后的运筹学和概率学

结束语 (2讲)

  1. 结束语|这里不是终点,而是一个起点
  2. 结课测试|来赴一场满分之约