企业级大模型落地二:基于K8s、VLLM、LiteLLM、vGPU落地高可用AI网关和大模型
课程详情
课程标题
企业级大模型落地二:基于K8s、VLLM、LiteLLM、vGPU落地高可用AI网关和大模型适合人群
- 想要基于K8s落地vGPU、VLLM和LiteLLM的
- 想要实现私有化大模型从零落地的
- 想要落地高可用AI基础设施的
你将会学到
- 基于K8s、vGPU、vLLM、LiteLLM落地企业级高可用AI网关和大模型
- 落地高可用AI网关LiteLLM
- K8s落地vGPU调度
- LiteLLM限流和缓存
- vLLM部署大模型
- 基于K8s落地AI大模型
课程简介
课程包含:- K8s 云原生 AI 基础设施与 GPU 管理基础:
- K8s 管理 GPU 和大模型的核心优势与必要性分析
- K8s Device Plugin 机制与 GPU 资源调度技术架构详解
- NVIDIA GPU Operator 自动化运维工具介绍
- Linux 服务器 GPU 驱动安装
- K8s 集群部署流程与环境准备
- GPU Operator 一键部署与集群 GPU 能力注入
- K8s 动态存储 Longhorn 部署与持久化数据管理
- vLLM 推理引擎与 LiteLLM 高可用网关架构实战:
- K8s 环境下大模型权重文件的预下载
- vLLM 高性能推理引擎在 K8s 中的容器化部署
- 企业级 LiteLLM 高可用架构设计与规划
- K8s 高可用 Redis 哨兵模式部署
- K8s 高可用 PostgreSQL 数据库部署
- LiteLLM AI 网关的多副本高可用落地实战
- LiteLLM 接口连通性测试与功能验证
- 基于 RPM/TPM 的精细化流量控制与限流策略配置
- LiteLLM 缓存功能验证
- K8s GPU 虚拟化 HAMi 平台与高密度部署进阶:
- K8s GPU 虚拟化调度平台 HAMi 核心原理介绍
- 基于 HAMi 实现物理 GPU 资源的切分与虚拟化配置
- K8s vGPU 调度机制测试与资源隔离验证
- 基于显存大小的精细化 vGPU 调度策略
- 指定显卡型号的定向调度实战
- vLLM 推理引擎结合 vGPU 虚拟化部署
注意
本课程需要学习第一阶段的课程《企业级大模型落地一:基于VLLM和LiteLLM落地私有化大模型》。课程目录
01 课程介绍 01 课程介绍.mp4 02 K8s环境准备 01 为什么要使用K8s管理GPU和大模型.mp4 02 K8s管理GPU资源技术架构.mp4 03 K8s GPU Operator介绍.mp4 04 GPU服务器环境准备.mp4 05 GPU服务器驱动安装.mp4 06 K8s集群部署.mp4 07 K8s GPU Operator部署.mp4 08 K8s部署动态存储Longhorn.mp4 03 基于K8s落地大模型和AI网关 01 基于K8s的vLLM部署模型方式.mp4 02 基于K8s模型文件预下载方式.mp4 03 基于K8s和vLLM部署大模型.mp4 04 基于K8s的高可用LiteLLM部署架构介绍.mp4 05 基于K8s部署高可用Redis哨兵模式.mp4 06 基于K8s部署高可用Postgres.mp4 07 基于K8s部署高可用AI网关Litellm.mp4 08 AI网关Litellm测试.mp4 09 AI网关Litellm RPM TPM限流.mp4 10 AI网关Litellm缓存功能测试.mp4 04 基于K8s实现GPU虚拟化vGPU 01 K8s GPU虚拟化调度平台HAMi介绍.mp4 02 K8s部署HAMi实现GPU虚拟化.mp4 03 K8s vGPU虚拟化调度测试.mp4 04 K8s vGPU虚拟化指定显存调度.mp4 05 K8s vGPU指定显卡类型调度GPU.mp4 06 K8s使用vLLM+vGPU部署模型.mp4





