时间表
| 章节 | 日期 | 主讲 | 状态 |
|---|---|---|---|
| 第一章:介绍与 AI 系统概览 | 2026-04-19 | 程治玮 | 已完成 |
| 第二章:AI 系统硬件概览 | 2026-05-24 | 于增辉 | 已完成 |
| 第三章:GPU 环境下的 OS、Docker 与 Kubernetes 调优 | 2026-07-12 | 程治玮 | 已完成 |
| 第四章:分布式网络通信调优 | 2026-06-28 | 费翌阳 | 已完成 |
| 第五章:基于 GPU 的存储 I/O 优化 | TBD | 黄健峰 | 未开始 |
| 第六章:GPU 架构、CUDA 编程与最大化占用率 | TBD | TBD | 未开始 |
| 第七章:GPU 内存访问模式的分析与调优 | TBD | TBD | 未开始 |
| 第八章:占用率调优、Warp 效率与指令级并行 | TBD | TBD | 未开始 |
| 第九章:提升 CUDA Kernel 效率与算术强度 | TBD | TBD | 未开始 |
| 第十章:Kernel 内流水线、Warp 特化与协作线程块集群 | TBD | TBD | 未开始 |
| 第十一章:Kernel 间流水线、同步与 CUDA 流有序内存分配 | TBD | TBD | 未开始 |
| 第十二章:动态调度、CUDA Graphs 与设备发起的 Kernel 编排 | TBD | TBD | 未开始 |
| 第十三章:PyTorch 的分析、调优与扩展 | TBD | TBD | 未开始 |
| 第十四章:PyTorch 编译器、OpenAI Triton 与 XLA 后端 | TBD | TBD | 未开始 |
| 第十五章:多节点推理、并行、解码与路由优化 | 2026-08-09 | 张文正 | 已完成 |
| 第十六章:大规模推理的分析、调试与调优 | TBD | TBD | 未开始 |
| 第十七章:推理中分离式 Prefill 与 Decode 的扩展 | TBD | TBD | 未开始 |
| 第十八章:高级 Prefill-Decode 与 KV Cache 调优 | TBD | TBD | 未开始 |
| 第十九章:动态与自适应推理引擎优化 | TBD | TBD | 未开始 |
| 第二十章:AI 辅助性能优化与百万级 GPU 集群扩展 | TBD | TBD | 未开始 |
阅读安排
- 原则上每章安排 2~3 周准备时间,具体以实际排期为准
- 每章安排一次线上分享:一人带读约 40 分钟 + 20 分钟自由讨论
