体系化学习
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| 深入理解 AI Infra:量化分析与系统设计 | 开源书稿 | 李博杰编写的 AI Infra 系统书稿,从计算、存储、通信和依赖约束出发量化推导系统设计,覆盖模型架构、加速器、算子与运行时、超节点、数据中心网络、推理优化、分布式推理、训练系统、资源调度与端边云协同。 | 在线阅读 · PDF · 配套实验 · 计算工具 |
| AI Systems Performance Engineering | 书籍 | 讲解 GPU CUDA Kernel 调优、PyTorch 算法优化、多节点训练和推理系统优化,并附有 175 多项实战优化清单。 | GitHub |
| How to Scale Your Model | 在线书籍 | 涵盖 Roofline 分析、硬件互连、Transformer 计算与内存、并行策略,以及训练和推理的性能分析。 | GitHub |
| CSCI 1390, Spring 2025: Systems for Machine Learning | 课程 | 主题包括高效训练和推理、ML 算法性能、GPU 编程、CUDA 和 Transformer 架构。 |
训练性能
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| Stanford CS336 Assignment 2: Systems | 实践课程 | 围绕 Transformer 训练系统实践性能基准测试、分析与优化,并实现分布式训练。整体计算资源要求不高,强烈推荐完整完成。 |
高速互联与通信
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| RDMA-aware Networks Programming Guide | 官方文档(归档) | NVIDIA DOCA 3.4.0 归档版 RDMA 编程指南,覆盖 InfiniBand、RoCE、RDMA Verbs、Queue Pair、Memory Region、Completion Queue、传输模式与 RDMA Read、Write、Atomic 操作,并提供 RC 和 Multicast UD 示例。 | rdma-core |
Profiling 工具
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| PyTorch Profiling with NVIDIA Nsight | 教程 | 详细讲解 Nsight Systems 和 Nsight Compute 的分工、报告采集、CLI 与 UI 分析、NVTX 标记、时间线解读,以及 PyTorch 常见性能瓶颈的诊断与优化。 |
