| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| How to Scale Your Model | 在线书籍 | 从系统视角讲解 LLM 在 TPU 和 GPU 上的训练与推理扩展,涵盖 Roofline 分析、硬件互连、Transformer 计算与内存、并行策略,以及基于 JAX 的性能分析与编程实践。 | GitHub |
| AI Systems Performance Engineering | 书籍 | 逐步讲解 GPU CUDA Kernel 调优、基于 PyTorch 的算法优化以及多节点训练与推理系统的优化方法。同时涵盖 GPU 集群扩展、分布式模型训练和推理服务的性能调优。书末附 175+ 项经过验证的实战优化清单。 | GitHub |
| Build a Large Language Model (From Scratch) | 书籍 | 从零规划并编写 LLM 的各个组件,涵盖数据集准备、文本分类微调、基于人类反馈的指令对齐,以及加载预训练权重等完整流程。 | GitHub |
| nanoGPT | 实践项目 | 精简的 PyTorch GPT 训练与微调实现,可从字符级 toy GPT 入门,并进一步复现 GPT-2 124M。项目已停止维护,作者推荐使用后续项目 nanochat。 | nanochat · 配套视频 |
