模型架构与 Scaling
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| How to Scale Your Model | 在线书籍 | 从系统视角讲解 LLM 在 TPU 和 GPU 上的训练与推理扩展,涵盖 Roofline 分析、硬件互连、Transformer 计算与内存、并行策略,以及基于 JAX 的性能分析与编程实践。 | GitHub |
| Awesome-LM-Architecture | 资源合集 | 按核心组件、模型架构、扩展与预训练、模型技术报告整理语言模型架构,涵盖位置编码、归一化、Attention、线性模型、Test-Time Learning、MoE 和 Scaling Laws。 |
预训练
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| Marin | 开源项目 | 公开开发的大模型训练项目与软件平台,覆盖数据整理、转换、过滤、去重、分词、预训练、后训练与评测,并公开代码、数据来源、模型权重以及成功和失败的实验记录。 | 官方网站 · 官方文档 |
| MAI-Thinking-1: Building a Hill-Climbing Machine | 技术报告 | 微软 MAI-Thinking-1 技术报告,涵盖 MoE 架构、Scaling Ladder、预训练数据、长周期 RL、评测以及大规模训练和推理基础设施。 |
分布式训练与容错
Test-Time Training
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| Test-Time Training Done Right | 论文 | 提出 Large Chunk Test-Time Training,通过大块在线更新提升 GPU 利用率和非线性状态容量,并将测试时训练扩展到语言、图像与视频的长上下文任务。 |
