AIInfraGuide 文章更新日志
记录 AIInfraGuide 知识库的每一次内容更新,方便读者追踪最新变化
本文持续记录 AIInfraGuide 知识库的内容更新,按时间倒序排列,方便大家了解最新动态。
2026-07-09
新增内容
模块四 · 推理优化 第 1、2 章文章上线:
-
文章: 1.1 LLM 推理基础 | 一篇讲透 LLM 推理的底层逻辑:Prefill/Decode 两阶段、KV Cache 显存账本、TTFT/TPOT 等性能指标,以及用 Roofline 解释为什么 Decode 是 Memory Bound
-
文章: 2.1 PagedAttention | 深入 vLLM 的核心技术 PagedAttention:借鉴虚拟内存分页思想,用 Block Table 消除 KV Cache 碎片化,并支持前缀共享与 Copy-on-Write
-
文章: 2.2 Continuous Batching | 深入 Continuous Batching 的原理:Iteration-level Scheduling 让请求随到随拼、完成即退,把 GPU 利用率从三成拉到八成以上
-
文章: 2.3 Prefix Cache 与 RadixAttention | 深入前缀缓存:vLLM 基于 Hash 的自动前缀缓存如何复用共享前缀的 KV 块,SGLang 的 RadixAttention 如何用 Radix Tree 做更高效的前缀共享
-
文章: 2.4 Chunked Prefill 与统一调度 | 深入 Chunked Prefill:把长 Prompt 的 Prefill 切块,消除它对 Decode 请求的干扰;理解 vLLM V1 如何用统一 Token 预算调度器抹平 Prefill/Decode 边界
-
文章: 2.5 Attention 后端与图优化 | 深入 vLLM 的可插拔 Attention 后端(FlashAttention/FlashInfer/FlashMLA/Triton)与图优化:用 CUDA Graph 和 torch.compile 消除 Decode 阶段的 CPU 启动开销
2026-07-07
新增内容
-
文章: 1.1 分布式训练总论:显存账本与五大并行策略全景 | 手算训练显存账本,总览五大并行策略全景与选择原则
-
文章: 1.2 环境搭建与分布式启动 | rank/local_rank/world_size、torchrun 启动与会合机制、NCCL 调试、最小 DDP 脚本
2026-07-06
新增内容
更新了分布式训练部分的教程大纲:
| 章节 | 主要内容 |
|---|---|
| 第 1 章 分布式训练总论 | 为什么需要分布式训练、训练显存账本、五大并行策略全景、环境搭建与 DDP 启动 |
| 第 2 章 集合通信原语 | AllReduce/ReduceScatter/AllGather/All-to-All 语义、Ring 算法、通信量量化分析 |
| 第 3 章 优化器 | SGD/Adam/AdamW 演进、优化器状态显存开销分析、大 Batch 优化器 LAMB/LARS |
| 第 4 章 数据并行 | DataParallel、DistributedDataParallel、FSDP |
| 第 5 章 ZeRO 系列 | ZeRO-1/2/3 切分策略与通信代价、ZeRO-Offload/Infinity 异构内存卸载 |
| 第 6 章 张量并行与序列并行 | Megatron Column/Row Parallel Linear、通信插入位置、序列并行激活显存优化 |
| 第 7 章 流水线并行 | Bubble 问题本质、GPipe、1F1B、Interleaved 调度 |
| 第 8 章 混合精度与显存优化 | FP16/BF16/FP8 混合精度、梯度累积、Activation Checkpointing |
| 第 9 章 长序列训练与上下文并行 | Attention 的 O(s²) 困境、Ring Attention、DeepSpeed-Ulysses、Megatron Context Parallel |
| 第 10 章 MoE 并行 | Router 机制、Expert Parallelism 的 All-to-All 通信、EP×DP×TP×PP 组合与负载均衡 |
| 第 11 章 3D 并行与混合并行策略 | TP×PP×DP×EP×CP 拓扑设计、通信域映射、rank 编排、集群选型 |
2026-06-25
新增内容
-
文章: 6.1 FlashAttention V1详解 | 本文深入剖析 FlashAttention V1 的核心原理与实现细节,理解如何通过 Tiling + Online Softmax 将 Attention 的额外显存占用从 降至 ,同时大幅减少 HBM 访问量,实现无精度损失的加速
-
文章: 6.2 FlashAttention V2详解 | 本本文深入剖析 FlashAttention V2 相比 V1 的核心改进:调换内外循环顺序、优化线程块内的工作分配、减少非矩阵乘运算
2026-06-06
新增内容
- 文章: 5.2 CUDA Online Softmax 实现优化 | 本文从算法推导出发,逐步实现并优化 Online Softmax 的 CUDA Kernel,这也是理解 FlashAttention 的核心前置知识
2026-06-05
新增内容
- 文章: 5.1 CUDA Softmax 朴素实现优化 | 本文从朴素实现出发,逐步引入 Safe Softmax、Block 级并行、Warp Shuffle、向量化访存等优化手段
2026-06-02
新增内容
- 文章: 4.1 CUDA GEMM算子性能优化 |本文从朴素实现出发,逐步Block-Warp-Thread三级Tiling优化、向量化访存、Bank Conflict 消除、双缓冲等优化手段,带你系统掌握 CUDA GEMM 优化的完整方法论
2026-05-18
新增内容
- 文章: 3.1 CUDA Reduce算子优化 | Reduce(规约)是 GPU 编程中最基础、也最能体现并行思维的算子之一。本文从最朴素的实现出发,逐步引入 Warp 级原语、向量化访存、多元素处理等优化手段,每一步都有性能对比和原理解析,帮你真正搞懂”怎么写出快的 Kernel”。
2026-05-16
新增内容
- 模块三 · 分布式训练 新增 第2章:优化器 | 理解 SGD → Momentum → Adam → AdamW 的演进逻辑与内部状态组成,手算优化器显存开销(AdamW 占训练总显存 75%),掌握大 Batch 优化器 LAMB/LARS 的适用场景,为后续 ZeRO 显存优化和混合精度训练打下基础。
结构调整
- 模块三 · 分布式训练 章节重新编号:原第2
7章顺延为第38章,新增第2章”优化器”插入总论与数据并行之间 - 同步更新 AI Infra 学习路线、README 中的模块三章节目录
2026-05-13
新增内容
- 文章: 2.4 同步与原子操作 | 正确的同步机制是编写无 Bug 并行程序的基础。本文详解 CUDA 中的块内同步
__syncthreads()、Warp 级同步、Memory Fence,以及原子操作的使用场景、性能代价与优化技巧,帮助你在保证正确性的前提下写出高性能的并行代码。
2026-05-12
新增内容
- 文章: 2.2 内存访问优化 | 内存访问效率是 CUDA Kernel 性能最大的杠杆。本文深入讲解合并访问(Coalesced Access)的原理与判定方法、共享内存 Bank Conflict 的成因与 Padding 解决方案,以及向量化加载(float4/int4)提升带宽利用率的实战技巧。
- 文章: 2.3 Occupancy 与资源分配 | Occupancy 衡量 SM 上实际活跃 Warp 数与理论最大值的比例,是调优 CUDA Kernel 的核心指标之一。本文讲解 Occupancy 的定义、计算方法、三大限制因素(寄存器/共享内存/Block 大小),以及为什么 Occupancy 并非越高越好——真正的目标是在延迟隐藏与资源利用之间找到平衡点。
2026-05-11
新增内容
- 文章: 2.1 Warp 与执行模型 | 深入理解 GPU 最核心的执行单元——Warp
2026-05-09
新增内容
- 文章: CUDA 内存模型 | 本文详解全局内存、共享内存、寄存器、常量内存和统一内存的特性、适用场景及优化技巧
- 文章: 第一个实用 Kernel:向量加法 | 通过一个完整的向量加法案例,走通 CUDA 编程的全流程
2026-05-08
新增内容
- 文章: 1.1 CUDA 开发环境搭建
- 文章: 1.2 CUDA 编程模型
2026-05-07
新增内容
- 文章: ✅ CUDA编程快速入门指南 🔥
2026-04-28
新增内容
2026-04-27
新增内容
2026-04-26
新增内容
2026-04-25
新增内容
- 文章: 🔥 PyTorch框架快速入门篇
2026-04-24
新增内容
2026-04-23
新增内容
2026-04-21
新增内容
2026-04-20
新增内容
2026-04-18
新增内容
2026-04-17
新增内容
- 面试专区:共收录 180+ 场面试真题,覆盖 40+ 家公司,按梯队分类组织。在线浏览 →
- 涵盖公司包括字节跳动、阿里巴巴、腾讯、百度、快手、美团、蚂蚁、英伟达、MiniMax、蔚来、小鹏、理想等。
- 社区入口:新增wx交流群,欢迎大家加入讨论
内容优化
- 更新 README,补充项目介绍图片
2026-04-16
重大更新
- 知识库框架全面升级:细化四大学习模块,调整页面布局结构
- 模块一 · 前置知识(6 章):编程语言基础、数学基础、Transformer 架构详解、PyTorch 框架、GPU 硬件概论、集合通信基础
- 模块二 · CUDA 编程与算子优化(8 章):CUDA 入门、性能优化基础、Reduce 实战、GEMM 实战、Softmax 实战、Attention 算子、AI 编译器、性能分析工具链
- 模块三 · 分布式训练(7 章):分布式训练总论、数据并行、ZeRO 系列、张量并行与序列并行、流水线并行、3D 并行与混合训练策略、训练框架实战
- 模块四 · 推理优化(8 章):推理基础、推理引擎核心技术、推理框架、量化、Speculative Decoding、PD 解耦架构、性能分析与 Benchmark、选型与端到端实战
新增内容
- Transformer 系列文章:
- 课程资料:150+ 篇详细子文章上线,覆盖四大模块全部章节
- 博客文章:新增「关于作者」介绍页
2026-04-15
项目上线
- AIInfraGuide 知识库正式上线
- 发布 [AI Infra 学习路线](/AIInfraGuide/guides/AI Infra学习路线)总览
- 发布「从零理解 AI Infra」入门指引
2026-04-14
项目初始化
- 完成网站框架搭建(基于 Astro + Starlight)
- 初始化项目仓库,发布首次 commit