跳到主要内容
#公告 #更新日志

AIInfraGuide 文章更新日志

记录 AIInfraGuide 知识库的每一次内容更新,方便读者追踪最新变化

本文持续记录 AIInfraGuide 知识库的内容更新,按时间倒序排列,方便大家了解最新动态。


2026-07-09

新增内容

模块四 · 推理优化 第 1、2 章文章上线:

  • 文章: 1.1 LLM 推理基础 | 一篇讲透 LLM 推理的底层逻辑:Prefill/Decode 两阶段、KV Cache 显存账本、TTFT/TPOT 等性能指标,以及用 Roofline 解释为什么 Decode 是 Memory Bound

  • 文章: 2.1 PagedAttention | 深入 vLLM 的核心技术 PagedAttention:借鉴虚拟内存分页思想,用 Block Table 消除 KV Cache 碎片化,并支持前缀共享与 Copy-on-Write

  • 文章: 2.2 Continuous Batching | 深入 Continuous Batching 的原理:Iteration-level Scheduling 让请求随到随拼、完成即退,把 GPU 利用率从三成拉到八成以上

  • 文章: 2.3 Prefix Cache 与 RadixAttention | 深入前缀缓存:vLLM 基于 Hash 的自动前缀缓存如何复用共享前缀的 KV 块,SGLang 的 RadixAttention 如何用 Radix Tree 做更高效的前缀共享

  • 文章: 2.4 Chunked Prefill 与统一调度 | 深入 Chunked Prefill:把长 Prompt 的 Prefill 切块,消除它对 Decode 请求的干扰;理解 vLLM V1 如何用统一 Token 预算调度器抹平 Prefill/Decode 边界

  • 文章: 2.5 Attention 后端与图优化 | 深入 vLLM 的可插拔 Attention 后端(FlashAttention/FlashInfer/FlashMLA/Triton)与图优化:用 CUDA Graph 和 torch.compile 消除 Decode 阶段的 CPU 启动开销


2026-07-07

新增内容


2026-07-06

新增内容

更新了分布式训练部分的教程大纲:

章节主要内容
第 1 章 分布式训练总论为什么需要分布式训练、训练显存账本、五大并行策略全景、环境搭建与 DDP 启动
第 2 章 集合通信原语AllReduce/ReduceScatter/AllGather/All-to-All 语义、Ring 算法、通信量量化分析
第 3 章 优化器SGD/Adam/AdamW 演进、优化器状态显存开销分析、大 Batch 优化器 LAMB/LARS
第 4 章 数据并行DataParallel、DistributedDataParallel、FSDP
第 5 章 ZeRO 系列ZeRO-1/2/3 切分策略与通信代价、ZeRO-Offload/Infinity 异构内存卸载
第 6 章 张量并行与序列并行Megatron Column/Row Parallel Linear、通信插入位置、序列并行激活显存优化
第 7 章 流水线并行Bubble 问题本质、GPipe、1F1B、Interleaved 调度
第 8 章 混合精度与显存优化FP16/BF16/FP8 混合精度、梯度累积、Activation Checkpointing
第 9 章 长序列训练与上下文并行Attention 的 O(s²) 困境、Ring Attention、DeepSpeed-Ulysses、Megatron Context Parallel
第 10 章 MoE 并行Router 机制、Expert Parallelism 的 All-to-All 通信、EP×DP×TP×PP 组合与负载均衡
第 11 章 3D 并行与混合并行策略TP×PP×DP×EP×CP 拓扑设计、通信域映射、rank 编排、集群选型

2026-06-25

新增内容

  • 文章: 6.1 FlashAttention V1详解 | 本文深入剖析 FlashAttention V1 的核心原理与实现细节,理解如何通过 Tiling + Online Softmax 将 Attention 的额外显存占用从 O(N2)O(N^2) 降至 O(N)O(N),同时大幅减少 HBM 访问量,实现无精度损失的加速

  • 文章: 6.2 FlashAttention V2详解 | 本本文深入剖析 FlashAttention V2 相比 V1 的核心改进:调换内外循环顺序、优化线程块内的工作分配、减少非矩阵乘运算


2026-06-06

新增内容

  • 文章: 5.2 CUDA Online Softmax 实现优化 | 本文从算法推导出发,逐步实现并优化 Online Softmax 的 CUDA Kernel,这也是理解 FlashAttention 的核心前置知识

2026-06-05

新增内容


2026-06-02

新增内容

  • 文章: 4.1 CUDA GEMM算子性能优化 |本文从朴素实现出发,逐步Block-Warp-Thread三级Tiling优化、向量化访存、Bank Conflict 消除、双缓冲等优化手段,带你系统掌握 CUDA GEMM 优化的完整方法论

2026-05-18

新增内容

  • 文章: 3.1 CUDA Reduce算子优化 | Reduce(规约)是 GPU 编程中最基础、也最能体现并行思维的算子之一。本文从最朴素的实现出发,逐步引入 Warp 级原语、向量化访存、多元素处理等优化手段,每一步都有性能对比和原理解析,帮你真正搞懂”怎么写出快的 Kernel”。

2026-05-16

新增内容

  • 模块三 · 分布式训练 新增 第2章:优化器 | 理解 SGD → Momentum → Adam → AdamW 的演进逻辑与内部状态组成,手算优化器显存开销(AdamW 占训练总显存 75%),掌握大 Batch 优化器 LAMB/LARS 的适用场景,为后续 ZeRO 显存优化和混合精度训练打下基础。

结构调整

  • 模块三 · 分布式训练 章节重新编号:原第27章顺延为第38章,新增第2章”优化器”插入总论与数据并行之间
  • 同步更新 AI Infra 学习路线、README 中的模块三章节目录

2026-05-13

新增内容

  • 文章: 2.4 同步与原子操作 | 正确的同步机制是编写无 Bug 并行程序的基础。本文详解 CUDA 中的块内同步 __syncthreads()、Warp 级同步、Memory Fence,以及原子操作的使用场景、性能代价与优化技巧,帮助你在保证正确性的前提下写出高性能的并行代码。

2026-05-12

新增内容

  • 文章: 2.2 内存访问优化 | 内存访问效率是 CUDA Kernel 性能最大的杠杆。本文深入讲解合并访问(Coalesced Access)的原理与判定方法、共享内存 Bank Conflict 的成因与 Padding 解决方案,以及向量化加载(float4/int4)提升带宽利用率的实战技巧。
  • 文章: 2.3 Occupancy 与资源分配 | Occupancy 衡量 SM 上实际活跃 Warp 数与理论最大值的比例,是调优 CUDA Kernel 的核心指标之一。本文讲解 Occupancy 的定义、计算方法、三大限制因素(寄存器/共享内存/Block 大小),以及为什么 Occupancy 并非越高越好——真正的目标是在延迟隐藏与资源利用之间找到平衡点。

2026-05-11

新增内容


2026-05-09

新增内容

  • 文章: CUDA 内存模型 | 本文详解全局内存、共享内存、寄存器、常量内存和统一内存的特性、适用场景及优化技巧
  • 文章: 第一个实用 Kernel:向量加法 | 通过一个完整的向量加法案例,走通 CUDA 编程的全流程

2026-05-08

新增内容


2026-05-07

新增内容


2026-04-28

新增内容


2026-04-27

新增内容


2026-04-26

新增内容


2026-04-25

新增内容


2026-04-24

新增内容


2026-04-23

新增内容


2026-04-21

新增内容


2026-04-20

新增内容


2026-04-18

新增内容


2026-04-17

新增内容

  • 面试专区:共收录 180+ 场面试真题,覆盖 40+ 家公司,按梯队分类组织。在线浏览 →
  • 涵盖公司包括字节跳动、阿里巴巴、腾讯、百度、快手、美团、蚂蚁、英伟达、MiniMax、蔚来、小鹏、理想等。
  • 社区入口:新增wx交流群,欢迎大家加入讨论

内容优化

  • 更新 README,补充项目介绍图片

2026-04-16

重大更新

新增内容


2026-04-15

项目上线

  • AIInfraGuide 知识库正式上线
  • 发布 [AI Infra 学习路线](/AIInfraGuide/guides/AI Infra学习路线)总览
  • 发布「从零理解 AI Infra」入门指引

2026-04-14

项目初始化

  • 完成网站框架搭建(基于 Astro + Starlight)
  • 初始化项目仓库,发布首次 commit