🗺️ LLM 知识体系导航 — 从底层原理到工程实践 置顶
2026-06-03
以 LLM 知识体系本身为骨架梳理的完整学习地图。已写的文章可以直接点进去读,空缺的知识点标注了"待补充",后续按图补全。
3281 字
|
16 分钟
LLM 训练与推理优化(五)— SFT 训练实战:Packing 到 Chunked NLL
2026-06-16
用 TRL SFTTrainer 讨论 Truncation、Packing、PEFT、Liger Kernel、Chunked NLL、Padding-Free、Activation Offloading 与 Gradient Checkpointing 的显存取舍。
3464 字
|
17 分钟
LLM 训练与推理优化(四)— 训练显存与 ZeRO 优化
2026-06-15
从 DDP 的多副本冗余出发,说明特定 Adam 混合精度配置下的 16Ψ 模型状态,并推导 ZeRO-1/2/3 的理想分片账本与通信取舍。
2852 字
|
14 分钟
LLM 训练与推理优化(三)— 量化深入:从最小化误差到 GPTQ/AWQ
2026-06-14
不直接抛公式,而是从"我想把 BF16 压成 INT4,又不想损失太多精度"这个目标出发,一步步推出 scale、zero_point、GPTQ 误差补偿、AWQ 通道保护。
3694 字
|
18 分钟
LLM 训练与推理优化(二)— 推理显存拆解与优化
2026-06-13
以 Llama-3-8B 为例,逐项推导推理时的权重和 KV Cache。讲清楚 KV Cache 公式里为什么是 n_kv 而不是 n_heads,以及 FlashAttention 如何避免把注意力矩阵常驻 HBM。
2739 字
|
14 分钟
LLM 训练与推理优化(一)— 显存基础:从 bit 到训练/推理的全景图
2026-06-12
系列开篇。统一 bit/byte/精度、训练与推理的显存组成,并说明一种常见 Adam 混合精度配置为何使用 FP32 状态,作为后续 4 篇的共同语言。
2825 字
|
14 分钟
大模型量化入门 — 从"最小化误差"出发,一步步推导量化公式
2026-05-16
不直接给公式,而是从"我想把 16 位浮点数压缩到 4 位整数,同时尽量少损失精度"这个目标出发,一步步推出 scale、zero_point、GPTQ、AWQ 的量化方案。
4519 字
|
23 分钟