RoPE 旋转位置编码 — 从目标出发,一步步推出旋转矩阵
2026-05-16
不直接给公式,而是从"我希望内积只依赖相对位置"这个目标出发,一步步反推出旋转矩阵形式的推导过程。
3336 字
|
17 分钟
LLM Decoding: From Probability Distributions to a Complete Strategy
2026-05-16
从 greedy 到 beam search,一文讲清 LLM decoding 策略的原理与选择。
3301 字
|
17 分钟
大模型推理显存拆解 — 一步步算清你的显存去哪了
2026-05-16
以 Llama-3-8B 为例,从参数怎么算、KV Cache 公式怎么来的、激活值有多大,到每项怎么优化,一步步推导而不是直接扔给你一个数字。
2991 字
|
15 分钟
长上下文扩展 — 从 RoPE 出发,一步步推导 PI、NTK 到 YaRN
2026-05-16
从 RoPE 的 θ 公式出发,先想清楚"为什么 RoPE 在训练长度外效果差",再一步步推出 PI、NTK-aware、YaRN 的改进思路和数学原理。
3315 字
|
17 分钟
Tokenization 完全指南 — 从字符到子词,模型到底是怎么"看懂"文字的
2026-05-16
从"模型只能读数字"这个最朴素的问题出发,一步步推出字符级、词级、BPE、WordPiece、Unigram、SentencePiece 的原理和代码实现。
4764 字
|
24 分钟
Building an Autonomous AI Agent on WSL
2026-05-15
记录在 WSL 上部署 Hermes Agent 的全过程——包括微信网关配置、Windows 保活机制、Camoufox 反爬浏览器的集成与使用。
3510 字
|
18 分钟
A Series on LLMs (I)
2025-12-05
深入讲解 LLM 训练中的 RLHF、PPO、DPO 三种核心方法的原理和伪代码实现,帮助理解大模型对齐技术。
1986 字
|
10 分钟
A Series on LLMs (II)
2025-02-06
对 LLM 推理中的提效技术进行学习,如 KV-Cache、Flash-Attention 的原理、实现及其如何避免注意力机制中的重复计算。
1220 字
|
6 分钟