Causal Inference Series (II)
因果推断系列第二篇,基于因果推断综述论文,系统介绍因果推断的基本符号、关键假设和核心定义。
1467 字
|
7 分钟
Deep Reinforcement Learning Series
系统学习强化学习中的策略梯度与价值方法两大类参数更新算法,涵盖 PPO、Q-Learning 等核心方法的原理与公式推导。
6258 字
|
31 分钟
Causal Inference Series (I)
因果推断入门系列第一篇,基于 Brady Neal 的课程,从辛普森悖论出发揭示相关性与因果性的本质区别。
2507 字
|
13 分钟
Lang Chain Series
对 LangChain 框架的核心组件(Prompts、Models、Indexes 等)进行学习记录与解读,加入个人理解与代码注释,方便快速上手。
8436 字
|
42 分钟
L1 and L2 Regularization
从多个角度探讨 L1 和 L2 正则化的原理,解释其为何能有效防止模型过拟合,涵盖公式推导、几何解释和贝叶斯视角。
1583 字
|
8 分钟
AdamW (part I) — Weight Decay == L2 Regularization?
探讨 SGD 与 Adam 优化器下 Weight Decay 和 L2 正则化的等价性差异,引入 AdamW 优化器的设计动机与原理。
765 字
|
4 分钟
Kullback–Leibler divergence
介绍 KL 散度(Kullback-Leibler divergence)的定义、离散与连续版本的公式,以及其在衡量两个概率分布差异性中的核心作用。
1295 字
|
6 分钟
Text Generator With Transformer Decoder
利用 Transformer Decoder 从零实现一个简单的文本生成器,涵盖数据构造、Mask Attention、Positional Encoding 等核心组件的代码实现。
1857 字
|
9 分钟