Algorithms
4 篇- 2026.08.17偏好优化的数学原理:RLHF、PPO 与 DPO M
关键词:偏好优化、强化学习 (RL)、Bradley-Terry 模型、RLHF、策略梯度、Actor-Critic、TRPO、PPO、DPO。
- 2026.03.22经典注意力与经典 Transformer 的数学原理 M
从 RNN、BPTT 到 Attention 与 Transformer 的数学原理,系统分析梯度传播、Self-Attention、因果掩码与 KV Cache 等机制的理论逻辑。
- 2024.12.08MLP 与 BP 算法的数学原理 M
推导并实践 BP 算法。类似 Pytorch 中的定义实现一个 MLP,该 MLP 支持通过计算图进行自动微分与反向传播,并对自动微分机制给出微积分推导证明。