算法
4 篇- 2026.08.17偏好优化的数学原理:RLHF、PPO 与 DPO M
关键词:偏好优化、强化学习 (RL)、Bradley-Terry 模型、RLHF、策略梯度、Actor-Critic、TRPO、PPO、DPO。
- 2026.03.22经典注意力与经典 Transformer 的数学原理 M
从 RNN、BPTT 到 Attention 与 Transformer 的数学原理,系统分析梯度传播、Self-Attention、因果掩码与 KV Cache 等机制的理论逻辑。
数学 & 统计
7 篇- 2026.05.27泛函分析与测度论视角下的方差缩减技术 M
在泛函分析与测度论的高观点上,重新讨论五种方差缩减技术:控制变量、对偶变量、分层抽样、Rao-Blackwellization 与重要性采样。
随笔 & 我
4 篇- 2026.06.26请输入文本
其他
3 篇- 2025.05.28Spring 框架学习研究札记