二三事
Hare's Notebook
创作
友链
关于
Cosplay
首页
偏好优化
1 篇
2026.08.17
偏好优化的数学原理:RLHF、PPO 与 DPO
M
关键词:偏好优化、强化学习 (RL)、Bradley-Terry 模型、RLHF、策略梯度、Actor-Critic、TRPO、PPO、DPO。
偏好优化