[LLM 3/10] RLHF 与 PPO:用一个无法求导的奖励去训练模型
第 2 章我们靠"逐 token 模仿标准答案"来教模型。但真正让 AI 助手可用的那些性质—— 答得对、有礼貌、不胡编、不滑回英语——既没有标准答案可模仿,也写不成一个直接的 loss function。 这一章是那个问题最正统的答案:RLHF(Reinforcement Learning from Human Feedback)配 PPO。 我们会从泰语偏好对训练一个真正的 reward model,然后从零手写约 120 行 PPO 循环, 最后做一个我在整个系列里最喜欢的实验:解开 KL 牵引绳,现场看模型作弊刷分。 这是全系列刻意安排的最重的一章,因为第 4 章(DPO)和第 5 章(GRPO) 都是从本章的公式出发,各自选择"删掉"其中一块零件。
