跳到主要内容

3 篇博文 含有标签「alignment」

查看所有标签

[LLM 3/10] RLHF 与 PPO:用一个无法求导的奖励去训练模型

· 阅读需 27 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

第 2 章我们靠"逐 token 模仿标准答案"来教模型。但真正让 AI 助手可用的那些性质—— 答得对、有礼貌、不胡编、不滑回英语——既没有标准答案可模仿,也写不成一个直接的 loss function。 这一章是那个问题最正统的答案:RLHF(Reinforcement Learning from Human Feedback)配 PPO。 我们会从泰语偏好对训练一个真正的 reward model,然后从零手写约 120 行 PPO 循环, 最后做一个我在整个系列里最喜欢的实验:解开 KL 牵引绳,现场看模型作弊刷分。 这是全系列刻意安排的最重的一章,因为第 4 章(DPO)和第 5 章(GRPO) 都是从本章的公式出发,各自选择"删掉"其中一块零件。

[LLM 4/10] DPO:当语言模型成为它自己的奖励模型

· 阅读需 21 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

上一章我们用 PPO 做了 RLHF,你应该已经看到它有多少零件—— 要单独训练一个奖励模型,要同时把 4 个模型塞进显存, 还要调十几个 PPO 超参数;而一旦奖励模型跑偏,模型就会找到刷分的捷径。 这一章我们要用一个普通的 supervised 训练循环做同样的事——没有奖励模型,也没有 RL。 更关键的是,这并不是一种近似:我们会用代数证明那两块东西是真的互相抵消掉了

[LLM 5/10] GRPO:删掉价值网络,让一组回答互为 baseline

· 阅读需 26 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

上一章我们以 DPO 的空白收尾:它只能给文件里别人准备好的回答排序。 而第 3 章我们付过 PPO 的全价:4 个模型挤在显存里,还要额外训练一整个价值网络。 这一章把两边的优点合起来——让模型采样自己的回答来学习,是货真价实的 RL, 却把价值网络整个删掉。靠的是一个简单到让人恼火"为什么没人早点想到"的统计学观察: 对同一道题采样多个回答,这组回答的平均 reward,本来就是价值网络想要估计的那个 baseline。 而且只要题目能用代码批改,我们连人类偏好数据都不需要——零对,零成本。