跳到主要内容

7 篇博文 含有标签「fine-tuning」

查看所有标签

[LLM 1/10] 继续预训练:把新知识真正灌进泰语 LLM

· 阅读需 14 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

一个泰语能力还不错的大语言模型,往往对你所在组织的专业知识"一无所知"—— 不懂泰国的政府法规,不懂你这个行业的术语,更没见过公司内部文档。 这篇文章要讲的是最直接的解法:继续预训练(Continue Pretraining,CPT), 从公式一直讲到能在免费 Colab 上大约 15 分钟真正跑完的代码。

[LLM 2/10] SFT + LoRA:只训练 1.69% 的参数,教模型学会当助手

· 阅读需 21 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

上一章我们用继续预训练把知识灌进了模型权重。 但"知道"的模型不等于"会回答"的模型——base 模型只有一个职业:把文字续写下去。 这一章要讲的是用 LoRA 来做 SFT(Supervised Fine-Tuning):只训练约 1.7% 的参数, 却能改变整个模型的行为——在免费 Colab 上约 15 分钟跑完。 而你拿到手的,是一个约 40 MB 的 adapter 文件,它将成为本系列余下所有章节的脊梁。

[LLM 3/10] RLHF 与 PPO:用一个无法求导的奖励去训练模型

· 阅读需 27 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

第 2 章我们靠"逐 token 模仿标准答案"来教模型。但真正让 AI 助手可用的那些性质—— 答得对、有礼貌、不胡编、不滑回英语——既没有标准答案可模仿,也写不成一个直接的 loss function。 这一章是那个问题最正统的答案:RLHF(Reinforcement Learning from Human Feedback)配 PPO。 我们会从泰语偏好对训练一个真正的 reward model,然后从零手写约 120 行 PPO 循环, 最后做一个我在整个系列里最喜欢的实验:解开 KL 牵引绳,现场看模型作弊刷分。 这是全系列刻意安排的最重的一章,因为第 4 章(DPO)和第 5 章(GRPO) 都是从本章的公式出发,各自选择"删掉"其中一块零件。

[LLM 4/10] DPO:当语言模型成为它自己的奖励模型

· 阅读需 21 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

上一章我们用 PPO 做了 RLHF,你应该已经看到它有多少零件—— 要单独训练一个奖励模型,要同时把 4 个模型塞进显存, 还要调十几个 PPO 超参数;而一旦奖励模型跑偏,模型就会找到刷分的捷径。 这一章我们要用一个普通的 supervised 训练循环做同样的事——没有奖励模型,也没有 RL。 更关键的是,这并不是一种近似:我们会用代数证明那两块东西是真的互相抵消掉了

[LLM 5/10] GRPO:删掉价值网络,让一组回答互为 baseline

· 阅读需 26 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

上一章我们以 DPO 的空白收尾:它只能给文件里别人准备好的回答排序。 而第 3 章我们付过 PPO 的全价:4 个模型挤在显存里,还要额外训练一整个价值网络。 这一章把两边的优点合起来——让模型采样自己的回答来学习,是货真价实的 RL, 却把价值网络整个删掉。靠的是一个简单到让人恼火"为什么没人早点想到"的统计学观察: 对同一道题采样多个回答,这组回答的平均 reward,本来就是价值网络想要估计的那个 baseline。 而且只要题目能用代码批改,我们连人类偏好数据都不需要——零对,零成本。

[LLM 6/10] 上下文蒸馏:把 system prompt 搬进模型权重里

· 阅读需 27 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

用户每一次给你的聊天机器人发消息,你都会把那段几百 token 的 system prompt 原封不动地一起送过去—— 系统活多久就付多久,每一次 request 都要重付,永远没有尽头。 这一章我们要把那一坨知识从 prompt 搬进模型权重,用的技术叫 Context Distillation(上下文蒸馏),而且是 on-policy 版本(OPCD)。 其中最漂亮的一点是:老师和学生是完全同一个模型——唯一的区别只是谁看得见 prompt。

[LLM 7/10] 模型蒸馏:教师的错误答案,才是最有价值的部分

· 阅读需 27 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

第 6 章我们把"上下文"蒸馏进了同一个模型的权重里,这一章我们要把"整个模型"蒸馏进一个更小的模型。 这两章是刻意成对的:context distillation 改变的是模型知道什么,让你不必再告诉它—— 模型蒸馏(model distillation)改变的是模型的大小,并尽力不改变它能做的事。 而本章的核心强烈违反直觉:教师能传给学生的最有价值的东西,不是正确答案, 而是教师犯错的方式——那个叫温度(temperature)的旋钮,正是让我们看见它的东西。