跳到主要内容

2 篇博文 含有标签「distillation」

查看所有标签

[LLM 6/10] 上下文蒸馏:把 system prompt 搬进模型权重里

· 阅读需 27 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

用户每一次给你的聊天机器人发消息,你都会把那段几百 token 的 system prompt 原封不动地一起送过去—— 系统活多久就付多久,每一次 request 都要重付,永远没有尽头。 这一章我们要把那一坨知识从 prompt 搬进模型权重,用的技术叫 Context Distillation(上下文蒸馏),而且是 on-policy 版本(OPCD)。 其中最漂亮的一点是:老师和学生是完全同一个模型——唯一的区别只是谁看得见 prompt。

[LLM 7/10] 模型蒸馏:教师的错误答案,才是最有价值的部分

· 阅读需 27 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

第 6 章我们把"上下文"蒸馏进了同一个模型的权重里,这一章我们要把"整个模型"蒸馏进一个更小的模型。 这两章是刻意成对的:context distillation 改变的是模型知道什么,让你不必再告诉它—— 模型蒸馏(model distillation)改变的是模型的大小,并尽力不改变它能做的事。 而本章的核心强烈违反直觉:教师能传给学生的最有价值的东西,不是正确答案, 而是教师犯错的方式——那个叫温度(temperature)的旋钮,正是让我们看见它的东西。