[LLM 10/10] 部署:你等的不是计算,而是权重在路上
· 阅读需 27 分钟
前面九章里,我们灌进了知识、教会了格式、对齐了 preference、把模型蒸馏变小、给它加上护栏,还诚实地做了测量。 但我们手上最好的那个模型,到现在为止仍然只是一个没有人能调用的 checkpoint 文件。 最后这一章把它真正送上线,并且证明一句话——这句话支配着 LLM 服务里的每一个决策: 逐 token 的 decode 不是被算力限制住的,而是被内存带宽限制住的—— 我们会在写下第一行代码之前,先从 GPU 的 datasheet 算出速度上限,然后再拿实测数字来对照。
