[LLM 9/10] Benchmarking:没有置信区间的 accuracy 只是传闻
· 阅读需 28 分钟
从第 1 章开始,这个系列每次报告数字时都会重复同一句话: "没有置信区间的 accuracy 不是实验结果,它只是传闻", 并且承诺会在第 9 章完整解释——就是这一章。 我们一个 step 都不会训练,而是要从零搭出一套三种模式的评测系统, 把整个系列训练出来的每一个 checkpoint 都拿到真实的泰语考题上测一遍, 然后证明那些从来没人写进 paper 的设置,能让同一个模型的分数移动得比 leaderboard 上大家争来争去的差距还要大。
