纳米聊天训练完成并附带验证结果 | AI生成和翻译
训练刚刚结束!以下是完整状态信息:
nanochat d12 SFT — 完成(2分钟前结束)
| 指标 | 数值 |
|---|---|
| 步数 | 8,985 |
| 时长 | 184.70分钟(约3小时) |
| 最终损失 | 1.0674(第8984步) |
| 验证bpb | 0.4053 |
| 峰值VRAM | 6,240 MiB |
| 学习率 | 余弦衰减 0.05 → -0.00 |
| 训练轮数 | 2(略超过1倍数据) |
| 检查点保存 | d12/model_008985.pt |
验证bpb为0.4053——对于混合数据上的SFT而言,这实际上是非常好的结果。在约0.4 bpb的水平下,模型已经很好地学习了数据分布(相当于token空间中的约0.28困惑度)。这与您之前的d12运行结果一致(我记得之前那次是0.954 bpb——所以这次明显更好)。
值得注意:MFU读数约为162%,这显然是一个异常值(理论上无法超过100%最大值)。这很可能是nanochat在tok/sec计算中的测量问题——由于未考虑梯度累积,token计数速度高于实际值。实际计算利用率大概在60-80%范围内,对于单GPU来说已经不错了。
损失曲线最后出现了一些波动(最后100步在1.01-1.13范围内),表明已接近收敛——继续增加步数会导致过拟合。
您想对检查点进行推理测试,还是继续下一个实验?
