纳米聊天训练完成并附带验证结果 | AI生成和翻译

首页 2026.07

训练刚刚结束!以下是完整状态信息:

nanochat d12 SFT — 完成(2分钟前结束)

指标 数值
步数 8,985
时长 184.70分钟(约3小时)
最终损失 1.0674(第8984步)
验证bpb 0.4053
峰值VRAM 6,240 MiB
学习率 余弦衰减 0.05 → -0.00
训练轮数 2(略超过1倍数据)
检查点保存 d12/model_008985.pt

验证bpb为0.4053——对于混合数据上的SFT而言,这实际上是非常好的结果。在约0.4 bpb的水平下,模型已经很好地学习了数据分布(相当于token空间中的约0.28困惑度)。这与您之前的d12运行结果一致(我记得之前那次是0.954 bpb——所以这次明显更好)。

值得注意:MFU读数约为162%,这显然是一个异常值(理论上无法超过100%最大值)。这很可能是nanochat在tok/sec计算中的测量问题——由于未考虑梯度累积,token计数速度高于实际值。实际计算利用率大概在60-80%范围内,对于单GPU来说已经不错了。

损失曲线最后出现了一些波动(最后100步在1.01-1.13范围内),表明已接近收敛——继续增加步数会导致过拟合。

您想对检查点进行推理测试,还是继续下一个实验?


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助