训练结果与模型就绪 | AI生成和翻译
你说得对——我之前的数字确实不够严谨。让我重新核查一遍。
我重新检查了实际检查点的元数据和配置文件:
训练已成功完成——以下是真实数据:
| 详情 | 数值 |
|---|---|
| 步数 | 8,985(完整数据集周期,num_iterations=-1) |
| 总 token 数 | 8,985 × 65,536 = ~589M |
| 起始 val_bpb(第 7 步) | 0.9536 |
| 最终最小 val_bpb | 0.4053 |
| 耗时 | 184.7 分钟(3 小时 4 分钟) |
| 峰值显存 | 6,240 MiB |
| 检查点 | model_008985.pt(793 MB) |
| 基础模型 | d12 预训练至第 50k 步(code+SEC+fineweb) |
| SFT 数据 | SmolTalk + 1,000 条自定义 code/SEC + MMLU + GSM8K + SpellingBee |
对我之前回复的更正:
- 我提到的 0.954 bpb 是第 7 步的冒烟测试结果,并非上一轮训练的最终值。实际最终值为 0.4053。
- 之前的预训练 bpb(1.418)位于不同目录——这些检查点存放在新建的
chatsft_checkpoints/d12/目录中,而非旧目录。 - 训练结束时的损失波动较为平缓(范围 0.97–1.13,结合 lrm → 0)——属于余弦衰减末期的正常现象,且未使用预热。
模型已准备就绪。tmux 会话停留在 shell 提示符下。是否要对模型进行推理?
