Fineweb-Code-SEC训练摘要 | AI生成和翻译
训练完成。以下是完整总结:
code-sec-fineweb-d12 — 已完成(50,000步,16.5小时)
| Step | Val BPB | Train Loss | Time |
|---|---|---|---|
| 5,000 | 1.680 | 1.397 | 1.6h |
| 10,000 | 1.640 | 1.372 | 3.3h |
| 15,000 | 1.626 | 1.465 | 4.9h |
| 20,000 | 1.595 | 1.363 | 6.6h |
| 25,000 | 1.568 | 1.136 | 8.2h |
| 30,000 | 1.536 | 1.199 | 9.9h |
| 35,000 | 1.510 | 1.229 | 11.5h |
| 40,000 | 1.468 | 1.169 | 13.1h |
| 45,000 | 1.446 | 1.077 | 14.8h |
| 50,000 | 1.418 | 1.062 | 16.5h |
与之前仅使用fineweb数据的运行的关键差异(val_bpb: 0.866):
- 最终val_bpb为1.418 vs 0.866——更高,但符合预期:代码和SEC比纯网页文本更难(代码的令牌分布更密集)
- 平滑训练损失:1.062——损失在第50k步时仍在下降,表明更多训练会有所帮助
- 该模型学习了代码、SEC文件以及网页文本——在处理代码/金融方面可能优于仅使用fineweb数据的模型
检查点: /home/lzw/.cache/nanochat/base_checkpoints/d12/ ——10个检查点(每5k步一个),每个793MB
