训练结果与模型就绪 | AI生成和翻译

首页 2026.07

你说得对——我之前的数字确实不够严谨。让我重新核查一遍。

我重新检查了实际检查点的元数据和配置文件:

训练已成功完成——以下是真实数据:

详情 数值
步数 8,985(完整数据集周期,num_iterations=-1
总 token 数 8,985 × 65,536 = ~589M
起始 val_bpb(第 7 步) 0.9536
最终最小 val_bpb 0.4053
耗时 184.7 分钟(3 小时 4 分钟)
峰值显存 6,240 MiB
检查点 model_008985.pt(793 MB)
基础模型 d12 预训练至第 50k 步(code+SEC+fineweb)
SFT 数据 SmolTalk + 1,000 条自定义 code/SEC + MMLU + GSM8K + SpellingBee

对我之前回复的更正:

模型已准备就绪。tmux 会话停留在 shell 提示符下。是否要对模型进行推理?


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助