H200 训练:1.38B,128K Tok/s | AI生成和翻译
Your browser does not support the audio element.
训练摘要 — H200 d24 (1.38B 参数)
模型架构
字段
值
层数
24
嵌入维度
1536
注意力头数
12 (GQA, kv=12)
每个头的维度
128
词表大小
32768
参数量
1,384,122,122 (1.38B)
窗口模式
SSSL (交替滑动窗口)
FP8
启用 (145/158 层, 张量级)
硬件
字段
值
GPU
NVIDIA H200 (140 GB)
Token数/秒
平均 ~128K (范围: 121K–131K)
MFU
~62% bf16 (范围: 59%–63%)
步时间
~4.1s (范围: 4.0–4.4s)
与 MI300X 参考对比: 68K tok/s, 27% MFU — H200 速度约为 1.9 倍
训练配置
字段
值
步数
29,000 (Chinchilla 最优)
总Token数
15.2B (比例 20.83× 参数)
每步批大小
524,288 tokens (16 × 32,768 微批)
梯度累积
16
序列长度
2048
学习率预热
40 步,峰值 lrm=1.0
权重衰减
0.042 (针对 d24 缩放)
评估
每 500 步
保存
每 5000 步
跟踪器
wandb (离线运行: w1pqqwr2)
损失曲线 (前 108 步)
step 0: loss 10.40 (初始化验证 bpb 3.22)
step 20: loss 7.21
step 40: loss 6.02 (约第 39 步达到 LR 峰值)
step 60: loss 5.59
step 80: loss 5.22
step 100: loss 4.99 (损失趋于平稳 — 简单模式的早期收敛)
稳定、干净的下降。第 0 步的初始尖峰 (190s, 2.7K tok/s) 是编译/JIT 预热。
预估
指标
估计值
当前步数
108 / 29,000 (0.37%)
已用时间
6.7 分钟
预计剩余时间
~32.9 小时
完成时间
~7 月 9 日 11:30 UTC (从开始约 33 小时)
数据
字段
值
数据集
FineWeb-Edu (44 个 parquet 文件, 96 GB)
可用Token总数
35.7B (足够用于 d24 和 d30)
分词器
自定义 BPE (词表 32K, 在 FineWeb-Edu 上训练)
检查点
将每 5000 步 (步骤 5000, 10000, 15000, 20000, 25000, + 最终) 保存到 ~/.cache/nanochat/base_checkpoints/d24/。每个检查点大小约为 6-12 GB,取决于优化器状态。
监控进度
tmux attach -t train-d24 # 查看实时
tmux capture-pane -t train-d24 -p # 不附加捕获