H200 训练:1.38B,128K Tok/s | AI生成和翻译

首页 2026.07

训练摘要 — H200 d24 (1.38B 参数)

模型架构

字段
层数 24
嵌入维度 1536
注意力头数 12 (GQA, kv=12)
每个头的维度 128
词表大小 32768
参数量 1,384,122,122 (1.38B)
窗口模式 SSSL (交替滑动窗口)
FP8 启用 (145/158 层, 张量级)

硬件

字段
GPU NVIDIA H200 (140 GB)
Token数/秒 平均 ~128K (范围: 121K–131K)
MFU ~62% bf16 (范围: 59%–63%)
步时间 ~4.1s (范围: 4.0–4.4s)

与 MI300X 参考对比: 68K tok/s, 27% MFU — H200 速度约为 1.9 倍

训练配置

字段
步数 29,000 (Chinchilla 最优)
总Token数 15.2B (比例 20.83× 参数)
每步批大小 524,288 tokens (16 × 32,768 微批)
梯度累积 16
序列长度 2048
学习率预热 40 步,峰值 lrm=1.0
权重衰减 0.042 (针对 d24 缩放)
评估 每 500 步
保存 每 5000 步
跟踪器 wandb (离线运行: w1pqqwr2)

损失曲线 (前 108 步)

step   0: loss 10.40  (初始化验证 bpb 3.22)
step  20: loss  7.21
step  40: loss  6.02  (约第 39 步达到 LR 峰值)
step  60: loss  5.59
step  80: loss  5.22
step 100: loss  4.99  (损失趋于平稳 — 简单模式的早期收敛)

稳定、干净的下降。第 0 步的初始尖峰 (190s, 2.7K tok/s) 是编译/JIT 预热。

预估

指标 估计值
当前步数 108 / 29,000 (0.37%)
已用时间 6.7 分钟
预计剩余时间 ~32.9 小时
完成时间 ~7 月 9 日 11:30 UTC (从开始约 33 小时)

数据

字段
数据集 FineWeb-Edu (44 个 parquet 文件, 96 GB)
可用Token总数 35.7B (足够用于 d24 和 d30)
分词器 自定义 BPE (词表 32K, 在 FineWeb-Edu 上训练)

检查点

将每 5000 步 (步骤 5000, 10000, 15000, 20000, 25000, + 最终) 保存到 ~/.cache/nanochat/base_checkpoints/d24/。每个检查点大小约为 6-12 GB,取决于优化器状态。

监控进度

tmux attach -t train-d24          # 查看实时
tmux capture-pane -t train-d24 -p # 不附加捕获

AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助