LLM预训练数据集 | AI生成和翻译

首页 2026.07

问题: 除了FineWeb,还有哪些文本数据集可以用于LLM预训练?

回答:

以下是按每个数据集在训练混合中的角色分类的实际场景。

通用网络文本(FineWeb的替代/同类数据集)

精选/多源数据集

代码数据

数学数据(每个token对推理能力提升最高)

多语言数据

适合你规模的实用配方

对于GPT-2 760M / nanoGPT级别的运行(约10–100B token,MI300X),一个强力的混合方案:

# 适用于约1B模型的Chinchilla风格混合,从Hugging Face流式加载
from datasets import load_dataset, interleave_datasets

mix = interleave_datasets([
    load_dataset("HuggingFaceFW/fineweb-edu", "sample-100BT", split="train", streaming=True),
    load_dataset("mlfoundations/dclm-baseline-1.0", split="train", streaming=True),
    load_dataset("bigcode/starcoderdata", data_dir="python", split="train", streaming=True),
    load_dataset("HuggingFaceTB/finemath", "finemath-4plus", split="train", streaming=True),
], probabilities=[0.55, 0.25, 0.10, 0.10], seed=42)

比更换数据集更有价值的两个举措:

  1. 自行在760M / 10B token规模下对比DCLM与FineWeb-Edu —— 结果因基准测试而异,运行消融实验能让你学到更多,远胜于任何排行榜。Karpathy的nanochat使用FineWeb-Edu分片,恰恰是因为它是可靠默认值,而非因为它总是最优。
  2. 研究过滤分类器,而不仅仅是输出结果。FineWeb-Edu的分类器是一个轻量级回归模型,在嵌入层上基于Llama-3-70B的教育价值标注进行训练——你可以在周末利用你的4070显卡,针对自定义领域(例如面向智能体/工具使用的语料库)重新训练该流水线。

参考文献:


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助