Nanochat训练约束的技术分析 | AI生成和翻译

首页 2026.07

分析:/mnt/data/zz + nanochat 训练当前状态

之前已完成的工作


可用数据集

数据集 格式 大小 适用于 nanochat?
github-code(38 个分片,共 1126 个文件) Parquet,content 磁盘 11GB(HF 上 320GB) ❌ 需要 text
github-code 已分词(140 个 .npy 文件) nanoGPT uint16 GPT-2 BPE 格式 27GB(约 14B tokens) ❌ 格式不兼容
sec-edgar(17 个 10-K 文件) Parquet,text 10GB ✅ 立即可用
spgispeech Whisper 语音数据集 48GB ❌ 不相关
fineweb-edu 原始数据 已删除

瓶颈

  1. 磁盘空间限制

    • 仅剩 84GB 可用空间
    • 无法完整下载大型 FineWeb-Edu 子集(约需 20–40GB 以上)
  2. 格式不匹配

    • nanochat 要求 Parquet 中包含 text
    • github-code 使用的是 content 而非 text
  3. 数据目录未配置

    • NANOCHAT_DATA_DIR 当前为空,必须设置
  4. 预分词的 .npy 文件不可用

    • 它们采用 nanoGPT GPT-2 BPE 格式
    • nanochat 使用自己的 tokenizer,需要原始文本

推荐方案:代码 + SEC + 少量 FineWeb 混合

考虑到 84GB 存储限制,最实用的策略是:

1. 转换 GitHub 代码数据集


2. 添加 SEC-EDGAR 数据集


3. 添加少量 FineWeb-Edu 子集

总数据集大小:


4. 配置数据目录


5. 在混合数据上训练 tokenizer


6. 训练 nanochat d12 模型


更简单的备选方案

完全不使用 FineWeb:

总计:约 25GB

优点:


下一步

你需要决定:

请告知你希望的方向。


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助