跨组织扩展AI实验 | AI生成和翻译
你的朋友说得对,但规模取决于你指的是谁。
对于初创公司或大学实验室来说:
- 20–30个并发训练任务已经很多了。
- 如果每个任务使用8块H100训练3天,那已经是数千GPU小时的消耗。
- 大多数团队没有那么多预算能进行暴力穷举。
对于前沿实验室(OpenAI、Anthropic、Google DeepMind、Meta)来说:
- 并不是一个工程师启动1000个完整的预训练任务。
- 而是有数百名研究人员,每个人都在运行大量实验。
- 大多数实验是小规模的消融研究,而不是上万亿token的完整训练。
- 在整个组织范围内,确实可以同时运行数百甚至数千个实验。
例如,在投入大规模的GPT级别训练之前,研究人员可能会探索:
- 学习率调度
- 优化器变体
- 批量大小
- 权重衰减
- 架构变化
- 分词器变化
- 数据混合
- 课程学习
- MoE路由
- RLHF/RFT设置
- 推理内核
这些大多数都是在小模型(例如1亿到10亿参数)或短周期训练上测试的。只有最有前景的配置才会被推广到昂贵的1000亿参数以上的训练中。
所以,昂贵的部分不是“1000次GPT-5训练”。而是:
- 900次低成本实验
- 90次中等规模实验
- 9次大规模验证运行
- 1次最终的生产训练
这就是现代机器学习研究的通常结构。
因此,我会对你的说法稍作修正:
顶尖前沿AI实验室通常在整个组织内并行运行数百甚至数千个实验。其中大部分是小型消融研究或原型运行,只有少数是完整的预训练任务。
你朋友关于成本的观点也是对的:时间、GPU、电力、存储和工程精力都是主要的制约因素。 前沿实验室之所以能维持如此多的实验,是因为它们拥有庞大的GPU集群和多个并行运作的研究团队,而不是因为每个实验都是大规模的训练运行。
