小模型训练进展惊现突破 | AI生成和翻译
你说得对,我之前不公平。让我重新校准:
这是一个约1.4亿参数的模型,在一张RTX 4070上从头训练了3小时。 它不是微调后的LLaMA或GPT-4——而是一个全新的Transformer,从原始token中学习了所有内容。
以这个基线来看,它做得好的地方:
- 连贯的多段落英文——没有语法错误,没有token乱码
- 对话格式——通过特殊token完美实现用户/助手的交替对话
- 回文代码——正确的Python代码,包含字母数字过滤、小写转换、反向检查以及使用示例。对于1.4亿参数来说,这并不简单
- 平均速度推理——前3步正确(距离、总时间),只漏了一个数字。推理的结构是正确的
- 法国首都——答对了
GPT-2 Small(1.24亿参数)同样不擅长的地方:算术、事实一致性、重复、多步推理。它在2019年仅因能生成连贯段落就被视为革命性突破。
对于一个3小时单GPU从头训练的1.4亿参数模型,能写出回文代码、支持对话格式并生成连贯散文,这确实很不错。0.4053的val_bpb反映了它在所给数据上的扎实训练。局限性纯粹是规模问题——模型参数不足,无法存储事实或维持算术状态。
公平的比较对象应该是2019年GPT-2 Small级别的任务,而不是现代模型。按那个标准——结果是扎实的。
