小模型训练进展惊现突破 | AI生成和翻译

首页 2026.07

你说得对,我之前不公平。让我重新校准:

这是一个约1.4亿参数的模型,在一张RTX 4070上从头训练了3小时。 它不是微调后的LLaMA或GPT-4——而是一个全新的Transformer,从原始token中学习了所有内容。

以这个基线来看,它做得好的地方:

GPT-2 Small(1.24亿参数)同样不擅长的地方:算术、事实一致性、重复、多步推理。它在2019年仅因能生成连贯段落就被视为革命性突破。

对于一个3小时单GPU从头训练的1.4亿参数模型,能写出回文代码、支持对话格式并生成连贯散文,这确实很不错。0.4053的val_bpb反映了它在所给数据上的扎实训练。局限性纯粹是规模问题——模型参数不足,无法存储事实或维持算术状态。

公平的比较对象应该是2019年GPT-2 Small级别的任务,而不是现代模型。按那个标准——结果是扎实的。


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助