SEC-EDGAR-GPT: 一个GPT-2(124M)语言模型,完全基于SEC EDGAR文件从头训练 | 原创,AI翻译

首页 2026.06

免责声明: 所有训练数据均公开可获取于 Hugging Face。所有实验和训练均在我的个人设备或云平台上使用个人账户进行——未使用任何银行资源。


我使用单张 RTX 4070,在 15.5 亿 token 的 SEC-EDGAR 财务申报文件上从头训练了一个 1.24 亿参数的 GPT-2 模型。训练耗时约 8 小时,验证损失收敛至 2.28。

SEC-EDGAR 是美国证券交易委员会的上市公司申报文件公开数据库——包括 10-K 年度报告、10-Q 季度报告及其他公开披露文件。

该模型能够生成逼真的 SEC 标准文本——风险因素、管理层讨论与分析(MD&A)章节、业务描述——但在数值一致性和长程连贯性方面存在困难,这在此规模下属于预期表现。

代码: github.com/lzwjava/sec-edgar-gpt 论文: sec-edgar-gpt.pdf

整个 1.24 亿参数模型——包括训练、部署、论文和网站——均在 3 天内使用 Hermes Agent 完成。借助 AI 智能体,LLM 研究与实践已变得真正触手可及。

感谢 Andrej Karpathy 的 nanoGPT 训练框架、Hugging Face 上的 kapilrao/SEC-EDGAR 数据集,以及 Ming Jian Wei、Du Chun 和 Parjanya Mudunuri 的有益讨论。


关于我: 我是一名在 GFT 工作的 AI 全栈工程师,通过合同安排服务于一家全球银行。过去一年中,我处理了约 30 亿 LLM token,并在 RTX 4070、H200、B200 和 AMD MI300X 上训练了约 15 个小模型(最高 7.6 亿参数)。我在银行内部 GitHub 上贡献了 5000 多次,在公共 GitHub 上贡献了 11000 多次——这些贡献借助 AI 工具完成,并经过人工审核验证。我在该银行担任合同工程师已有 2.5 年,涉及 WPB 和 GFT 部门。我曾向 80 位银行同事发表 AI 演讲,分享实践经验。最近,我还与首席工程师 Parjanya Mudunuri 及我的主管 Ming Jian Wei 合作约一个月,参与一个涉及大型 Excel 文件处理及连接/联合工具的项目,用于比较多个银行系统间的差异与差距。

正如银行 CEO 所言,AI 正成为我们这个时代最具定义性的技术之一。我希望这项工作能帮助银行更多地采用 AI 技术。


项目网站(部署于 Cloudflare Workers,请使用个人设备访问):

二维码:项目网站

sec-edgar-gpt.lzwjava.workers.dev

SEC-EDGAR-GPT 网站

聊天——试用模型(部署于 RunPod,请使用个人设备访问;每小时 0.24 美元,数日后将关闭):

二维码:聊天

gq8kq409jjxh7r-8888.proxy.runpod.net

SEC-EDGAR-GPT 聊天机器人

HuggingFace 模型:

二维码:HuggingFace

huggingface.co/lzwjava/sec-edgar-gpt-124m-hf


原创,AI翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助