AI课程:从神经网络到智能体 | 原创,AI翻译
我提供AI辅导。每节课50元人民币(每节30分钟)。订阅1到100+节课——定制你自己的学习路径。我很乐意分享我所学到的知识。
我的背景
- 男,1995年出生,中国公民,现居广州。2011年广东NOIP全省前300名,在线解决约1000道算法题。
- 过往经历包括LeanCloud、北京平方根、博彦科技(外派至某新加坡银行)、法本信息(外派至某英国国际银行)以及一家全球IT外包公司(外派至某英国国际银行)。
- 累计12年专业经验。擅长移动端(Android、iOS)及全栈工程,有1年机器学习/大数据经验。
- 对HTML、CSS、JavaScript、Vue、React、Angular、iOS/Android、Java、Spring、MySQL、Redis、分布式系统以及云平台(阿里云、AWS、Azure)有良好理解。
- 趣直播 — GitHub,一个基于微信的面向iOS、Android、后端及AI内容开发者的技术直播平台。运营于2016至2017年,约3万用户。
- 个人博客 — lzwjava.github.io,一个AI驱动的一站式博客系统,具备AI翻译等功能。运营自2021年至今,月浏览量约6万(Cloudflare)。
- 母语为中文,英语熟练(雅思6.5)。阅读超过320本书。
- AI爱好者——在H200、AMD MI300X和RTX 4070 GPU上训练过小型LLM(nanoGPT),并使用OpenRouter和Claude Code构建项目(约30亿token消耗量)。
- 更多详情:简历 · 软件作品集 · AI作品集 · 生活作品集
课程理念
- 通过打印变量来理解——而非仅仅阅读理论
- 阅读真实代码(比如nanoGPT,而非仅看教科书)
- 自己动手训练小型模型
- 构建系统,而非仅学理论
- 像训练LLM一样迭代——首次尝试不会完美
你将能够做到
你将深入理解神经网络、理解Transformer、从零训练GPT、修改nanoGPT、微调模型、构建AI代理,并打造一个类似OpenClaw的平台。
从数学到GPT再到AI系统。这就是路径。
适用人群
- 从高中生到博士生,任何专业——文理科背景均欢迎。AI对于任何有好奇心和毅力的人都是可学的。
- 在职专业人士,包括软件工程师、IT经理以及其他希望加深AI理解的技术岗位。
- 任何将AI作为兴趣或职业转型方向的人。
课程形式
- 每节课50元人民币(每节30分钟)。订阅1到100+节课。
- 每位学生一对一指导。
- 前几名学生通过Zoom或腾讯会议进行实时授课并录制。后续学生将收到这些录制的视频课程,而非实时会议。
- 每节课约30分钟。
- 必须完成每节课的作业后才能进入下一节。
- 课间休息时间(睡眠时间除外)可进行快速文字讨论(不超过30分钟)。
- 我亲自指导每位学生,确保没有人被不必要的障碍卡住。
- 按课付费,无长期承诺。
- 加入一个拥有3000+中国工程师的微信群进行交流与讨论。通过微信联系:lzwjava。
要报名,请发送邮件至lzwjava@gmail.com,主题为”AI Course Enrollment”。请在邮件中附上简短的自我介绍以及学习AI的动机。您也可以点击此处了解更多。
我们可以涵盖的主题
以下为例示主题。可选任意子集,或深入任何领域——我们根据你的需求定制课程。
从第一性原理理解神经网络
理解神经网络真正计算的是什么。标量、向量、矩阵运算。逐步前向传播。手动求导的反向传播直觉。激活函数、损失函数。
练习:打印每个变量(禅意神经网络风格)。用纯Python实现一个2层神经网络。在MNIST上训练。
之后,你将理解神经网络中的每一个数字。
从神经网络到深度学习
梯度下降、学习率、收敛。过拟合与泛化。正则化、Dropout、批量/小批量/SGD。
练习:训练一个3层分类器。可视化损失曲线。手动实现Dropout。
之后,你将理解深度学习实际是如何训练的。
PyTorch最小框架
张量基础、自动求导、nn.Module设计、优化器机制、Dataset与DataLoader。
练习:用PyTorch重建MLP。训练CIFAR分类器。检查梯度。
之后,你将能阅读任何PyTorch模型。
语言建模基础
分词(BPE)、n-gram模型、RNN/LSTM直觉、下一个词预测、语言交叉熵。
练习:构建一个字符级语言模型。在小型莎士比亚语料上训练。生成文本。
之后,你将理解GPT预测的是什么。
Transformer架构
自注意力、Q K V解释、多头注意力、位置编码、前馈模块、残差连接。
练习:实现单头注意力。构建一个小型Transformer。可视化注意力。
之后,你将理解GPT的架构。
nanoGPT深度探索
这是关键的一课。nanoGPT训练循环、GPT模型架构、权重初始化、数据管道、采样。
练习:在小型数据集上训练nanoGPT。修改模型大小。在中文语料上训练。更换分词器。
之后,你将能训练自己的GPT。
GPT训练工程
GPU内存优化、梯度累积、混合精度、检查点、多GPU训练、数据规模扩展。
练习:训练一个1亿参数模型。恢复训练。微调模型。
之后,你将能运行真实的GPT训练。
指令微调与对齐
SFT微调、指令数据集、RLHF概述、奖励模型概念、LoRA微调。
练习:使用聊天格式数据集微调nanoGPT。构建一个遵循指令的模型。
之后,你将能构建一个聊天模型。
LLM代理(Claude Code / OpenClaw)
工具调用、代理循环、规划与执行、记忆系统、CLI代理设计。
练习:构建一个编码代理。构建一个CLI自动化代理。构建一个多步推理代理。
之后,你将能构建一个OpenClaw风格的系统。
个人AI系统(结业项目)
本地模型部署、检索增强生成(RAG)、长上下文记忆、多代理系统、CLI工具集成。
最终项目选项:个人编程AI、研究助手、CLI AI工具包或自主开发代理。
之后,你将拥有自己的AI系统。
