神经网络演进史——从感知机到大模型
一门面向完全零基础学习者的神经网络发展史课程。以历史演进为主线,系统讲解从1943年MP神经元到当代大语言模型的核心技术原理。重在理解「每个技术为什么出现、解决了什么问题、核心思想是什么」,不以从业为目标。
从零到「学习」——神经网络如何诞生
1943-1969:从生物神经元到感知机,再到第一次AI寒冬。建立神经网络最基本的概念框架,理解「学习」的数学本质和早期瓶颈。
- 用数学模拟大脑——MP神经元模型:从生物神经元到数学抽象,用MP模型实现逻辑门,理解第一个计算神经元的意义与局限。
- 第一个会学习的模型——感知机:Rosenblatt如何让权重从固定变为可学习,感知机学习算法的直观原理,用几何视角看分类。
- 第一次AI寒冬——XOR与线性不可分:XOR问题为什么是感知机的噩梦,Minsky的批判如何导致十年寒冬,以及这次寒冬的历史教训。
「深度」的密码——多层网络与专用架构
1980s-2000s:反向传播让深度网络可训练,CNN让网络学会「看」,LSTM让网络拥有「长期记忆」。三大核心架构的诞生。
- 冲破线性枷锁——多层感知机与激活函数:为什么多加一层就能解决XOR?非线性激活函数如何赋予网络表达任意函数的能力?万能逼近定理的直觉。
- 为深度网络注入灵魂——反向传播算法:多层网络怎么训练?链式法则如何让误差从输出层逐层回传?梯度消失问题的初次感知。
- 让网络学会「看」——卷积神经网络(CNN):全连接处理图像的致命缺陷,局部感受野、卷积、权值共享、池化的精妙设计,LeNet-5的里程碑意义。
- 让网络拥有「记忆」——RNN与LSTM:序列数据的挑战,RNN的循环结构,长期依赖的困境,LSTM如何用三扇门实现选择性记忆。
引爆点——深度学习为何爆发
2006-2015:从Hinton破冰到AlexNet引爆,GPU与ImageNet作为两大燃料,ResNet让深度无上限。
- 深度学习前夜——Hinton的破冰之举:2006年DBN如何用逐层无监督预训练打破僵局,受限玻尔兹曼机的直觉,「深度学习」概念的提出。
- 算力与数据的双重解放——GPU与ImageNet:CPU vs GPU的本质差异,CUDA如何降低门槛,ImageNet如何成为视觉领域的「奥运会」,数据增强。
- 历史性的一刻——AlexNet的胜利:2012年ImageNet竞赛的碾压性胜利,AlexNet架构详解,ReLU/Dropout/重叠池化的创新。
- 走向更深——VGG、GoogLeNet与ResNet:网络退化问题——更深为什么反而更差?残差连接的优雅解决,VGG的简洁和GoogLeNet的宽度探索。
注意力革命——Transformer改写一切
2014-2018:从RNN信息瓶颈到注意力机制,再到完全基于注意力的Transformer架构,BERT与GPT开辟预训练时代的两条道路。
- 突破RNN瓶颈——注意力机制:Seq2Seq的信息瓶颈问题,注意力如何让解码器「回头查看」输入,Q-K-V模型的直觉理解。
- 「注意力就是一切」——Transformer架构:完全抛弃RNN和CNN,只用注意力构建模型。自注意力、多头注意力、位置编码的完整直觉。
- 理解 vs 生成——BERT与GPT的两条路:BERT的双向理解(MLM)vs GPT的单向生成(自回归),预训练+微调范式的确立,两条技术路线的分叉。
大模型时代——规模即是智能?
2020-至今:Scaling Laws揭示规模的力量,涌现能力带来意外惊喜,多模态与RLHF让模型走向通用助手,回顾与展望。
- 大力出奇迹的科学——Scaling Laws:幂律关系揭示的规律——更大模型、更多数据、更多算力→性能稳定提升。2020年Scaling Laws论文和Chinchilla最优配比的启示。
- 规模带来的魔法——涌现能力:涌现能力的定义——小模型没有、大模型突然出现的能力。上下文学习、思维链、指令遵循的案例分析。
- 从文本到世界——多模态与人类对齐:CLIP如何统一图文,扩散模型如何生成图像,RLHF三步法如何让ChatGPT学会遵循指令。
- 回顾与展望——算法×算力×数据的交响:从1943到2025,三大支柱如何相互作用推动神经网络发展。当前瓶颈与未来方向——可解释性、世界模型、AGI。