LINUX SB 快照站

神经网络为什么要从一层变成多层?精华

原帖: linux.sb/topic/13113 · 共 8 楼 · 标题快照 2026-08-17 20:21:54

楼主
发帖 2026-08-16 22:38:30 · 快照 2026-08-17 20:21:54

你有没有想过,为什么模型要设置那么多层神经元而不是一层?是不是层数越多,模型就越好呢?其实不一定,那么今天我们就来讲一讲非线性、隐藏层和反向传播

人工神经元

首先我们来认识一下人工神经元。人工神经元不是真正的大脑,而是一个负责计算的函数。神经元会把输入乘以对应的权重,再加上偏置,最后交给激活函数处理,简单来说就是:接收输入→乘权重→求和→加偏置→激活函数→输出,权重决定模型更重视哪些,偏置则帮助模型调整判断标准。比如识别一只喵时,有的神经元可能更关注耳朵,有的可能更关注眼睛和胡须。

非线性与隐藏层

首先什么是线性,简单来说线性就是无论输入是多少,都按照同一种固定的计算规则变化。望文生义,非线性就是有有固定规则,只是在不同区间的计算方式不同。,比如出租车超过3公里就重新计算,这就是一种非线性,ReLU就是一种非线性,如果z<=0时,输出0,如果z>0时,输出z。隐藏层就是藏在输入层和输出层中间的网络层,负责提取信息

前向传播与反向传播

前向传播就是数据从输入层开始,按照顺序经过各个隐藏层,最后到达输出层并产生预测结果的过程。而反向传播就是模型从最终的Loss开始,由后往前计算每个权重和偏置对Loss产生了多大影响。简单来说前向传播预测结果,反向通过结果对比Loss计算出每个权重和偏置对Loss产生了多大影响

好啦,喵,恭喜你学会了非线性,隐藏层和反向传播,快去搭建你的多层神经网络吧!🐱

最后由 Sam.Altman 编辑于 2026-08-16 22:38
#1
发帖 2026-08-16 22:39:21 · 快照 2026-08-17 20:21:54

楼主讲得挺通俗的,尤其是拿出租车计费比喻非线性,一下就懂了 😹

补充一点,为什么单层不行:如果只有线性变换,多层叠起来其实还是等价于一层,因为线性的组合仍是线性。正是 ReLU 这类激活函数引入了非线性,才让多层有了意义,能拟合更复杂的边界。

不过层数确实不是越多越好,太深容易梯度消失、过拟合,还得配合残差、归一化这些手段。感谢分享,学习了!

#2
发帖 2026-08-16 22:39:47 · 快照 2026-08-17 20:21:54

好贴

#5
发帖 2026-08-17 08:26:38 · 快照 2026-08-17 20:21:54

就像一元一次函数解决不了复杂问题一样。

#7
发帖 2026-08-17 11:01:47 · 快照 2026-08-17 20:21:54

year!又有精华了喵