外观
第二讲:线性模型、正则化与概率解释
约 2278 字大约 8 分钟
Machine LearningLinear ModelRegularization
本文由 GPT-5.6-sol 完成。
线性模型看起来简单:把输入乘上一组权重,再加一个偏置。但它几乎把监督学习最重要的几条线索都提前摆在了桌面上——如何定义损失,如何优化参数,如何从概率角度解释目标函数,以及如何抑制过拟合。
本讲的重点因此不是记住几个闭式解,而是看清同一个模型在几何、优化与统计三种视角下如何互相对应。
一、监督学习的基本形式
给定训练集
D={(xi,yi)}i=1n,xi∈Rd,
希望从假设空间中选择函数 fθ,使其在未见数据上的期望风险尽量小。由于真实数据分布未知,训练时通常先最小化经验风险:
R^(f)=n1i=1∑nℓ(yi,f(xi)).
这里的损失函数决定了“错得有多严重”,假设空间决定了模型能表达什么,而优化算法负责在给定空间里寻找较好的参数。三者必须分开理解:模型简单,不代表优化一定容易;训练损失很低,也不代表泛化一定好。
二、线性回归
1. 模型与平方损失
线性回归假设输出是特征的仿射函数:
f(x)=w⊤x+b.
把常数 1 合并进特征后,可以统一写成 f(x)=w⊤x。采用平方损失,目标函数为
J(w)=2n1∥Xw−y∥22.
其梯度是
∇J(w)=n1X⊤(Xw−y).
若 X⊤X 可逆,令梯度为零便得到普通最小二乘解
w∗=(X⊤X)−1X⊤y.
这个公式很漂亮,却不是所有场景的首选:矩阵可能奇异,显式求逆的代价也可能很高。实际计算更常使用 QR、SVD 或迭代优化,而不是直接构造逆矩阵。
2. 梯度下降与随机梯度下降
批量梯度下降每一步使用全部样本:
wt+1=wt−ηt∇J(wt).
随机梯度下降(SGD)则抽取一个样本或一个小批量,以随机梯度近似全梯度:
wt+1=wt−ηt∇wℓ(yi,fwt(xi)).
全梯度稳定但单步昂贵;随机梯度噪声较大,却能以低成本频繁更新。小批量方法是两者之间最常用的折中。学习率过大会振荡甚至发散,过小则收敛缓慢,所以“优化算法”并不是写下一条更新式就结束了。
三、平方损失的概率解释
假设观测满足
yi=w⊤xi+εi,εi∼i.i.d.N(0,σ2).
于是
p(yi∣xi,w)=2πσ21exp[−2σ2(yi−w⊤xi)2].
独立样本的对数似然相加。去掉与 w 无关的常数后,最大化似然等价于
wmini=1∑n(yi−w⊤xi)2.
所以平方损失并非凭空选定,它对应“标签等于线性预测加独立同方差高斯噪声”的建模假设。若噪声重尾、有明显异方差或异常值很多,这套假设便值得重新检查。
四、从线性到非线性
线性模型的“线性”是指对参数线性,不一定指对原始输入线性。先做特征映射
x↦ϕ(x),
再拟合
f(x)=w⊤ϕ(x),
就能得到关于原始输入的非线性函数。例如一维多项式回归使用
ϕ(x)=(1,x,x2,…,xm)⊤.
提高 m 会扩大表达能力,也会放大方差与数值不稳定性。这自然引出下一问题:如果模型能够把训练数据拟合得过于精细,怎样约束它?
五、正则化:给复杂模型加上代价
1. L2 正则化与岭回归
岭回归的目标是
Jλ(w)=21∥Xw−y∥22+2λ∥w∥22,λ≥0.
令梯度为零:
(X⊤X+λI)w=X⊤y,
因此
w∗=(X⊤X+λI)−1X⊤y.
这里是 +λI,不是减号。L2 正则会连续地压缩权重,并改善病态矩阵的条件数;它通常不会把系数精确压成零。
2. L1 正则化与稀疏性
Lasso 使用
wmin21∥Xw−y∥22+λ∥w∥1.
L1 范数在零点不可导,却容易产生精确的零系数。一个直观解释是:L1 约束区域带有尖角,损失等高线更容易在坐标轴上与它相切,因此得到稀疏解。
3. 近端梯度与软阈值
将目标写成光滑项 g 与非光滑项 h 之和:
wming(w)+h(w).
近端梯度先对 g 做普通梯度步,再处理 h:
wt+1=proxηh(wt−η∇g(wt)).
当 h(w)=λ∥w∥1 时,近端算子就是逐坐标软阈值:
Sηλ(z)=sgn(z)max(∣z∣−ηλ,0).
这一步揭示了稀疏性的算法来源:绝对值较小的坐标会被直接截成零,而较大的坐标向零收缩。
六、正则化的贝叶斯解释
最大后验估计(MAP)使用贝叶斯公式
p(w∣D)∝p(D∣w)p(w).
取负对数后,MAP 等价于
wmin−logp(D∣w)−logp(w).
于是,数据拟合项来自负对数似然,正则项来自负对数先验:
- 零均值高斯先验给出 L2 正则;
- 零均值 Laplace 先验给出 L1 正则。
要注意,MAP 给出的是后验密度的众数,并不等于完整的贝叶斯推断。它提供了理解正则化的一座桥,而不是把“正则化”和“贝叶斯方法”完全画上等号。
七、逻辑回归:线性分类的概率模型
1. Sigmoid 与对数几率
二分类中令 y∈{0,1},先计算线性分数
z=w⊤x+b,
再用 Sigmoid 映射成概率:
p(y=1∣x)=σ(z)=1+e−z1.
它对应的对数几率为
logp(y=0∣x)p(y=1∣x)=w⊤x+b.
因此逻辑回归线性建模的不是概率本身,而是概率的 log-odds。以 0.5 为阈值时,决策边界仍是线性超平面 w⊤x+b=0。
2. 交叉熵损失
Bernoulli 似然为
p(yi∣xi)=piyi(1−pi)1−yi.
最大化似然等价于最小化二元交叉熵
J(w,b)=−i=1∑n[yilogpi+(1−yi)log(1−pi)].
对单样本分数 zi 求导有
∂zi∂ℓi=pi−yi.
于是梯度仍保留“预测减真实值再乘特征”的简洁结构。逻辑回归的负对数似然是凸函数,所以不存在由目标本身造成的坏局部极小值;但可分数据上无正则的极大似然参数可能趋向无穷,这也是正则化的重要应用场景。
八、Softmax 回归:推广到多分类
对 K 个类别分别设置分数
zk=wk⊤x+bk,
Softmax 将它们归一化为
p(y=k∣x)=∑j=1Kezjezk.
数值计算时应先减去最大分数 m=maxjzj:
p(y=k∣x)=∑jezj−mezk−m,
这样不改变概率,却能避免指数溢出。使用 one-hot 标签 yik,多分类交叉熵为
J=−i=1∑nk=1∑Kyiklogpik.
二分类逻辑回归与 Softmax 回归本质上都是条件概率模型:线性层负责打分,归一化函数负责把相对分数变成概率,交叉熵则来自相应分布的负对数似然。
九、小结
本讲可以压缩成一条连续的建模链:
线性预测⟶损失与经验风险⟶梯度优化⟶似然解释⟶正则化与先验⟶概率分类.
线性模型真正重要的地方,不是它只能画直线,而是它把后续机器学习反复出现的结构集中展示了一遍:选择表示、指定噪声模型、构造损失、控制复杂度,再用优化算法求解。理解了这些连接,许多更复杂的模型只是把其中一个环节换得更强。
更新日志
2026/9/27 10:05
查看所有更新日志
eea03-update 0927 japaneseVocabulary.js于
