正则化与稀疏(向量如何变稀疏)

本文目录
向量如何变稀疏
阈值化,1和L2正则化。
1、阈值化。将向量中的所有元素与一个阈值比较,所有小于阈值的元素都设置为零,从而使得向量变得更加稀疏。
2、L1和L2正则化。正则化是一种非常常见的方法,可以通过增加正则项来惩罚大量的维度,从而导致一些分量为零的向量。在L1正则化中,正则项为绝对值,L2正则化中,正则项为平方和,它们可以相互转换并用于训练模型。
正则化方法在哪些方面有研究
正则化(regularization),是指在线性代数理论中,不适定问题通常是由一组线性代数方程定义的,而且这组方程组通常来源于有着很大的条件数的不适定反问题。大条件数意味着舍入误差或其它误差会严重地影响问题的结果。
求解不适定问题的普遍方法是:用一组与原不适定问题相“邻近”的适定问题的解去逼近原问题的解,这种方法称为正则化方法。如何建立有效的正则化方法是反问题领域中不适定问题研究的重要内容。通常的正则化方法有基于变分原理的Tikhonov 正则化、各种迭代方法以及其它的一些改进方法,这些方法都是求解不适定问题的有效方法,在各类反问题的研究中被广泛采用,并得到深入研究。
正则化:Normalization,代数几何中的一个概念。
通俗来说
就是给平面不可约代数曲线以某种形式的全纯参数表示。
即对于PC^2中的不可约代数曲线C,寻找一个紧Riemann面C*和一个全纯映射σ:C*→PC^2,使得σ(C*)=C
严格的定义如下
设C是不可约平面代数曲线,S是C的奇点的集合。如果存在紧Riemann面C*及全纯映射σ:C*→PC^2,使得
(1) σ(C*)=C (2) σ^(-1)(S)是有限点集 (3) σ:C*\σ^(-1)(S)→C\S是一对一的映射
则称(C*,σ)为C的正则化。不至于混淆的时候,也可以称C*为C的正则化。
正则化的做法,实际上是在不可约平面代数曲线的奇点处,把具有不同切线的曲线分支分开,从而消除这种奇异性。
主要解决的问题
1.正则化就是对最小化经验误差函数上加约束,这样的约束可以解释为先验知识(正则化参数等价于对参数引入先验分布)。约束有引导作用,在优化误差函数的时候倾向于选择满足约束的梯度减少的方向,使最终的解倾向于符合先验知识(如一般的l-norm先验,表示原问题更可能是比较简单的,这样的优化倾向于产生参数值量级小的解,一般对应于稀疏参数的平滑解)。
2.同时,正则化解决了逆问题的不适定性,产生的解是存在,唯一同时也依赖于数据的,噪声对不适定的影响就弱,解就不会过拟合,而且如果先验(正则化)合适,则解就倾向于是符合真解(更不会过拟合了),即使训练集中彼此间不相关的样本数很少。
为什么L1稀疏,L2平滑
你是问的机器学习中的正则化吧,在机器学习建模中,通常使用正则化来避免
过拟合问题,正则化实际上是限制参数的大小,防止特征小范围变动被参数放大。
从数学公式的角度来看,L1是线性收敛到圆点,而L2是逐渐逼近圆点,所以通常L1可以
得到为0的参数(相当于特征选择,也就是稀疏),而L2只能得到较小的比较近似的参数(平滑)。
***隐藏网址***
正则化的通俗解释
正则化:
1. 正则化的目的:防止过拟合!
2. 正则化的本质:约束(限制)要优化的参数。
关于第1点,过拟合指的是给定一堆数据,这堆数据带有噪声,利用模型去拟合这堆数据,可能会把噪声数据也给拟合了,这点很致命,一方面会造成模型比较复杂(想想看,本来一次函数能够拟合的数据,现在由于数据带有噪声,导致要用五次函数来拟合,多复杂!),另一方面,模型的泛化性能太差了(本来是一次函数生成的数据,结果由于噪声的干扰,得到的模型是五次的),遇到了新的数据让你测试,你所得到的过拟合的模型,正确率是很差的。
关于第2点,本来解空间是全部区域,但通过正则化添加了一些约束,使得解空间变小了,甚至在个别正则化方式下,解变得稀疏了。这一点不得不提到一个图,相信我们都经常看到这个图,但貌似还没有一个特别清晰的解释,这里我尝试解释一下,图如下:

这里的w1,w2都是模型的参数,要优化的目标参数,那个红色边框包含的区域,其实就是解空间,正如上面所说,这个时候,解空间“缩小了”,你只能在这个缩小了的空间中,寻找使得目标函数最小的w1,w2。左边图的解空间是圆的,是由于采用了L2范数正则化项的缘故,右边的是个四边形,是由于采用了L1范数作为正则化项的缘故,大家可以在纸上画画,L2构成的区域一定是个圆,L1构成的区域一定是个四边形。
再看看那蓝色的圆圈,再次提醒大家,这个坐标轴和特征(数据)没关系,它完全是参数的坐标系,每一个圆圈上,可以取无数个w1,w2,这些w1,w2有个共同的特点,用它们计算的目标函数值是相等的!那个蓝色的圆心,就是实际最优参数,但是由于我们对解空间做了限制,所以最优解只能在“缩小的”解空间中产生。
蓝色的圈圈一圈又一圈,代表着参数w1,w2在不停的变化,并且是在解空间中进行变化(这点注意,图上面没有画出来,估计画出来就不好看了),直到脱离了解空间,也就得到了图上面的那个w*,这便是目标函数的最优参数。
对比一下左右两幅图的w*,我们明显可以发现,右图的w*的w1分量是0,有没有感受到一丝丝凉意?稀疏解诞生了!是的,这就是我们想要的稀疏解,我们想要的简单模型。
还记得模式识别中的剃刀原理不?倾向于简单的模型来处理问题,避免采用复杂的。【剃刀原理:剃刀是一种经验法则,用于允许排除(刮掉)不可能的解释或者情况。另提一句,剃刀是一种有效的思维方式,但事实上并不是严格意义上的“定理”。】
这里必须要强调的是,这两幅图只是一个例子而已,没有说采用L1范数就一定能够得到稀疏解,完全有可能蓝色的圈圈和四边形(右图)的一边相交,得到的就不是稀疏解了,这要看蓝色圈圈的圆心在哪里。
此外,正则化其实和“带约束的目标函数”是等价的,二者可以互相转换。关于这一点,
通过熟悉的拉格朗日乘子法(注意这个方法的名字),

看到没,这两个等价公式说明了,正则化的本质就是,给优化参数一定约束,所以,正则化与加限制约束,只是变换了一个样子而已。
此外,我们注意,正则化因子,也就是里面的那个lamda,如果它变大了,说明目标函数的作用变小了,正则化项的作用变大了,对参数的限制能力加强了,这会使得参数的变化不那么剧烈(仅对如上数学模型),直接的好处就是避免模型过拟合。反之,自己想想看吧。。。
个人感觉,“正则化”这几个字叫的实在是太抽象了,会吓唬到人,其实真没啥。如果改成“限制化”或者是“约束化”,岂不是更好?
正则化中,为什么说模型越复杂,正则化值越大
L1正则假设参数的先验分布是Laplace分布,可以保证模型的稀疏性,也就是某些参数等于0;
L2正则假设参数的先验分布是Gaussian分布,可以保证模型的稳定性,也就是参数的值不会太大或太小
在实际使用中,如果特征是高维稀疏的,则使用L1正则;如果特征是低维稠密的,则使用L2正则。
最后,附一张示意图。
向左转|向右转
右侧是L1正则,最优解位于坐标轴上,意味着某些参数是0。

更多文章:
vscode离线python环境搭建(VScode配置Python环境“配置任务运行程序”遇到问题)
2026年5月23日 19:15
javabus怎么上不去了(为什么JAV连续几天都登不上去)
2026年3月30日 04:30
函数static修饰(C++类的线程函数为什么要加static修饰)
2026年1月3日 20:45
周杰伦最新专辑发布时间(周杰伦新专辑确切消息!于今年12月12日发布!!)
2026年8月4日 04:00
drawimage 缩放(如何在固定的canvas画布内缩放)
2026年7月14日 16:30
canva手机版教程(超市宣传海报怎么制作图片-手机怎么做超市海报)
2025年9月12日 09:00
一i一一人口人一一 我(目前我国人口目前我国人口最多的少数民族是哪个民族)
2025年5月29日 06:45
matlab怎么画多个函数图像(如何用Matlab画函数的图像)
2025年10月17日 02:00
completefuture使用场景(completefuture无法手动停止)
2026年1月15日 20:00
css怎么把文字放在图片中间(div+css怎么让图片在两边文字在中间)
2025年6月16日 21:30










