机器学习中「正则化来防止过拟合」到底是一个什么原理?scRNA-使用sctransform去除批次效应

本文目录
机器学习中「正则化来防止过拟合」到底是一个什么原理
过度拟合的问题通常发生在变量(特征)过多的时候。这种情况下训练出的方程总是能很好的拟合训练数据,也就是说,我们的代价函数可能非常接近于 0 或者就为 0。但是,这样的曲线千方百计的去拟合训练数据,这样会导致它无法泛化到新的数据样本中,以至于无法预测新样本价格。在这里,术语"泛化"指的是一个假设模型能够应用到新样本的能力。新样本数据是指没有出现在训练集中的数据。
具体而言,我们可以人工检查每一项变量,并以此来确定哪些变量更为重要,然后,保留那些更为重要的特征变量。至于,哪些变量应该舍弃,我们以后在讨论,这会涉及到模型选择算法,这种算法是可以自动选择采用哪些特征变量,自动舍弃不需要的变量。这类做法非常有效,但是其缺点是当你舍弃一部分特征变量时,你也舍弃了问题中的一些信息。例如,也许所有的特征变量对于预测房价都是有用的,我们实际上并不想舍弃一些信息或者说舍弃这些特征变量。正则化中我们将保留所有的特征变量,但是会减小特征变量的数量级(参数数值的大小θ(j))。这个方法非常有效,当我们有很多特征变量时,其中每一个变量都能对预测产生一点影响。正如我们在房价预测的例子中看到的那样,我们可以有很多特征变量,其中每一个变量都是有用的,因此我们不希望把它们删掉,这就导致了正则化概念的发生。
scRNA-使用sctransform去除批次效应
关于去除多组数据中的批次效应,有多种算法,如Seurat包的CCA(canonical correlation analysis)、LIGER的NMF(non-negative matrix factorization)、 Scran包的mnnCorrect 、Seurat包的sctransform
这次就来看看sctransform是如何使用的
目前教程更新于2019-10-08
***隐藏网址***
它的开发者曾说:
还支持管道单行命令:
之前利用常规流程处理 ,得到的UMAP结果是:
得到的结果是:
注意到:这里的 FindNeighbors 使用了更多的主成分(30个) ,而之前常规分析中根据 ElbowPlot(pbmc) 结果仅使用了10个主成分就得了不错的结果。
这是因为:
另外,常规分析中的 FindVariableFeatures 默认得到2000个高变异基因(HVGs),而 这里的 sctransform 因为使用了更多的PCs,算法也更优化,所以默认会得到3000个HVGs 。sctransform认为:新增加的这1000个基因就包含了之前没有检测到的微弱的生物学差异。而且,即使使用全部的全部的基因去做下游分析,得到的结果也是和 sctransform 这3000个基因的结果相似
因为SCTransform对参数的要求不是很多,一般默认参数就能应付大多数情况,因此作者也给出了单行从创建对象到最后分群的结果
作为了解即可:它利用了正则化负二项分布(regularized negative binomial regression)计算了技术噪音模型,得到的残差是归一化值,有正有负。正值表示:考虑到细胞群体中基因的平均表达量和细胞测序深度,某个细胞的某个基因所包含的UMIs比预测值要高。
这些marker的选择:
(二)正则化
一个样本变量的分布,尤其是其统计方差在很大程度上依赖于取样支撑的大小,支撑越大,方差越小。在一般的统计事件中,样本的支撑应该是相同的,但在地质勘探过程中,尤其是金矿勘探工作中,在确保充分揭示矿体又能反映品位变化的前提下,样品往往采自较小的支撑上,通常只有几十厘米,最大不超过2m,且变化较大。为了便于研究,在进行地质统计学研究之前,必须对所有样品进行正则化,即把所有样品统一到同一支撑上。
如前所述,某金矿床的样品支撑有钻孔样品和坑道样品两类,这两类样品的支撑的几何形态各不相同,钻孔样品的支撑为直径约66mm的圆柱体,而坑道样品的支撑为横截面为10cm×5cm的长方体,且样品的长度是随矿化脉的厚度及矿化的富集程度的变化而变化的,其值介于0.19~2.35m之间。在进行正则化时,我们不可能对样品支撑的几何形态做任何改变,而只能对其长度做正则化,以达到等长度支撑的规则样品。
首先,由于钻孔样品只采自矿体带附近和内部,对废石没有采样或采了样但没有进行化学分析,但其测试结果表明其品位值均与围岩中金的背景值相当,由于金的背景值较低,为了保证整个钻孔采样的连续性,便于研究矿体的空间几何形态,暂将废石段的金品位赋为零。对于“这些连续采样”的钻孔,分别将它们正则化为1m长,3m长和5m长的组合样,其相应的正则化金品位的统计结果见下表。我们发现正则化的支撑越大,其金品位越低,且统计方差和品位的变化系数越小,我们认为这一结果与原始样中金品位与其样长之间的负相关关系(其相关系数约为-0.04)及支撑效应有关。
坑道样品品位沿矿脉走向变化趋势图
正则化样品的金品位统计结果表
在以往的地质统计工作中,人们一直认为正则化样品的均值与其支撑的大小无关,且与原始样的均值相同,只有样本方差随正则化支撑大小的变化而变化,支撑越大,样本方差越小,反之亦然。通过研究发现这一结论是在不考虑原始样品支撑变化的基础上建立的,然而当原始样品具有不等支撑时,这一结论就难以成立。下面我们将从数学原理上对它们之间的关系加以推导。
首先考虑一维情况,令Z(xi)为原始样品的品位,l(xi)为原始样品的长度,i=1,2,…,n,其中:n为原始样品数,L为正则化后样品的长度,那么,原始样品的总长度TL为
TL=l(x1)+l(x2)+…+l(xn)
正则化后样品的数目为: 其中,int表示取整数。
对于第一个样品Z(x1)来说,如果其长度l(x(x1)≥L,那么第一个正则化样品的品位为Z(x(xi)=Z(x1);否则,应该考虑前几个样品,直到其累计长度达到正则化长度。假设为2个样品,则其正则化品位为
地质统计学(空间信息统计学)基本理论与方法应用
第二个正则化样品的品位为
地质统计学(空间信息统计学)基本理论与方法应用
但无论怎样,我们总可以推导出正则化后所有新样品金品位Z’(x’j)的均值为
地质统计学(空间信息统计学)基本理论与方法应用
由此可见,正则化样品的均值是原始样品品位的加权平均值,其权系数为
地质统计学(空间信息统计学)基本理论与方法应用
对于给定的工程而言,TL是常数,所以,权系数只与原始样品的样长有关,若所有原始样品均为等样长样品,则每个原始样品在正则化过程中具有相等的权,且正则化样品的均值等于原始样品的算术平均值。
地质统计学(空间信息统计学)基本理论与方法应用
即与原始样品具有相同的均值。否则,正则化后样品的均值将随原始样品的品位与样长的变化而变化,进一步我们可以推导出正则化样品的均值与原始样品的品位与样长的相关系数成反比关系。
显然,如果原始样品的品位与样长之间的相关系数为负,则正则化样品的均值小于原始样品的均值,如果相关系数为0,则正则化样品的均值与原始样品的均值相等,否则正则化样品的均值将大于原始样品的均值。
在二维及三维情况下,我们可以得出同样的结论。
金矿床1号矿脉群0号勘探剖面图
金矿床1号矿脉群1390m标高中段平面图
所有正整数之和为什么是负十二分之一
求和的定义是广泛的,在这里正整数和为负十二分之一的运算其实是Zeta函数正则化。Zeta函数通常就是将无限不收敛级数化成有限结果的方法,用它求和会产生一些非直觉的结果,例如1+1+1+1+…=-1/2或者lz给的例子1-1+1-1+1-1+...=1/2等等
***隐藏网址***
参考了果壳网一众大神
正则化的方法
求解不适定问题的普遍方法是:用一组与原不适定问题相“邻近”的适定问题的解去逼近原问题的解,这种方法称为正则化方法。如何建立有效的正则化方法是反问题领域中不适定问题研究的重要内容。通常的正则化方法有基于变分原理的Tikhonov 正则化、各种迭代方法以及其它的一些改进方法,这些方法都是求解不适定问题的有效方法,在各类反问题的研究中被广泛采用,并得到深入研究。
正则化:Regularization,代数几何中的一个概念。 就是给平面不可约代数曲线以某种形式的全纯参数表示。
即对于PC^2中的不可约代数曲线C,寻找一个紧Riemann面C*和一个全纯映射σ:C*→PC^2,使得σ(C*)=C 设C是不可约平面代数曲线,S是C的奇点的集合。如果存在紧Riemann面C*及全纯映射σ:C*→PC^2,使得
(1) σ(C*)=C (2) σ^(-1)(S)是有限点集 (3) σ:C*\σ^(-1)(S)→C\S是一对一的映射
则称(C*,σ)为C的正则化。不至于混淆的时候,也可以称C*为C的正则化。
正则化的做法,实际上是在不可约平面代数曲线的奇点处,把具有不同切线的曲线分支分开,从而消除这种奇异性。 正则化就是对最小化经验误差函数上加约束,这样的约束可以解释为先验知识(正则化参数等价于对参数引入先验分布)。约束有引导作用,在优化误差函数的时候倾向于选择满足约束的梯度减少的方向,使最终的解倾向于符合先验知识(如一般的l-norm先验,表示原问题更可能是比较简单的,这样的优化倾向于产生参数值量级小的解,一般对应于稀疏参数的平滑解)。 同时,正则化解决了逆问题的不适定性,产生的解是存在,唯一同时也依赖于数据的,噪声对不适定的影响就弱,解就不会过拟合,而且如果先验(正则化)合适,则解就倾向于是符合真解(更不会过拟合了),即使训练集中彼此间不相关的样本数很少。
(四)关于正则化
1.正则化的本质
什么是正则化?正则化包括正则化变量和正则化承载两个内容。它是在实际应用中体现区域化变量理论的一个技术环节。
若观测数据为Zv(x),信息点x的承载(支撑)为u(例如钻探工程的岩心样品,坑道内取的矿样等)。此时,x点的观测数据Zv(x)实际上是点x所在的承载的数据,这个承载占有一定的体积,现实中它不可能是一个纯粹的点数据(纯粹的点数据只是理论上的),因此,代表点x的承载u(x)的数据(如矿石品位)Zv(x)实际上是点x承载的信息平均值。
地质统计学(空间信息统计学)基本理论与方法应用
平均值Zv(x)即为区域化变量Z(y)在承载u(x)内的正则化变量,其中u(x)称正则化承载。而Zv(x)的运算过程叫做把Z(y)在u(x)上的正则化。所以正则化就是用承载u(x)内的平均值代替原始(点)数据。正则化依赖于正则化支撑(承载)u(x)的大小,形状及方向正则化承载u(x)确定后,正则化变量Zv(x)亦是一个区域化变量,所以又称作是原区域化变量Z(y)的正则化变量。
2.正则化变量Zv(x)的性质
1)若Z(y)二阶平稳,则Z(x)同样二阶平稳。即满足Z(y)二阶平稳的两个条件:
E=m(常数)
Cov(协方差函数)-m=C(h)
同样是满足Zv(y)二阶平稳的条件,将Z(y)和Z(y+h)换成Zv(x)和Zv(x+h)即可。
2)若Z(y)二阶平稳,则正则化变量Zv(x)的变差函数 存在而且平稳,其协方差函数Cv(h)、方差函数Cv(0)和变差函数γv(h)之间亦满足关系式:γv(h)=Cv(0)-Cv(h)(证明从略)
3.正则化(变量的)变差函数的计算公式:
对于变差函数
地质统计学(空间信息统计学)基本理论与方法应用
我们可以把变差函数计算公式看成是用平均品位Zv(x+h)估计平均品位Zv(x)的估计方差 h),u(x+h)]}
因为点半变差函数γ(h)平稳,所以上式右边的后两项相等
地质统计学(空间信息统计学)基本理论与方法应用
式中的γh表示支撑v平移了一个向量h后形成的另一支撑。
当距离h相对于支撑v很大时(h《《r),其平均值γ(v,vh)近似地等于点变差函数γ(h),
即γv(h)≈γ(h) (这个公式在实际工作中很有用)它们的关系如下图所示。
例如,有一个钻孔的所有岩心样品具有相同的样长l和相同的样品横截面积S,当S与l相比甚小时,可以忽略S,这样,就可以把两个岩心样品看成是具有同样长度l和相隔距离为h的两个列线线段,其正则化的变差函数式写成
地质统计学(空间信息统计学)基本理论与方法应用
见下页图。

更多文章:
illustrator举例说明(illustrator选择工具和直接选择工具有什么不同啊)
2026年4月3日 07:30
结构体类型名称是什么(什么是结构体类型C语言中结构体类型占几个字节)
2026年1月27日 07:15
css高度自适应(CSS3如何固定图片宽度使图片高度按图片比例自适应)
2025年9月3日 02:45
mapreduce的实现原理(Hadoop技术内幕的内容介绍)
2025年11月16日 03:30
culture shock阅读理解(你好,完形填空I understand culture shock, i’ve been答案你有了吗)
2025年10月15日 21:45
private owner(求一篇 关于国外二手车交易现状的英文文章)
2025年6月10日 08:15
bool类型几个字节(C++定义bool类型的最小存储空间是多大)
2025年7月5日 02:15
手机号码的正则表达式(求国际手机号码完整正则表达式,哪位大侠有)
2026年6月1日 11:30
illustrator怎么记住(illustrator中释放到图层和粘贴时记住图层是什么意思)
2026年1月16日 13:15














