机器学习中「正则化来防止过拟合」到底是一个什么原理?scRNA-使用sctransform去除批次效应

2025-09-12 15:00:01 :0

机器学习中「正则化来防止过拟合」到底是一个什么原理?scRNA-使用sctransform去除批次效应

“正则化为负”相关信息最新大全有哪些,这是大家都非常关心的,接下来就一起看看机器学习中「正则化来防止过拟合」到底是一个什么原理?scRNA-使用sctransform去除批次效应!

本文目录

机器学习中「正则化来防止过拟合」到底是一个什么原理

过度拟合的问题通常发生在变量(特征)过多的时候。这种情况下训练出的方程总是能很好的拟合训练数据,也就是说,我们的代价函数可能非常接近于 0 或者就为 0。但是,这样的曲线千方百计的去拟合训练数据,这样会导致它无法泛化到新的数据样本中,以至于无法预测新样本价格。在这里,术语"泛化"指的是一个假设模型能够应用到新样本的能力。新样本数据是指没有出现在训练集中的数据。

具体而言,我们可以人工检查每一项变量,并以此来确定哪些变量更为重要,然后,保留那些更为重要的特征变量。至于,哪些变量应该舍弃,我们以后在讨论,这会涉及到模型选择算法,这种算法是可以自动选择采用哪些特征变量,自动舍弃不需要的变量。这类做法非常有效,但是其缺点是当你舍弃一部分特征变量时,你也舍弃了问题中的一些信息。例如,也许所有的特征变量对于预测房价都是有用的,我们实际上并不想舍弃一些信息或者说舍弃这些特征变量。正则化中我们将保留所有的特征变量,但是会减小特征变量的数量级(参数数值的大小θ(j))。这个方法非常有效,当我们有很多特征变量时,其中每一个变量都能对预测产生一点影响。正如我们在房价预测的例子中看到的那样,我们可以有很多特征变量,其中每一个变量都是有用的,因此我们不希望把它们删掉,这就导致了正则化概念的发生。

scRNA-使用sctransform去除批次效应

关于去除多组数据中的批次效应,有多种算法,如Seurat包的CCA(canonical correlation analysis)、LIGER的NMF(non-negative matrix factorization)、 Scran包的mnnCorrect 、Seurat包的sctransform

这次就来看看sctransform是如何使用的

目前教程更新于2019-10-08

***隐藏网址***

它的开发者曾说:

还支持管道单行命令:

之前利用常规流程处理 ,得到的UMAP结果是:

得到的结果是:

注意到:这里的 FindNeighbors 使用了更多的主成分(30个) ,而之前常规分析中根据 ElbowPlot(pbmc) 结果仅使用了10个主成分就得了不错的结果。

这是因为:

另外,常规分析中的 FindVariableFeatures 默认得到2000个高变异基因(HVGs),而 这里的 sctransform 因为使用了更多的PCs,算法也更优化,所以默认会得到3000个HVGs 。sctransform认为:新增加的这1000个基因就包含了之前没有检测到的微弱的生物学差异。而且,即使使用全部的全部的基因去做下游分析,得到的结果也是和 sctransform 这3000个基因的结果相似

因为SCTransform对参数的要求不是很多,一般默认参数就能应付大多数情况,因此作者也给出了单行从创建对象到最后分群的结果

作为了解即可:它利用了正则化负二项分布(regularized negative binomial regression)计算了技术噪音模型,得到的残差是归一化值,有正有负。正值表示:考虑到细胞群体中基因的平均表达量和细胞测序深度,某个细胞的某个基因所包含的UMIs比预测值要高。

这些marker的选择:

(二)正则化

一个样本变量的分布,尤其是其统计方差在很大程度上依赖于取样支撑的大小,支撑越大,方差越小。在一般的统计事件中,样本的支撑应该是相同的,但在地质勘探过程中,尤其是金矿勘探工作中,在确保充分揭示矿体又能反映品位变化的前提下,样品往往采自较小的支撑上,通常只有几十厘米,最大不超过2m,且变化较大。为了便于研究,在进行地质统计学研究之前,必须对所有样品进行正则化,即把所有样品统一到同一支撑上。

如前所述,某金矿床的样品支撑有钻孔样品和坑道样品两类,这两类样品的支撑的几何形态各不相同,钻孔样品的支撑为直径约66mm的圆柱体,而坑道样品的支撑为横截面为10cm×5cm的长方体,且样品的长度是随矿化脉的厚度及矿化的富集程度的变化而变化的,其值介于0.19~2.35m之间。在进行正则化时,我们不可能对样品支撑的几何形态做任何改变,而只能对其长度做正则化,以达到等长度支撑的规则样品。

首先,由于钻孔样品只采自矿体带附近和内部,对废石没有采样或采了样但没有进行化学分析,但其测试结果表明其品位值均与围岩中金的背景值相当,由于金的背景值较低,为了保证整个钻孔采样的连续性,便于研究矿体的空间几何形态,暂将废石段的金品位赋为零。对于“这些连续采样”的钻孔,分别将它们正则化为1m长,3m长和5m长的组合样,其相应的正则化金品位的统计结果见下表。我们发现正则化的支撑越大,其金品位越低,且统计方差和品位的变化系数越小,我们认为这一结果与原始样中金品位与其样长之间的负相关关系(其相关系数约为-0.04)及支撑效应有关。

坑道样品品位沿矿脉走向变化趋势图

正则化样品的金品位统计结果表

在以往的地质统计工作中,人们一直认为正则化样品的均值与其支撑的大小无关,且与原始样的均值相同,只有样本方差随正则化支撑大小的变化而变化,支撑越大,样本方差越小,反之亦然。通过研究发现这一结论是在不考虑原始样品支撑变化的基础上建立的,然而当原始样品具有不等支撑时,这一结论就难以成立。下面我们将从数学原理上对它们之间的关系加以推导。

首先考虑一维情况,令Z(xi)为原始样品的品位,l(xi)为原始样品的长度,i=1,2,…,n,其中:n为原始样品数,L为正则化后样品的长度,那么,原始样品的总长度TL为

TL=l(x1)+l(x2)+…+l(xn)

正则化后样品的数目为: 其中,int表示取整数。

对于第一个样品Z(x1)来说,如果其长度l(x(x1)≥L,那么第一个正则化样品的品位为Z(x(xi)=Z(x1);否则,应该考虑前几个样品,直到其累计长度达到正则化长度。假设为2个样品,则其正则化品位为

地质统计学(空间信息统计学)基本理论与方法应用

第二个正则化样品的品位为

地质统计学(空间信息统计学)基本理论与方法应用

但无论怎样,我们总可以推导出正则化后所有新样品金品位Z’(x’j)的均值为

地质统计学(空间信息统计学)基本理论与方法应用

由此可见,正则化样品的均值是原始样品品位的加权平均值,其权系数为

地质统计学(空间信息统计学)基本理论与方法应用

对于给定的工程而言,TL是常数,所以,权系数只与原始样品的样长有关,若所有原始样品均为等样长样品,则每个原始样品在正则化过程中具有相等的权,且正则化样品的均值等于原始样品的算术平均值。

地质统计学(空间信息统计学)基本理论与方法应用

即与原始样品具有相同的均值。否则,正则化后样品的均值将随原始样品的品位与样长的变化而变化,进一步我们可以推导出正则化样品的均值与原始样品的品位与样长的相关系数成反比关系。

显然,如果原始样品的品位与样长之间的相关系数为负,则正则化样品的均值小于原始样品的均值,如果相关系数为0,则正则化样品的均值与原始样品的均值相等,否则正则化样品的均值将大于原始样品的均值。

在二维及三维情况下,我们可以得出同样的结论。

金矿床1号矿脉群0号勘探剖面图

金矿床1号矿脉群1390m标高中段平面图

所有正整数之和为什么是负十二分之一

求和的定义是广泛的,在这里正整数和为负十二分之一的运算其实是Zeta函数正则化。Zeta函数通常就是将无限不收敛级数化成有限结果的方法,用它求和会产生一些非直觉的结果,例如1+1+1+1+…=-1/2或者lz给的例子1-1+1-1+1-1+...=1/2等等
***隐藏网址***

参考了果壳网一众大神

正则化的方法

求解不适定问题的普遍方法是:用一组与原不适定问题相“邻近”的适定问题的解去逼近原问题的解,这种方法称为正则化方法。如何建立有效的正则化方法是反问题领域中不适定问题研究的重要内容。通常的正则化方法有基于变分原理的Tikhonov 正则化、各种迭代方法以及其它的一些改进方法,这些方法都是求解不适定问题的有效方法,在各类反问题的研究中被广泛采用,并得到深入研究。
正则化:Regularization,代数几何中的一个概念。 就是给平面不可约代数曲线以某种形式的全纯参数表示。
即对于PC^2中的不可约代数曲线C,寻找一个紧Riemann面C*和一个全纯映射σ:C*→PC^2,使得σ(C*)=C 设C是不可约平面代数曲线,S是C的奇点的集合。如果存在紧Riemann面C*及全纯映射σ:C*→PC^2,使得
(1) σ(C*)=C (2) σ^(-1)(S)是有限点集 (3) σ:C*\σ^(-1)(S)→C\S是一对一的映射
则称(C*,σ)为C的正则化。不至于混淆的时候,也可以称C*为C的正则化。
正则化的做法,实际上是在不可约平面代数曲线的奇点处,把具有不同切线的曲线分支分开,从而消除这种奇异性。 正则化就是对最小化经验误差函数上加约束,这样的约束可以解释为先验知识(正则化参数等价于对参数引入先验分布)。约束有引导作用,在优化误差函数的时候倾向于选择满足约束的梯度减少的方向,使最终的解倾向于符合先验知识(如一般的l-norm先验,表示原问题更可能是比较简单的,这样的优化倾向于产生参数值量级小的解,一般对应于稀疏参数的平滑解)。 同时,正则化解决了逆问题的不适定性,产生的解是存在,唯一同时也依赖于数据的,噪声对不适定的影响就弱,解就不会过拟合,而且如果先验(正则化)合适,则解就倾向于是符合真解(更不会过拟合了),即使训练集中彼此间不相关的样本数很少。

(四)关于正则化

1.正则化的本质

什么是正则化?正则化包括正则化变量和正则化承载两个内容。它是在实际应用中体现区域化变量理论的一个技术环节。

若观测数据为Zv(x),信息点x的承载(支撑)为u(例如钻探工程的岩心样品,坑道内取的矿样等)。此时,x点的观测数据Zv(x)实际上是点x所在的承载的数据,这个承载占有一定的体积,现实中它不可能是一个纯粹的点数据(纯粹的点数据只是理论上的),因此,代表点x的承载u(x)的数据(如矿石品位)Zv(x)实际上是点x承载的信息平均值。

地质统计学(空间信息统计学)基本理论与方法应用

平均值Zv(x)即为区域化变量Z(y)在承载u(x)内的正则化变量,其中u(x)称正则化承载。而Zv(x)的运算过程叫做把Z(y)在u(x)上的正则化。所以正则化就是用承载u(x)内的平均值代替原始(点)数据。正则化依赖于正则化支撑(承载)u(x)的大小,形状及方向正则化承载u(x)确定后,正则化变量Zv(x)亦是一个区域化变量,所以又称作是原区域化变量Z(y)的正则化变量。

2.正则化变量Zv(x)的性质

1)若Z(y)二阶平稳,则Z(x)同样二阶平稳。即满足Z(y)二阶平稳的两个条件:

E=m(常数)

Cov(协方差函数)-m=C(h)

同样是满足Zv(y)二阶平稳的条件,将Z(y)和Z(y+h)换成Zv(x)和Zv(x+h)即可。

2)若Z(y)二阶平稳,则正则化变量Zv(x)的变差函数 存在而且平稳,其协方差函数Cv(h)、方差函数Cv(0)和变差函数γv(h)之间亦满足关系式:γv(h)=Cv(0)-Cv(h)(证明从略)

3.正则化(变量的)变差函数的计算公式:

对于变差函数

地质统计学(空间信息统计学)基本理论与方法应用

我们可以把变差函数计算公式看成是用平均品位Zv(x+h)估计平均品位Zv(x)的估计方差 h),u(x+h)]}

因为点半变差函数γ(h)平稳,所以上式右边的后两项相等

地质统计学(空间信息统计学)基本理论与方法应用

式中的γh表示支撑v平移了一个向量h后形成的另一支撑。

当距离h相对于支撑v很大时(h《《r),其平均值γ(v,vh)近似地等于点变差函数γ(h),

即γv(h)≈γ(h) (这个公式在实际工作中很有用)它们的关系如下图所示。

例如,有一个钻孔的所有岩心样品具有相同的样长l和相同的样品横截面积S,当S与l相比甚小时,可以忽略S,这样,就可以把两个岩心样品看成是具有同样长度l和相隔距离为h的两个列线线段,其正则化的变差函数式写成

地质统计学(空间信息统计学)基本理论与方法应用

见下页图。

关于正则化为负,机器学习中「正则化来防止过拟合」到底是一个什么原理的介绍到此结束,希望对大家有所帮助。

机器学习中「正则化来防止过拟合」到底是一个什么原理?scRNA-使用sctransform去除批次效应

本文编辑:admin

更多文章:


内存按什么编址(按字节编址什么意思)

内存按什么编址(按字节编址什么意思)

大家好,内存按什么编址相信很多的网友都不是很明白,包括按字节编址什么意思也是一样,不过没有关系,接下来就来为大家分享关于内存按什么编址和按字节编址什么意思的一些知识点,大家可以关注收藏,免得下次来找不到哦,下面我们开始吧!本文目录按字节编址

2025年10月27日 17:00

recycling翻译(recycling泛读原文及翻译)

recycling翻译(recycling泛读原文及翻译)

各位老铁们好,相信很多人对recycling翻译都不是特别的了解,因此呢,今天就来为大家分享下关于recycling翻译以及recycling泛读原文及翻译的问题知识,还望可以帮助大家,解决大家的一些困惑,下面一起来看看吧!本文目录recy

2026年3月3日 10:45

illustrator举例说明(illustrator选择工具和直接选择工具有什么不同啊)

illustrator举例说明(illustrator选择工具和直接选择工具有什么不同啊)

各位老铁们好,相信很多人对illustrator举例说明都不是特别的了解,因此呢,今天就来为大家分享下关于illustrator举例说明以及illustrator选择工具和直接选择工具有什么不同啊的问题知识,还望可以帮助大家,解决大家的一些

2026年4月3日 07:30

property域名(在tomcat中配置CAS)

property域名(在tomcat中配置CAS)

“property域名”相关信息最新大全有哪些,这是大家都非常关心的,接下来就一起看看property域名(在tomcat中配置CAS)!本文目录在tomcat中配置CASIP是什么Permission denied to access p

2026年5月4日 19:15

结构体类型名称是什么(什么是结构体类型C语言中结构体类型占几个字节)

结构体类型名称是什么(什么是结构体类型C语言中结构体类型占几个字节)

大家好,结构体类型名称是什么相信很多的网友都不是很明白,包括什么是结构体类型C语言中结构体类型占几个字节也是一样,不过没有关系,接下来就来为大家分享关于结构体类型名称是什么和什么是结构体类型C语言中结构体类型占几个字节的一些知识点,大家可以

2026年1月27日 07:15

uml工具是什么(UML是什么)

uml工具是什么(UML是什么)

其实uml工具是什么的问题并不复杂,但是又很多的朋友都不太了解UML是什么,因此呢,今天小编就来为大家分享uml工具是什么的一些知识,希望可以帮助到大家,下面我们一起来看看这个问题的分析吧!本文目录UML是什么iOS开发文档里的uml图是用

2026年1月17日 09:15

air源码自助站(自助建站系统到底好不好用)

air源码自助站(自助建站系统到底好不好用)

大家好,air源码自助站相信很多的网友都不是很明白,包括自助建站系统到底好不好用也是一样,不过没有关系,接下来就来为大家分享关于air源码自助站和自助建站系统到底好不好用的一些知识点,大家可以关注收藏,免得下次来找不到哦,下面我们开始吧!本

2025年11月5日 04:45

css高度自适应(CSS3如何固定图片宽度使图片高度按图片比例自适应)

css高度自适应(CSS3如何固定图片宽度使图片高度按图片比例自适应)

各位老铁们好,相信很多人对css高度自适应都不是特别的了解,因此呢,今天就来为大家分享下关于css高度自适应以及CSS3如何固定图片宽度使图片高度按图片比例自适应的问题知识,还望可以帮助大家,解决大家的一些困惑,下面一起来看看吧!本文目录C

2025年9月3日 02:45

mapreduce的实现原理(Hadoop技术内幕的内容介绍)

mapreduce的实现原理(Hadoop技术内幕的内容介绍)

今天给各位分享Hadoop技术内幕的内容介绍的知识,其中也会对Hadoop技术内幕的内容介绍进行解释,如果能碰巧解决你现在面临的问题,别忘了关注本站,现在开始吧!本文目录Hadoop技术内幕的内容介绍是否所有的mapreduce程序都需要经

2025年11月16日 03:30

culture shock阅读理解(你好,完形填空I understand culture shock, i’ve been答案你有了吗)

culture shock阅读理解(你好,完形填空I understand culture shock, i’ve been答案你有了吗)

各位老铁们好,相信很多人对culture shock阅读理解都不是特别的了解,因此呢,今天就来为大家分享下关于culture shock阅读理解以及你好,完形填空I understand culture shock, i’ve been答案

2025年10月15日 21:45

private owner(求一篇 关于国外二手车交易现状的英文文章)

private owner(求一篇 关于国外二手车交易现状的英文文章)

今天给各位分享求一篇 关于国外二手车交易现状的英文文章的知识,其中也会对求一篇 关于国外二手车交易现状的英文文章进行解释,如果能碰巧解决你现在面临的问题,别忘了关注本站,现在开始吧!本文目录求一篇 关于国外二手车交易现状的英文文章翻译 th

2025年6月10日 08:15

bool类型几个字节(C++定义bool类型的最小存储空间是多大)

bool类型几个字节(C++定义bool类型的最小存储空间是多大)

本篇文章给大家谈谈bool类型几个字节,以及C++定义bool类型的最小存储空间是多大对应的知识点,文章可能有点长,但是希望大家可以阅读完,增长自己的知识,最重要的是希望对各位有所帮助,可以解决了您的问题,不要忘了收藏本站喔。本文目录C++

2025年7月5日 02:15

matlab曲线拟合(matlab拟合曲线的方法有几种)

matlab曲线拟合(matlab拟合曲线的方法有几种)

各位老铁们好,相信很多人对matlab曲线拟合都不是特别的了解,因此呢,今天就来为大家分享下关于matlab曲线拟合以及matlab拟合曲线的方法有几种的问题知识,还望可以帮助大家,解决大家的一些困惑,下面一起来看看吧!本文目录matlab

2025年7月13日 09:00

手机号码的正则表达式(求国际手机号码完整正则表达式,哪位大侠有)

手机号码的正则表达式(求国际手机号码完整正则表达式,哪位大侠有)

这篇文章给大家聊聊关于手机号码的正则表达式,以及求国际手机号码完整正则表达式,哪位大侠有对应的知识点,希望对各位有所帮助,不要忘了收藏本站哦。本文目录求国际手机号码完整正则表达式,哪位大侠有手机号和身份证号的正则表达式怎么写求JS手机号的正

2026年6月1日 11:30

illustrator怎么记住(illustrator中释放到图层和粘贴时记住图层是什么意思)

illustrator怎么记住(illustrator中释放到图层和粘贴时记住图层是什么意思)

大家好,关于illustrator怎么记住很多朋友都还不太明白,不过没关系,因为今天小编就来为大家分享关于illustrator中释放到图层和粘贴时记住图层是什么意思的知识点,相信应该可以解决大家的一些困惑和问题,如果碰巧可以解决您的问题,

2026年1月16日 13:15

网站设计过程(网站设计的基本步骤)

网站设计过程(网站设计的基本步骤)

其实网站设计过程的问题并不复杂,但是又很多的朋友都不太了解网站设计的基本步骤,因此呢,今天小编就来为大家分享网站设计过程的一些知识,希望可以帮助到大家,下面我们一起来看看这个问题的分析吧!本文目录网站设计的基本步骤网站设计的基本步骤有哪些企

2025年9月2日 17:15

commit中文翻译(求翻译:I’m committed to working with members of both parties to cut our deficits and debt)

commit中文翻译(求翻译:I’m committed to working with members of both parties to cut our deficits and debt)

今天给各位分享求翻译:I’m committed to working with members of both parties to cut our deficits and debt的知识,其中也会对求翻译:I’m committed

2025年12月21日 06:30

知己棋牌源码(杭州有啥遇知己的蹦迪地方)

知己棋牌源码(杭州有啥遇知己的蹦迪地方)

这篇文章给大家聊聊关于知己棋牌源码,以及杭州有啥遇知己的蹦迪地方对应的知识点,希望对各位有所帮助,不要忘了收藏本站哦。本文目录杭州有啥遇知己的蹦迪地方在棋牌领域,人类是不是被人工智能全面超越了异性知己最高境界不能说的话爱上有妇之夫又不想破坏

2025年5月25日 09:45

offset属性(offsetheight 的属性是什么)

offset属性(offsetheight 的属性是什么)

今天给各位分享offsetheight 的属性是什么的知识,其中也会对offsetheight 的属性是什么进行解释,如果能碰巧解决你现在面临的问题,别忘了关注本站,现在开始吧!本文目录offsetheight 的属性是什么JS中的offs

2026年7月14日 23:15

align命令怎么用(cad对齐怎么用)

align命令怎么用(cad对齐怎么用)

大家好,关于align命令怎么用很多朋友都还不太明白,不过没关系,因为今天小编就来为大家分享关于cad对齐怎么用的知识点,相信应该可以解决大家的一些困惑和问题,如果碰巧可以解决您的问题,还望关注下本站哦,希望对各位有所帮助!本文目录cad对

2025年11月7日 04:45

近期文章

本站热文

electronics软件(labcenter electronics是什么软件)
2025-05-22 23:45:02 浏览:134
博客是微博吗(博客是微博吗)
2025-05-22 22:45:01 浏览:111
diversity and distribution(悬赏英语短文)
2025-05-23 16:15:02 浏览:107
ios软件开发前景(iOS就业前景怎么样)
2025-05-22 23:00:01 浏览:102
next month(有The next month这个单词吗,和 next month有什么区别)
2025-05-23 02:30:01 浏览:102
patron(patron是什么意思)
2025-05-23 10:30:02 浏览:95
标签列表

热门搜索