GBDT的正则化及与XGBOOST区别

2023-11-15

1.GBDT的正则化
　　和Adaboost一样，我们也需要对GBDT进行正则化，防止过拟合。GBDT的正则化主要有三种方式。
　　
　　第一种是和Adaboost类似的正则化项，即步长(learning rate)。定义为νν,对于前面的弱学习器的迭代
fk(x)=fk−1(x)+hk(x)fk(x)=fk−1(x)+hk(x)
　　如果我们加上了正则化项，则有
fk(x)=fk−1(x)+νhk(x)fk(x)=fk−1(x)+νhk(x)
　　νν的取值范围为0<ν≤10<ν≤1。对于同样的训练集学习效果，较小的νν意味着我们需要更多的弱学习器的迭代次数。通常我们用步长和迭代最大次数一起来决定算法的拟合效果。
　　
　　第二种正则化的方式是通过子采样比例（subsample）。取值为(0,1]。注意这里的子采样和随机森林不一样，随机森林使用的是放回抽样，而这里是不放回抽样。如果取值为1，则全部样本都使用，等于没有使用子采样。如果取值小于1，则只有一部分样本会去做GBDT的决策树拟合。选择小于1的比例可以减少方差，即防止过拟合，但是会增加样本拟合的偏差，因此取值不能太低。推荐在[0.5, 0.8]之间。
　　使用了子采样的GBDT有时也称作随机梯度提升树(Stochastic Gradient Boosting Tree, SGBT)。由于使用了子采样，程序可以通过采样分发到不同的任务去做boosting的迭代过程，最后形成新树，从而减少弱学习器难以并行学习的弱点。
　　
　　第三种是对于弱学习器即CART回归树进行正则化剪枝。在决策树原理篇里我们已经讲过，这里就不重复了。

GBDT小结　
　　总结下GBDT的优缺点。
　　GBDT主要的优点有：
　　1) 可以灵活处理各种类型的数据，包括连续值和离散值。
　　2) 在相对少的调参时间情况下，预测的准备率也可以比较高。这个是相对SVM来说的。
3）使用一些健壮的损失函数，对异常值的鲁棒性非常强。比如 Huber损失函数和Quantile损失函数。
　　GBDT的主要缺点有：
　　1)由于弱学习器之间存在依赖关系，难以并行训练数据。不过可以通过自采样的SGBT来达到部分并行。

【问】xgboost/gbdt在调参时为什么树的深度很少就能达到很高的精度？
用xgboost/gbdt在在调参的时候把树的最大深度调成6就有很高的精度了。但是用DecisionTree/RandomForest的时候需要把树的深度调到15或更高。用RandomForest所需要的树的深度和DecisionTree一样我能理解，因为它是用bagging的方法把DecisionTree组合在一起，相当于做了多次DecisionTree一样。但是xgboost/gbdt仅仅用梯度上升法就能用6个节点的深度达到很高的预测精度，使我惊讶到怀疑它是黑科技了。请问下xgboost/gbdt是怎么做到的？它的节点和一般的DecisionTree不同吗？

【答】
这是一个非常好的问题，题主对各算法的学习非常细致透彻，问的问题也关系到这两个算法的本质。这个问题其实并不是一个很简单的问题，我尝试用我浅薄的机器学习知识对这个问题进行回答。
一句话的解释，来自周志华老师的机器学习教科书（机器学习-周志华）：Boosting主要关注降低偏差，因此Boosting能基于泛化性能相当弱的学习器构建出很强的集成；Bagging主要关注降低方差，因此它在不剪枝的决策树、神经网络等学习器上效用更为明显。
随机森林(random forest)和GBDT都是属于集成学习（ensemble learning)的范畴。集成学习下有两个重要的策略Bagging和Boosting。
Bagging算法是这样做的：每个分类器都随机从原样本中做有放回的采样，然后分别在这些采样后的样本上训练分类器，然后再把这些分类器组合起来。简单的多数投票一般就可以。其代表算法是随机森林。Boosting的意思是这样，他通过迭代地训练一系列的分类器，每个分类器采用的样本分布都和上一轮的学习结果有关。其代表算法是AdaBoost, GBDT。
其实就机器学习算法来说，其泛化误差可以分解为两部分，偏差（bias)和方差(variance)。这个可由下图的式子导出（这里用到了概率论公式D(X)=E(X^2)-[E(X)]^2）。偏差指的是算法的期望预测与真实预测之间的偏差程度，反应了模型本身的拟合能力；方差度量了同等大小的训练集的变动导致学习性能的变化，刻画了数据扰动所导致的影响。这个有点儿绕，不过你一定知道过拟合。
如下图所示，当模型越复杂时，拟合的程度就越高，模型的训练偏差就越小。但此时如果换一组数据可能模型的变化就会很大，即模型的方差很大。所以模型过于复杂的时候会导致过拟合。
当模型越简单时，即使我们再换一组数据，最后得出的学习器和之前的学习器的差别就不那么大，模型的方差很小。还是因为模型简单，所以偏差会很大。

模型复杂度与偏差方差的关系图

也就是说，当我们训练一个模型时，偏差和方差都得照顾到，漏掉一个都不行。
对于Bagging算法来说，由于我们会并行地训练很多不同的分类器的目的就是降低这个方差(variance) ,因为采用了相互独立的基分类器多了以后，h的值自然就会靠近.所以对于每个基分类器来说，目标就是如何降低这个偏差（bias),所以我们会采用深度很深甚至不剪枝的决策树。
对于Boosting来说，每一步我们都会在上一轮的基础上更加拟合原数据，所以可以保证偏差（bias）,所以对于每个基分类器来说，问题就在于如何选择variance更小的分类器，即更简单的分类器，所以我们选择了深度很浅的决策树。

最近引起关注的一个Gradient Boosting算法：xgboost，在计算速度和准确率上，较GBDT有明显的提升。xgboost 的全称是eXtreme Gradient Boosting，它是Gradient Boosting Machine的一个c++实现，作者为正在华盛顿大学研究机器学习的大牛陈天奇。xgboost最大的特点在于，它能够自动利用CPU的多线程进行并行，同时在算法上加以改进提高了精度。它的处女秀是Kaggle的希格斯子信号识别竞赛，因为出众的效率与较高的预测准确度在比赛论坛中引起了参赛选手的广泛关注。值得我们在GBDT的基础上对其进一步探索学习。

链接：http://www.jianshu.com/p/005a4e6ac775

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系:hwhale#tublm.com(使用前将#替换为@)

机器学习

GBDT的正则化及与XGBOOST区别的相关文章

tomcat应用

web服务器 web服务器是安装在服务端主机上实现了http协议的软件也叫http服务器如微软的IIS 当前排名第一开源免费的Apache 个人认为凡是实现了应用层协议的软件都可以叫web服务器如ftp服务器 smtp服务器只不过
C++之异常处理机制

一 C 异常处理机制是由3个部分组成检查 try 抛出 throw 和捕捉 catch 把需要检查的语句放在try中 throw用来当出现异常时发生一个异常信息而catch则用来捕捉异常信息如果捕捉到了异常信息就处理它二 1 首先介

随机推荐

5、Java入门教程【循环+条件语句】

一循环 java有三种主要的循环结构 while 循环 do while 循环 for 循环 1 while 循环语法 while 布尔表达式循环内容示例 public class Test public static void m
break和continue跳出多重循环

关于break和continue 众所周知 break是跳出当前循环 continue是跳出本次循环但是在多重循环中我们可能会模糊概念 break是跳出全部循环还是只是某层循环 gt 跳出的是break所在层的循环即当前循环结论只要
VueUse中文文档Vue官方工具库

VueUse官网地址https vueuse org 这里就列举常用工具详情请去官网查看所有API 浏览器 useFullscreen全屏展示 isFullscreen 当前是否是全屏 toggle 是函数直接调用即可 const isF
Visual Studio 2022 创建C++项目

打开Visual Studio 创建新项目选择平台选择空项目点击下一步设置项目名称以及指定项目文件位置点击创建创建成功后如下图在源文件中添加代码文件写入代码运行代码 F5 运行结果界面如下图所示
c语言模板类,C++类模板（Class Template）

C 除了支持函数模板还支持类模板 Class Template 函数模板中定义的类型参数可以用在函数声明和函数定义中类模板中定义的类型参数可以用在类声明和类实现中类模板的目的同样是将数据的类型参数化声明类模板的语法为 templat
深度学习论文精读[9]：PSPNet

场景解析 scene parsing 是语义分割的一个重要应用方向区别于一般的语义分割任务场景解析需要在复杂的自然图像场景下对更庞大的物体类别的每一个像素进行分类场景解析在自动驾驶和机器人感知等方向应用广泛但由于自然场景的复杂性语
在Windows 10上安装TensorFlow及PyCharm开发环境

有时候在查看官方文档时常常看到很多的分支所以作为开发者我们都喜欢把最佳实践总结出来下面一起来看看如何在Windows 10上安装一个TensorFlow和PyCharm开发环境安装Anaconda 安装Anaconda以后即可获得
Image Super-Resolution Using Very Deep Residual Channel Attention Networks

因为我是语义分割方向对图像超分辨率不了解这里简单记录一下读论文的收获论文地址超分辨率的输入是低分辨率最终恢复超分辨率图片作者发现低分辨率的图片拥有丰富的低频细节对应图像中大块的平坦区域然而低分辨率的每个通道在处理时候总是平等
depot_tools安装过程

depot tools安装过程使用torserviseSVN 1 6 6版本移除其它版本 Install the depot tools Chromium and Chromium OS use a package of scripts
数据结构——线性表(C++)

一前言数据结构在逻辑结构上分为线性和非线性例如链表顺序表串数组都是线性的他们的特点就是一对一而非线性结构比如图和二叉树他们的对应关系是一对多多对多这里介绍线性表的顺序表和链表循环链表和双向链表还有双向循环链表链表
关于springboot profiles

在项目中会遇到项目环境变量切换到的问题但是主要配置相同只想切换部分的配置可以在application yml配置所有的环境变量然后在application dev yml配置dev中的环境变量如果dev中没有配置会读取applic
tan x x的matlab求解,matlab画x=tan(x)

matlab怎么解非线性方程如tan x 4x x 2 4 equ sym tan x 4 x x 2 4 x solve equ gt gt xx 0再问这只能求出一个解啊再答还有其他解吗 matlab 求解tan x x 1 0
Rotated_Faster_Rcnn

rotated faster rcnn 文章目录训练 rpn head forward train rpn head forward rpn head loss rpn head get bboxes roi head forward t
mysql绿色版安装与卸载

第一步下载Mysql 官网下载地址 https dev mysql com downloads mysql 1 鼠标滑下来找到Other Download中的 Windows x86 64 bit ZIP Archive 点击其右边的D
第32步机器学习分类实战：SHAP

继续填坑这回到SHAP 这个是选修有兴趣可以看看我们建立了十个ML模型如果选出了Xgboost LightGBM Catboost这种树模型大概率也是这些最厉害了那就可以用SHAP进行模型可视化 1 首先使用pip insta
解决“The debugger has set two breakpoints at the same address 0x08xxxxx”问题

今天来分享一个前段时间做项目适合遇到的一个bug 正好今天有空就拿出来跟大家分享一下错误首先大家直接来看这个错误提示这个错误是我在使用J Link调试时候出现的上面的意思是调试器在同一地址设置了两个断点但是我检查了整个工程也没
数据结构编程回顾（五）交通咨询系统设计

题目五交通咨询系统设计设计要求设计一个咨询交通系统能让旅客咨询从任一个城市到另一个城市之间的最短路径里程最低费用或者最少时间等问题对于不同的咨询要求可以输入城市间路程所需时间或者所需费用设计分3 个部分 1 建立交
QT connect第五个参数

一介绍 1 Qt AutoConnection 默认连接连接类型在信号发出时确定如果接收者和发送者在同一个线程使用Qt DirectConnection类型如果接收者和发送者不在一个线程则使用Qt QueuedConnectio
管理概论笔记

前言本文章属于在听课时做的笔记第一周管理导论来源管理概论浙江大学邢以群 MOOC 学习理论的目的是为了能够做没有学过的人做不了的事情或者比他们做得更好一管理及其功能介绍什么是管理以及为什么需要管理观念决定行为行为决定
GBDT的正则化及与XGBOOST区别

1 GBDT的正则化和Adaboost一样我们也需要对GBDT进行正则化防止过拟合 GBDT的正则化主要有三种方式第一种是和Adaboost类似的正则化项即步长 learning rate 定义为对于前面的弱学习器的迭代 fk

GBDT的正则化及与XGBOOST区别

GBDT的正则化及与XGBOOST区别 的相关文章

随机推荐

热门标签

GBDT的正则化及与XGBOOST区别的相关文章