查看: 2866| 回复: 15
跳转到指定楼层
上一主题 下一主题
收起左侧

请问为什么ensemble各种模型,能提高性能呢

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
把不同的模型混合后,为何能提高性能呢?
理论依据是什么?

个人感觉,混合模型的性能最高不能超过最高的那个性能。大家认为呢?

假设3个模型A,B, C
ensemble(A,B,C) <= max(A, B, C)

如何理论证明 ensemble(A,B,C) > max(A, B, C)

上一篇:有朋友拼九章9.9刀的knn/cnn项目课嘛?
下一篇:有老师能带我pytorch pair coding吗?有偿
全局:
variance降低了有的bias提高了
回复

使用道具 举报

推荐
 楼主| microsat 2022-12-5 03:01:15 | 只看该作者
全局:
本帖最后由 microsat 于 2022-12-4 13:03 编辑
penolove427 发表于 2022-12-4 11:02
印象中 average ensemble model 的期望值 >= single model的期望值 有證明的

其实,大家能汇报一下自己亲自ensemble后的性能,是否提高。不就相当于证明了吗?
如果10个人,9个回复,性能不见得提高,顶多就是最高性能。
那就是最好的证明。

所以,请大家勇于将自己亲自实验的结果贴出来。

注意:我说的ensemble是所有的模型都是基于同一个数据。数据是x,模型A用的是数据x,模型B也是用数据x,模型C也是用数据x。
回复

使用道具 举报

推荐
 楼主| microsat 2022-12-1 03:32:19 | 只看该作者
全局:
yitu96001 发表于 2022-11-30 11:09
variance降低了有的bias提高了

请问大家在实际编程中,发现
的确ensemble能增大模型的性能吗?

我验证了几个。发现都是等于,最大性能的模型的那个性能。
也就是ensemble(A,B,C) = max(A,B,C).

并不能超越。

也就是说,根本没有必要搞这个ensemble,只需要用model selection选出一个性能最优的模型就可以了。

大家平常的试验,都是结果如何?
回复

使用道具 举报

全局:
一楼正解,可以看下bias和variance的trade off,这也只是解释,不算证明,因为ensemble不保证一定最好。我记得好像南大周志华很早就是做这个的。
回复

使用道具 举报

🔗
 楼主| microsat 2022-12-1 03:32:51 | 只看该作者
全局:
非著名农民 发表于 2022-11-30 11:48
一楼正解,可以看下bias和variance的trade off,这也只是解释,不算证明,因为ensemble不保证一定最好。我 ...

请问你的试验结果,发现能加强性能吗?还是不能?
回复

使用道具 举报

🔗
a49481 2022-12-1 03:36:29 来自APP | 只看该作者
全局:
这个有严格证明的,用到冯诺依曼MinMax定理。可以找一下相关的论文。

补充内容 (2022-12-01 03:38 +08:00):
简单的说就是只要你每个子模型的效果都好于瞎猜,集成模型的效果就会更好。
回复

使用道具 举报

全局:
microsat 发表于 2022-11-30 11:32:51
请问你的试验结果,发现能加强性能吗?还是不能?
我一个人的dp的好与不好,说明不了问题啊。但是Xgboost在Kaggle大杀四方是不争的事实。现在也越来越多model把多个dl结合在一起,但是如何结合,是个trick,这不就是bagging和boosting的区别
回复

使用道具 举报

全局:
我的理解是,主要有3 types of ensemble methods: 1. Bagging → mainly focused on reducing variance. 2. Boosting → mainly focused on reducing bias. 3. Stacking → mainly focused on reducing bias. 他们ensemble的原理不一样

求加米看面经
回复

使用道具 举报

🔗
showei 2022-12-1 07:44:58 来自APP | 只看该作者
全局:
Ensemble的性能不光取决于单个模型的性能,还得看模型之间的差异性。如果发现ensemble的性能几乎等于best single model,可以试试进一步降低模型之间的correlation。
回复

使用道具 举报

🔗
(h_x) 2022-12-4 07:38:44 | 只看该作者
全局:
从实验验证ensemble效果的角度来说,random forest也是ensemble,在几乎所有情况下random forest性能都比single decision tree要好。这是因为single decision tree更容易overfit training data, bias & variance tradeoff中的bias小但variance大,难以generalize to test set。ensemble是通过weighting减少variance,从而让最终结果更generalizable。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表