📣 Back to School开学季 - VIP通行证5折优惠!蓝莓、Offer多多同步优惠
查看: 973| 回复: 6
跳转到指定楼层
上一主题 下一主题
收起左侧

regression问题如何“特别对待”预测值特定区间的modeling

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由 牧moon 于 2021-1-19 02:13 编辑

有一个拟合的问题困扰挺久的,比如一个regression问题,常规的loss可以是MSE,MAE,MAPE等等。比如训练数据预测y,y均匀分布在10到100,做一个常规的least square fitting,将y和y_pred plot出来,对于从10到100的y,abs(y-y_pred)应该差不多是一样的吧。如果特别想对某一个区间(比如40-60)让error比较小,而其他的区间error可以相对大一些,有没有特殊的loss函数或者一些trick去优化这个fitting的过程?我能想到的就是对这个区间的数据加一些权重,但是想了解一下统计中有没有哪个方面是研究这种问题的?自己不知道搜索的关键词。

还有一个问题就是,如果训练数据产生本身就有一定的分布,比如最常见的高斯分布,那么训练数据中某个区间的数据量就会比较大,可不可以用这个分布概率作为权重去修改loss,进而能够实现对某一个区间“特别对待”,去尽量优化这个区间的loss。可是某一个区间数据量比较大,假设真实情况的数据总是有一些error,那么数据量大的区间会不会因此fitting更难,这感觉有点悖论,因为我们是希望有更多的数据训练模型提高泛化能力的。每次想到这里就会卡住。

如果有了解这方面研究的小伙伴还请赐教,实现是不知道这个研究的关键词是什么,自己搜索了很久也没有找到合适的资料或者文献。谢谢!
. 1point 3 acres

补充内容 (2021-1-19 07:31):. ----
或者说,我可以认为落在这个高斯分布90%之外的数据点是outlier而将它们从训练数据中移除?
-baidu 1point3acres
补充内容 (2021-1-19 07:32):
再想想与classification比较一下,这也类似于unbalance数据,常规操作downsample oversample,是否可以借用到regression问题中?

上一篇:如何weighted sample without replacement
下一篇:文科转data science !!! 求助!!data science certificate
🔗
achromatic 2021-1-19 06:25:07 | 只看该作者
全局:
第一个问题,可以看一下M-Estimator

第二个问题(也包括第一个问题),都可以考虑GLM Model, 选取不同的random components (response variable的分布,例如分类选binomial distribution、interval可以考虑Beta distribution).
回复

使用道具 举报

🔗
 楼主| 牧moon 2021-1-19 07:36:04 | 只看该作者
全局:
achromatic 发表于 2021-1-19 06:25
第一个问题,可以看一下M-Estimator

第二个问题(也包括第一个问题),都可以考虑GLM Model, 选取不同的 ...

谢谢你的回复,我要去研究一下M-estimator。
对于GLM,我的理解是可以基于不同的random component建立不同的model,比如最常见的logistic regression就是一个例子,但是如果不使用GLM这类model,比如使用tree或者neural nets,那第二个问题该如何解决呢?或者我没有理解对你的想法?
回复

使用道具 举报

🔗
achromatic 2021-1-19 09:36:38 | 只看该作者
全局:
牧moon 发表于 2021-1-19 07:36
谢谢你的回复,我要去研究一下M-estimator。
对于GLM,我的理解是可以基于不同的random component建立不 ...

关于第二个问题,对于GLM的理解是对的。你提到tree model,个人理解不需要修改loss,因为本来就是nonparameter model,模型自身就能够适应数据的分布。NN没有深入研究过。
回复

使用道具 举报

全局:
1. 楼主想讲的是weighted least squares?

2. 有点不太懂,既然某个区间样本多,那么自然在loss上所占的权重就大了;另外把outliers扔掉还是挺危险的一个事情;或许lz想要考虑用spline regressino?
回复

使用道具 举报

🔗
 楼主| 牧moon 2021-1-19 12:22:58 | 只看该作者
全局:
本帖最后由 牧moon 于 2021-1-19 12:31 编辑
鸡籽就是大王 发表于 2021-1-19 11:21
1. 楼主想讲的是weighted least squares?

2. 有点不太懂,既然某个区间样本多,那么自然在loss上所占的 ...

谢谢你的回复,我想到的也是weighted ls这类的方法,只不过linear model在我的这个数据表现并不好,tree和neural net的表现要更好,于是我想问问看除了使用weight改变权重,还有没有其他的方法可以有”针对性“的改善某个预测区间的准确度?
以前没有考虑过这样的情况,但是最近遇到一个问题,训练一个model时不知道什么时候这个model被用到,所以自然而然的用所有的训练数据训练并且算出mean error去评价模型,但是实际应用中90%的时候都在y的一个区间做预测,用不到训练数据时的全部y,所以我想,那么能不能针对这个预测范围对model进一步优化呢,或者甚至是有针对性的重新训练一个model?统计中有没有研究这种问题的方向呢?不知道有没有说清楚。
你提到的既然某个区间样本多,那么自然在loss上所占的比重就大,这很有道理。那么既然这个区间数据多,minimize应该更加重视这个区间,而且数据多泛化能力应该强,可是为什么在用MSE作为loss拟合后数据多这个区间的MSE更大呢?相当于给整体的MSE“拉了后腿“。于是我想是不是这个区间虽然数据多,但是数据中由于各种无法model的因素产生的error(random error/noise)也多,反而导致了fitting变难了,降低了泛化能力。我就卡在这里走不出去了



回复

使用道具 举报

全局:
牧moon 发表于 2021-1-19 12:22
谢谢你的回复,我想到的也是weighted ls这类的方法,只不过linear model在我的这个数据表现并不好,tree ...

我感觉有两种因素,一个是heterogeneous variance(类似于中间宽,两头窄),也就是你说的中间error更多;另外一个是model的问题,就是这个model可能太简单了;虽然两头的数据不多,但是leverage大 对斜率影响大,所以把中间的predicted values给玩坏了;. ----

如果是单纯的1,WLS应该可以解决;如果2的比重比较大,可以考虑换个model或者试试spline regression
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表