123
返回列表 发新帖
楼主: huixingzhijia
跳转到指定楼层
上一主题 下一主题
收起左侧

求问大家一道长问题,如何处理categorical变量很多level问题,比如state

 
🔗
drenched 2019-7-7 16:57:56 | 只看该作者
全局:
本帖最后由 liyuan 于 2019-7-7 17:03 编辑
.1point3acres
祝你有好的offer
回复

使用道具 举报

🔗
novavistamn 2019-7-16 19:55:29 | 只看该作者
全局:
target encoding 可以通过smoothing来缓和过拟合,
比如:. Χ
(frequency of "1" + C)/(frequency of "1" + frequency of "0"). Waral dи,

这里C是一个hyperparameter
回复

使用道具 举报

🔗
慎独 2019-8-30 03:32:25 | 只看该作者
全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies
回复

使用道具 举报

🔗
w3e4NB 2019-10-31 23:24:19 来自APP | 只看该作者
全局:
面试官想得太多了…. 1point 3acres

对于 randomForest 来说,onehot 反而是缩小了每次 split 的搜索空间,把复杂度从 exponential 缩小到了 linear. 如果你控制树的深度不变,反而是自带 regularization 了。R 的 randomForest 的包默认遍历所有可能的子集,这个可比 onehot encoding induce 出来的搜索空间大
回复

使用道具 举报

🔗
w3e4NB 2019-10-31 23:26:57 来自APP | 只看该作者
全局:
还有一点:level 多在有些问题里面很自然。比如 mixed effect model 里面,经常出现 random effect 的 level 比 fixed effect 的要多。只要你用对了模型(别用错成了 fixed effect)并不是大问题。大家反而会关心 fixed effect 的层级不够多,导致算法收敛结果不稳定。
回复

使用道具 举报

🔗
ccqqw 2021-1-13 07:05:49 | 只看该作者
全局:
good question !
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表