楼主: huixingzhijia
跳转到指定楼层
上一主题 下一主题
收起左侧

求问大家一道长问题,如何处理categorical变量很多level问题,比如state

 
🔗
albeehere 2019-7-4 13:46:14 | 只看该作者
全局:
请教lz一下呢,如果是target encoding,假设train里面每个state有一个比例的数值,test里面还是用一样的数值吗?如果test有train里面没有出现的state,怎么处理?

categorical很多level,我感觉是one hot encoding+pca,如果是像state这样没有大小含义的又不适合用integer encoding的
回复

使用道具 举报

🔗
drenched 2019-7-4 18:34:21 | 只看该作者
全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies

评分

参与人数 15大米 +49 收起 理由
Yana + 1 给你点个赞!
sanmao0715 + 1 赞一个
luckyPidgey + 1 赞一个
yshaw + 1 赞一个
ShikiH + 2 给你点个赞!

查看全部评分

回复

使用道具 举报

🔗
 楼主| huixingzhijia 2019-7-4 21:31:07 来自APP | 只看该作者
全局:
liyuan 发表于 2019/07/04 18:34:21
我觉得你的理解已经很好了 我觉得有以下几点或可一试
1. 只对train做target encoding 如果test里面有新的类出现 一种方法是可以把新类的值设成一个很小的数(这里借用了Naive...

谢谢谢谢 太牛了。看你是统计phd 好厉害
回复

使用道具 举报

全局:
但我还是觉得embedding也很说得通呢,虽然要求大样本而去不是很统计
回复

使用道具 举报

无效楼层,该帖已经被删除
🔗
currant 2019-7-6 04:35:16 | 只看该作者
全局:
不知道楼主有没有搜到这个帖子 https://www.reddit.com/r/Machine ... _variable_encoding/
回复

使用道具 举报

🔗
ZYYYZ 2019-7-6 04:54:21 | 只看该作者
全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies
回复

使用道具 举报

🔗
冰吧ip哥 2019-7-6 06:59:55 | 只看该作者
全局:
X^2 分箱,合并
回复

使用道具 举报

全局:
huixingzhijia 发表于 2019/07/04 21:31:07


谢谢谢谢 太牛了。看你是统计phd 好厉害
. Χ
感觉类似state的categorical variable可以被某种numerical替代?比如average income,population density等等
回复

使用道具 举报

全局:
别想太多…直接string encoding
扔进xgboost直接当做numberic来处理
相信我 效果惊人
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表