📣 Back to School开学季 - VIP通行证5折优惠!蓝莓、Offer多多同步优惠
查看: 3324| 回复: 23
跳转到指定楼层
上一主题 下一主题
收起左侧

如何把ID当成ML model input feature?

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
最近在看educative ML interview的课程,里面讨论tweet feed ranking问题,提到了把user id 和 tweet id当成feature的说法

user_id

This is a very simple feature used to identify users with very high engagement rates, such as celebrities and influencers.

tweets_id

This feature is used to identify Tweets that have high engagement and hence have a higher probability of engaging users.


对于这个,我不是太理解,为啥user id feature可以identify high engagement rates? ..

另外一个问题,也是跟id相关,比如model linkedin user,如何把user  在职的公司 当成一个feature使用?如果只有公司名称,怎么把其转化成feature来用呢?one_hot的话,维度就太大了。tensorflow提供这种hash backet的方法是业界比较认可的方法吗?https://www.tensorflow.org/api_d ... mn_with_hash_bucket

上一篇:组队准备Data Scientist的面试
下一篇:ProductSense + AARRR思维导图分享
推荐
Tyrant89 2021-1-22 16:41:25 | 只看该作者
全局:
做成embedding

评分

参与人数 1大米 +1 收起 理由
jiangyntz + 1 赞一个

查看全部评分

回复

使用道具 举报

推荐
 楼主| capybara9673 2021-1-28 14:07:49 | 只看该作者
全局:
川川唔 发表于 2021-1-28 13:40
我觉得有个帖子可能可以解答楼主在楼上提出的很多问题,比如怎么用word2vec训练embedding,比如怎么cluster ...

多谢推荐这篇paper

其实我本来想知道是id ·本身· 为什么可以作为feature?

我现在也没有找到答案,不过通过楼上这些讨论,我对embedding有了另外一些层次的理解。大致有三个方法. Χ
. From 1point 3acres bbs
1. 利用不同类型id之间的 “相关性” 生成embedding,比如 (user_id, tweet_id) interacted or not -> user_embedding * tweet_embedding, 对应的CF的matrix factorization

2. 利用同类型id之间的 “时序性” 生成embedding, 比如 浏览历史 (id1, id3, id5, id7) , 将其看作text,用word2vec 或者 更fancy的self attention bert 生成 embedding. From 1point 3acres bbs

3. 将id进行hash,让若干id变到同一个bucket下,用bucket id作为feature。除了降维,我还是不太理解这个操作的实际意义
回复

使用道具 举报

🔗
pliu19 2021-1-22 13:54:53 来自APP | 只看该作者
全局:
工业界的personalization可以用这种方式 做一个cross product就好了 一个model 还可以共享feature
回复

使用道具 举报

🔗
 楼主| capybara9673 2021-1-22 14:32:45 来自APP | 只看该作者
全局:
pliu19 发表于 2021-01-21 21:54:53. check 1point3acres for more.
工业界的personalization可以用这种方式 做一个cross product就好了 一个model 还可以共享feature
你说的这种方式是Id 当成feature ,怎么做cross product ,可以详细说明一下吗?
回复

使用道具 举报

🔗
brtt13 2021-1-23 00:09:10 来自APP | 只看该作者
全局:
It’s called embedding lookup...you should learn word2vec before reading other materials
回复

使用道具 举报

🔗
 楼主| capybara9673 2021-1-23 01:30:24 | 只看该作者
全局:
brtt13 发表于 2021-1-23 00:09
It’s called embedding lookup...you should learn word2vec before reading other materials

Why does word2vec apply to this situation? Neither CBOW nor Skipgram works here, since all the ids are permutable.
回复

使用道具 举报

🔗
 楼主| capybara9673 2021-1-23 01:32:44 | 只看该作者
全局:

能详细说一下怎么做embeddiing,输入输出是什么?输入输出都是id本身,类似于autoencoder那种方法吗?
回复

使用道具 举报

🔗
lliquid 2021-1-23 01:51:23 | 只看该作者
全局:
用 user id 做feature 要注意避免 data leakage problem https://www.cs.umb.edu/~ding/his ... ingInDataMining.pdf
回复

使用道具 举报

🔗
Tyrant89 2021-1-23 02:18:52 | 只看该作者
全局:
capybara9673 发表于 2021-1-23 01:32
能详细说一下怎么做embeddiing,输入输出是什么?输入输出都是id本身,类似于autoencoder那种方法吗?

你可以用collaborative filtering, matrix factorization等组成user2item之类的矩阵然后 svd出来做embedding输入到model中,或者用tf/pytorch之类的embedding_lookup功能直接end2end训练出来embedding
回复

使用道具 举报

全局:
本质是one hot encoding做成embedding,但全部id都用dim太大,所以一般要用hashing,比如zero collison hashing
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表