回复: 10
跳转到指定楼层
上一主题 下一主题
收起左侧

Machine Learning Design的框架,欢迎讨论

   
全局:

2020(7-9月) MachineLearningEng 硕士 全职@meta - 猎头 - 视频面试  | | Other | 在职跳槽
本帖最后由 wwx_27 于 2020-10-2 23:40 编辑

自己整理了一个Machine Learning System Design的基础框架,从preprocessing到最后model evaluation,以page recommendation为例,欢迎大家讨论,补充跟指正。

Scenario: Clarify question/senario/feature/background
System goal: Clarify metrics

Data extraction:
1.target variable construction:
•        Deduplication
•        EDA(0,1 ratio), imbalance data
2. Feature engineering:
•        What should be feature: page metadata, user metadata, friend metadata
•        Important feature distribution

Preprocessing(why preprocess): 1. Text embedding 2. Categorical feature 3. Date Parse 4. Missing value 5. Outlier detector

Model selection: There are 3 widely-use classification model
Logistic regression is a linear classifier(linear combination + sigmoid function(Monotonically increasing)). The model output
您好!
本帖隐藏的内容需要积分高于 188 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 188 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies
le data set.
Model Calibration if necessary.
  • Online evaluation
Before model deployment, I would do a A/B test to compare existing policy and using new model as recommendation policy.
Metrics: num of like
Two proportion sample test, z statics, 5% significant level

Model iteration:
•        Batch model: monthly retrain, better solution is to monitor AUC
•        Online retrain: using latest hour/daily data to partially update model parameter (add a tree with smaller learning rate)












本帖子中包含更多资源

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x

评分

参与人数 27大米 +36 收起 理由
bushimajia + 1 很有用的信息!
asyz13jinage + 1 很有用的信息!
lyft + 2 给你点个赞!
tensorboy + 1 赞一个
dustbin + 2 给你点个赞!

查看全部评分


上一篇:IBM Data Scientist - Chief Analyst Office
下一篇:databricks 新鲜面经

本帖被以下淘专辑推荐:

推荐
yangshao 2020-10-28 03:21:56 | 只看该作者
全局:
wwx_27 发表于 2020-10-4 23:25
Normalize data只在linear model中比较有用,比如linear regression和logistics regression,不过欢迎继 ...

nn里也需要,不然loss shape会比较难看,优化起来困难。
回复

使用道具 举报

推荐
 楼主| wwx_27 2020-10-4 23:25:00 | 只看该作者
全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies

评分

参与人数 1大米 +1 收起 理由
biorainy + 1 赞一个

查看全部评分

回复

使用道具 举报

地里匿名用户
推荐
匿名用户-VYUYU  2020-10-4 08:45:02 来自APP
Preprocessing 可能还需要做standardization跟normalize data
回复

使用道具 举报

全局:
谢谢楼主分享干货
回复

使用道具 举报

🔗
jxlin 2020-10-3 05:20:06 | 只看该作者
本楼:
全局:
Thank you!!
回复

使用道具 举报

🔗
jimmy12day 2020-10-7 08:34:55 | 只看该作者
全局:
谢谢分享,干活满满
回复

使用道具 举报

全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies
回复

使用道具 举报

🔗
transcendence 2020-10-28 01:43:07 | 只看该作者
全局:
Data generation 这块可能还要考虑下用什么data 做training, label 是什么,
Metrics 这块如果是个ranking problem, 那就不仅是AUC,要用些专用的metric 比如 MAP@K , NDCG
回复

使用道具 举报

🔗
 楼主| wwx_27 2020-10-28 02:00:52 | 只看该作者
全局:
transcendence 发表于 2020-10-28 01:43
Data generation 这块可能还要考虑下用什么data 做training, label 是什么,
Metrics 这块如果是个rankin ...

ranking problem值得仔细讨论,欢迎添加NDCG的细节
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表