楼主: jojozheng
跳转到指定楼层
上一主题 下一主题
收起左侧

Machine Learning 一周一个algorithm打卡!

🔗
facebbook 2019-8-16 00:15:49 | 只看该作者
全局:
NG的几门课都很好,大家不要错过。
回复

使用道具 举报

全局:
加油~~~~正准备自学ml
回复

使用道具 举报

🔗
 楼主| jojozheng 2019-8-17 01:15:33 | 只看该作者
全局:
8.16 关于cost function思考
随着对ML思考加深和工作实践,发现做模型有时候有点玄学。发现对行业的理解真的非常重要,所以business sense真不是一天两天可以达成的。所以有喜欢的industry了早点入行,真的是一件好事。 毕竟技术是一辈子要不断学习的一天也少不了。
没有行业经验, 很难选择恰当的模型甚至在了解数据这一块都要很长一段时间。 俗称抓瞎。
当完全了解business problem,选择regression还是classification这是思考的起点,其次要充分掌握数据特征(这还得多下功夫多接项目),选择合适的cost function。
例如regression problem中
-----如果数据有outlier就会让RMSE大于MAE。 因为RMSE会penalize outlier。 同时value需要跟target (range)进行对比, 不能单看value大小。 最好把两个一起拿出来对比才可以更好做出选择,还有看你是否希望让outlier impact更多。(sigh,又是考对business problem的理解了。。。。)
-----R square/adjust R square 可以单看value得知模型的好坏, 毕竟value在(0,1)之间。 但是R会随着input variable increase而是模型看起来好, adjustedR则penalize 新加入的variable。
----- F test hypothesis null是未用于model的variable result比用 variable的result好。。如果reject了null hypo则还好, 没的话。。(目前还没有接触)
regression cost function:
https://becominghuman.ai/underst ... etrics-bdb0e7fcc1b3
https://medium.com/human-in-a-ma ... better-e60ac3bde13d

例如classification problem:
---- accuracy/ accuracy paradox
----confusion matrix: TP, FP, TN, FN。 例如癌症检测, 你不会希望预测没病的人最后换上癌症, 所以宁愿抓错没病的也不能放过一个有病的。这时候accuracy将不是最重要的考量,而是FN的准确性。
https://towardsdatascience.com/accuracy-paradox-897a69e2dd9b
https://becominghuman.ai/underst ... etrics-cad56f2da3aa
https://towardsdatascience.com/m ... -models-a7b1b00ba60

cost function in math
https://www.youtube.com/playlist ... PMRicPbEvLyZe-7b-GT








评分

参与人数 1大米 +5 收起 理由
K叔 + 5

查看全部评分

回复

使用道具 举报

🔗
zwayhoho 2019-8-17 16:46:21 | 只看该作者
全局:
加油楼主 我也在努力中
回复

使用道具 举报

🔗
 楼主| jojozheng 2019-8-22 10:58:05 | 只看该作者
全局:
8.21 抓虾中看起了周志华机器学习。看完绪论和第一章模型评估和选择
2.1 经验误差: 1-a/m (a: 错误样本, m数据大小) ; 过拟合over fitting: 算法学的太好不行因为把样本特殊性当成了泛化性。算法学的太烂也不行underfitting
2.2 评估方法:
hold out 就是分train/test ;可多次划分多次训练
k-fold cv  (loo), 把数据分为K set, 每个set之间是mutually exclusive的, 每次学习 k-1个set, 留下1个set测试结果,一共这么学习k次。 K 个测试结果平均值得出最终结果。
这两方法的训练集大小小于数据集本身大小会导致误差, 为克服不同size数据集而造成的误差,引进bootstrap。
bootstrap是假如数据size m, 每次从选出一个sample放进新的set,然后放回原来的set,就这么重复取直到新set的size达到跟原本数据一样大小m。 就这么重复n次,就会有n个新set。 重点此方法克服了数据大小不同而导致的差异,同时样本可重复选择。即便是量扩大了,仍然有大约1/3的数据不会被选,正好用于test。
2.3 performance measure
regression problem: MSE之类
classification problem: confusion matrix (precision/recall /P-R curve/F-1), cost matrix (根据代价的不同而考虑总体代价最小), ROC/AUC (比面积大小,交叉则比较BEP)
2.4 比较检测 。假设检验。。。真难。。。。(pending)
2.5 bias: y_pred vs. y_truth difference degree (fitness)
variance : 同样大小的training set的变动导致的学习performance变化。数据扰动造成的影响???
error : 数据本身问题

坚持
回复

使用道具 举报

🔗
 楼主| jojozheng 2019-8-27 02:28:47 | 只看该作者
全局:
zwayhoho 发表于 2019-8-17 16:46
加油楼主 我也在努力中

加油!一起努力!
回复

使用道具 举报

🔗
 楼主| jojozheng 2019-8-28 22:13:55 | 只看该作者
全局:
学algorithm怎么能只学编程不理解高等数学呢? 发现一个比较好的简要回顾derivative的网页
https://blog.csdn.net/sunbobosun56801/article/details/77892321
简明扼要
回复

使用道具 举报

🔗
 楼主| jojozheng 2019-9-11 22:39:04 | 只看该作者
全局:
度假回来上班啦! 继续每日更新学习内容 加油学习!

线性代数简介 写的挺好 refresh what ive learned at university

https://blog.csdn.net/sunbobosun56801/article/details/78292698
回复

使用道具 举报

🔗
Florence0909 2019-9-12 06:49:42 | 只看该作者
全局:
和楼主一起加油
回复

使用道具 举报

🔗
 楼主| jojozheng 2019-9-18 03:15:20 | 只看该作者
全局:

fighting!
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表