楼主: 阿钟
跳转到指定楼层
上一主题 下一主题
收起左侧

复习+刷题

🔗
 楼主| 阿钟 2019-12-25 08:50:29 | 只看该作者
全局:
12/24

lecture 12- 13

K-meansy algorithm
-assign centroid
-reevaluate centroid
Does K-means always converge: yes. but it has local optimal. you can run it multiple times.
Choosing k is somewhat subjective

EM(expectation maximization): (essentially, Maximum likelihood with latent variables)
E step: find Q(theta) such that we have a tight lower bound on L
M step: find theta that maximizes the lower bound.

can also be treated as coordinate ascent in J(Q, Theta)

EM for mixture of Gaussian, Naive Bayes(text clustering)

--
Factor Analysis: what if we have large dimension small set of example? restrict the space of covariance matrix sigma.
this is an EM with continuous variable.

也有参考李航蓝皮书
回复

使用道具 举报

🔗
 楼主| 阿钟 2019-12-26 10:25:49 | 只看该作者
全局:
12/25/2019

今天 lecture 14-15 老版cs229的unsupervised learning就讲完了.
新版的cs229加入了一些树的模型。deep learning,削弱了svm推导和RL。

unsupervised learning有两种 一种是probabilistic, 一种不是

前者包括 EM(实际上是一个算法不是具体模型)for Gaussian Mixture, Bayesian, Factor Analysis
后者包括 k means, PCA.

--

今天主要是PCA,(comparing to Factor Analysis(如上)) ICA.

PCA,求解maximum projection unit vector u given training data。这个其实就 k largest eigenvalue of empirical covariance matrix。该矩阵symmetric,所以前k一定有解。注意同样eigenvalue的eigenvector之间subject to permutation,所以不要赋予这些vector太多涵义。求解只需要SVD。

对data要preprocessing,i.e.  subtract mean, normalize variance to 1

应用就是降维啊什么什么的……

--

ICA,independent component analysis,假设有source,但只观测到x 如果x=As,需要找到W使得 s = W^-1x

px(x) = ps(W^-1 x) |W|,

write down log likelihood of data, do gradient descent.

有两个assumption,(1)这个原distribution不是Gaussian,因为Gaussian会有rotation symmetric的问题,原distribution可以用sigmoid(or laplacian),两个都have fatter tail。 (2) source data points are independent,这个在data够多的时候不是什么大问题,但sgd的时候可以permute data。


我个人觉得ICA不是很经常考。



明天撸一撸tree-based models

回复

使用道具 举报

🔗
 楼主| 阿钟 2019-12-27 12:53:10 | 只看该作者
全局:
12/26

ID3(信息增益) C4。5(信息增益比) CART
但是没有学习各种boosting bagging random forest blah blah……

看了一会儿统计
回复

使用道具 举报

🔗
 楼主| 阿钟 2019-12-28 15:43:56 | 只看该作者
全局:
12/27

仔细看了一下CART
然后看了一下random forest (1)bagging sample with replacement (2)random subset of features【避免有几个非常有影响力的feature导致tree correlated】  重点在于reduce variance and remain unbiased,when trees are not correlated。有几个树,这是可以tune的parameter。可以用random forest做feature importance。

学了一会儿统计
MLE of variance竟然是biased…… variance = 2nd momentum around mean != 2nd raw momentum.
z - confidence interval. interpretation of confidence interval. interval length wrt # of samples & confidence coefficient.
t - confidence interval (likely that we don't know sigma can't use z)

明天再看一看boosting

顺带说一句我觉得靠系统复习也有个尽头 比如说这些推导究竟要看到什么程度呢?所以我决定从今天开始driven by真题 lol……看见不会的就补
回复

使用道具 举报

🔗
 楼主| 阿钟 2019-12-29 16:43:04 | 只看该作者
全局:
12/28

十点多困得昏过去了 然后凌晨起来继续

看完了andrew ng deeplearning ai P44-67

Andrew 讲课是真的好。听过都说好。我deep learning说来惭愧,是在project上一边用一边学的,再系统看一下会比较好。
明天大概看看RNN和LSTM吧 感觉越复习越豁。

关于传统ML,我觉得讲得比较偏实践的课其实是youtube上非官方录制的一个caltech cs155……
已经决定放弃预习CRF, HMM MEMM = =
回复

使用道具 举报

🔗
 楼主| 阿钟 2019-12-30 11:45:16 | 只看该作者
全局:
12/29
连续几天没睡好 睡前打算不脑力消耗然后明天去学校

今天看了andrew ng deepleaerning ai RNN的第一周
主要是为了看一下LSTM的解释。
回复

使用道具 举报

🔗
 楼主| 阿钟 2019-12-31 12:23:03 | 只看该作者
全局:
12/30
leetcode 491/500

明天撸9题 但看样子只能做medium到这个数 hard估计不行。
回复

使用道具 举报

🔗
 楼主| 阿钟 2020-1-1 12:00:11 | 只看该作者
全局:
12/31

水leetcode水到500
从20号到今天我感觉自己过了一个小final……
回复

使用道具 举报

🔗
 楼主| 阿钟 2020-1-3 12:22:18 | 只看该作者
全局:
1/1 - 1/2
写了四个leetcode
重新复习ML
回复

使用道具 举报

🔗
 楼主| 阿钟 2020-1-9 10:19:27 | 只看该作者
全局:
哇的一声 好久没更新了

01/08

二次梳理ML
leetcode总数516
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表