查看: 1352| 回复: 13
跳转到指定楼层
上一主题 下一主题
收起左侧

打卡贴:Reinforcement Learning,CS294,Berkeley,Fall 2018

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由 nunuh89 于 2018-11-8 23:32 编辑

之前在另外一个区发求队友贴,好像发错地方了

在机器学习区再开个贴吧,自己打卡,然后继续求队友。

这个是课程网站:http://rail.eecs.berkeley.edu/deeprlcourse-fa17/index.html,上面有视频加PPT,还有作业。最后再撸个project

我的联系邮箱,st19930921@gmail.com

评分

参与人数 1大米 +3 收起 理由
Dorothy1995 + 3 给你点个赞!

查看全部评分


上一篇:ML 斯坦福 Andrew NG打卡贴 需要监督
下一篇:分享一篇文章:如何在每次训练都得到相同的word2vec/doc2vec/paragraph vectors
推荐
Dorothy1995 2018-11-8 05:47:59 | 只看该作者
全局:
Update一下我的进度:
11.06: lecture 6看完了,总结一下就是:
1. Fitted Value Iteration: forget policies, compute value directly,用神经网络fit V(s), 前提是知道 transition dynamics
2. Fitted Q Iteration: Compared to value iteration是在不知道transition dynamics的情况下,用神经网络fit Q(s, a)
3. Converge or not:For value iteration with function approximation: always converge if transitions are known and might not converge for non-tabular cases; Q-iteration does not converge with function approximation

评分

参与人数 1大米 +5 收起 理由
Shen.TT + 5 给你点个赞!

查看全部评分

回复

使用道具 举报

推荐
 楼主| Shen.TT 2018-11-15 05:42:45 | 只看该作者
全局:
Dorothy1995 发表于 2018-11-15 05:06
楼主进度不错啊,我前几天看完了Q-learning,那个Overestimation in Q-learning 和double Q-learning有点奇 ...

可以可以

我现在在看Lec 10了

下周感恩节要出去玩,估计没啥时间看,回来时候咱俩进度估计差不多了,到时候开始看作业

评分

参与人数 1大米 +3 收起 理由
Dorothy1995 + 3 给你点个赞!

查看全部评分

回复

使用道具 举报

推荐
 楼主| Shen.TT 2018-11-8 06:07:40 | 只看该作者
全局:
Dorothy1995 发表于 2018-11-8 05:47
Update一下我的进度:
11.06: lecture 6看完了,总结一下就是:
1. Fitted Value Iteration: forget polic ...

进度差不多,我lec 7 看到一半。他这节就是在讨论Q-learning的收敛问题。

等等可以讨论下HW 1&2.

评分

参与人数 1大米 +3 收起 理由
Dorothy1995 + 3 不错不错

查看全部评分

回复

使用道具 举报

🔗
Dorothy1995 2018-11-6 07:12:56 | 只看该作者
全局:
楼主太棒了!我也准备近期学习RL,刚刚研究了一下这个CS294,看起来还不错,想报个名一起学习!
回复

使用道具 举报

🔗
 楼主| Shen.TT 2018-11-6 08:31:17 来自APP | 只看该作者
全局:
Dorothy1995 发表于 2018/11/06 07:12:56
楼主太棒了!我也准备近期学习RL,刚刚研究了一下这个CS294,看起来还不错,想报个名一起学习!

不错不错,终于找到小伙伴一块学了

你看到lecture 几了?

评分

参与人数 1大米 +3 收起 理由
Dorothy1995 + 3 给你点个赞!

查看全部评分

回复

使用道具 举报

🔗
Dorothy1995 2018-11-6 08:41:20 | 只看该作者
全局:
Shen.TT 发表于 2018-11-6 08:31
不错不错,终于找到小伙伴一块学了

你看到lecture 几了?

看完了第五个lecture,讲Actor-critic那个,听的时候感觉明白了,但是可能还要再推敲推敲,你看到哪里了,要不要交流一下呀
回复

使用道具 举报

🔗
 楼主| Shen.TT 2018-11-6 09:40:03 来自APP | 只看该作者
全局:
Dorothy1995 发表于 2018/11/06 08:41:20


看完了第五个lecture,讲Actor-critic那个,听的时候感觉明白了,但是可能还要再推敲推敲,你看到哪里了,要不要交流一下呀

差不多,我到lec6. 以后可以一块在这个贴打卡????

评分

参与人数 1大米 +3 收起 理由
Dorothy1995 + 3 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
Dorothy1995 2018-11-6 13:55:02 | 只看该作者
全局:
本帖最后由 Dorothy1995 于 2018-11-6 13:58 编辑

好啊!对了这里有一个post,简要介绍了RL的每个分支和经典算法模型,学的时候可以参考一下:https://lilianweng.github.io/lil-log/2018/02/19/a-long-peek-into-reinforcement-learning.html

评分

参与人数 1大米 +3 收起 理由
Shen.TT + 3 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
 楼主| Shen.TT 2018-11-9 06:01:25 | 只看该作者
全局:
好消息!刚刚发现2018 Fall的lecture Video 出来了

可以开始看2018的video了

那么问题来了,怎么改帖子标题?

评分

参与人数 1大米 +3 收起 理由
Dorothy1995 + 3 可以

查看全部评分

回复

使用道具 举报

🔗
Dorothy1995 2018-11-9 06:20:59 | 只看该作者
全局:
赞!能看最新的还是更好~

你试试帖子最下面的有没有可以点的编辑,我的回帖能看到那个编辑选项

评分

参与人数 1大米 +5 收起 理由
Shen.TT + 5 给你点个赞!

查看全部评分

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表