12
返回列表 发新帖
楼主: axyx
跳转到指定楼层
上一主题 下一主题
收起左侧

立Flag上UCL David Silver的Reinforcement Learning

🔗
阿钟 2020-3-28 10:58:55 | 只看该作者
全局:
本帖最后由 阿钟 于 2020-3-28 11:05 编辑
axyx 发表于 2020-3-28 02:31
Lecture 2上完了。话说这课难道没有作业吗?还是假设所有人对这些东西都特别熟,上上课就完了?
然后看Sut ...

我感觉那个kaggle就是训练一个alphago similar的就可以了
但是maybe that's an overkill

Silver这个课就是很 很  很 basic的传统RL
正经的trick他当然也不会讲,什么Deep rl之前是怎么对continuous domain做function approximation啊,option啊什么的。deep rl之后出现了很多不同的算法,具体你可以看看sergey levine的cs285,但那也不全(没有ppo),反正还是得看paper……然而看paper也没用,实际能跑的算法库比如baseline,spinning up,写得都很成熟的,不用自己造轮子,然而看看别人造的轮子我还是emmm吧哈哈哈(逃跑


我们在学校上课的时候project是replicate一篇paper hhh

另外 Sutton的书有练习 和text混在一起
想说的是RL水深,Silver入门不错


评分

参与人数 1大米 +1 收起 理由
axyx + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
 楼主| axyx 2020-3-29 01:35:17 | 只看该作者
全局:
阿钟 发表于 2020-3-28 10:58
我感觉那个kaggle就是训练一个alphago similar的就可以了
但是maybe that's an overkill

豁然开朗。怪不得Silver这课也是主要做一个大作业就行。可见搞清楚基本框架后面就是不断的code,在实际问题和看paper中学。

话说为啥我认识的搞RL的都是统计大牛,害得我一直以为是个对建模要求特别高的课,果然是抽样偏差?ToT
回复

使用道具 举报

🔗
阿钟 2020-3-29 01:57:38 | 只看该作者
全局:
axyx 发表于 2020-3-29 01:35
豁然开朗。怪不得Silver这课也是主要做一个大作业就行。可见搞清楚基本框架后面就是不断的code,在实际问 ...

RL发展到今天,如果你不是搞各种算法(就是如何update你的function approximator)的话,就是在搞应用。
要用RL解决问题,主要写码有两块,一块是environment 和agent的交互,一块是如何update 比如说function approximator,或者Q table啊之类的。一般是分开来的。

如果真的有兴趣,open ai的spinning up也是一个很好的source。
https://spinningup.openai.com/en/latest/index.html

回复

使用道具 举报

🔗
 楼主| axyx 2020-4-4 07:12:47 | 只看该作者
全局:
我去看看spinning up。environment和agent的交互这种应该轮不到我一个scientist来写,应该是engineer写了。

终于上完了第三个lecture,进度跟预期比较接近。
那天跟人讨论RL的应用问题,说组里很多东西都是按照prediction再加rule来做,然后有resource constrain。还没想明白RL在这种地方到底有没有实际应用的价值。特别我们组data feedback loop很长,要知道一个experiment有没有用,要等5-6个星期数据才会mature,感觉好悬。

回复

使用道具 举报

全局:
axyx 发表于 2020-4-4 07:12
我去看看spinning up。environment和agent的交互这种应该轮不到我一个scientist来写,应该是engineer写了。 ...

感觉这种RL可能不是很好做,RL sample efficiency是在太低,Loop 太长了估计不好办。
不知道这种情况之下Beyesian Opt好不好做?

评分

参与人数 1大米 +1 收起 理由
axyx + 1 给你点个赞!

查看全部评分

回复

使用道具 举报

🔗
 楼主| axyx 2020-4-8 05:56:35 | 只看该作者
全局:
轮到我来申请了 发表于 2020-4-5 07:56
感觉这种RL可能不是很好做,RL sample efficiency是在太低,Loop 太长了估计不好办。
不知道这种情况之 ...

Beyesian Opt大约是长啥样?不断update?假设task是减少退货率。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表