楼主: pentilm
跳转到指定楼层
上一主题 下一主题
收起左侧

Yann LeCun表示ChatGPT缺乏创新

   
🔗
tytz 2023-1-25 05:14:37 | 只看该作者
全局:
YAMWD 发表于 2023-1-24 08:51
真诚发问,为什么这样的提升是“很显然不可持续的”?到现在来说,transformer类大模型的潜力天花板应该还 ...

堆数据/堆参数确实能提高效果,但是问题是需要多少呢。按照现在的路线,把地球烧了都不一定能train出来AGI。GPT3系列(包括ChatGPT)已经非常昂贵了。
回复

使用道具 举报

🔗
fsss1729 2023-1-25 05:44:48 | 只看该作者
全局:
本帖最后由 fsss1729 于 2023-1-24 16:50 编辑

推荐一篇paper: Emergent abilities of large language models. 里面很多关于大模型的实验结果都挺有趣。

尽管楼里有人觉得这种靠堆FLOPS/model perpelxity的方式是不可持续的,但至少这个方向在研究里还是现在学术界的方向之一。在大模型身上的unseen capabilities其实某种程度上改变了NLP研究,比如无论怎样精细finetune过的模型在其专精领域表现也不如general训练过的大模型。学术界本身和工业界就有gap,目标不同。这个路线也不是单一的,scaling up有好处,RLHF也有好处,未来肯定也有相关的方法论,让我们抵达更高智能模型的FLOPS是sublinear增长的。

这也导致很可能未来的人工智能市场确实就是有能力训练大模型的公司来提供这些接口,而其他公司不再需要自己从头开始训练,build upon foundation models, 做一些很小的改动就会有很好的效果,也算是降低AI新型应用研发的边际成本。
回复

使用道具 举报

🔗
tytz 2023-1-25 06:05:05 | 只看该作者
全局:
fsss1729 发表于 2023-1-24 13:44
推荐一篇paper: Emergent abilities of large language models. 里面很多关于大模型的实验结果都挺有趣。
...

"至少这个方向在研究里还是现在学术界的方向之一" 这很对,事实上lecun的批评和我上面说的都不是否定LLM或是GPT的存在意义。他们很有意义,问题在于overhyped。overhype带来的对于某条路线的盲目乐观可能会导致资源的不合理倾斜和浪费。
回复

使用道具 举报

🔗
tytz 2023-1-25 06:06:41 | 只看该作者
全局:
fsss1729 发表于 2023-1-24 13:44
推荐一篇paper: Emergent abilities of large language models. 里面很多关于大模型的实验结果都挺有趣。
...

以及“无论怎样精细finetune过的模型在其专精领域表现也不如general训练过的大模型”这点在绝大多数task上都不成立。
回复

使用道具 举报

🔗
sub240 2023-1-25 06:29:17 | 只看该作者
全局:
tytz 发表于 2023-1-24 17:05
"至少这个方向在研究里还是现在学术界的方向之一" 这很对,事实上lecun的批评和我上面说的都不是否定LLM ...

很认同兄台的看法! 这个浮躁的年代。。。
回复

使用道具 举报

🔗
renlong30 2023-1-25 07:52:36 | 只看该作者
全局:
Integer23 发表于 2023-1-23 22:43
这么说Iphone 也就是个just engineered well 的手机而已。呵呵

从research的角度来说,某种意义上是对的。。。
回复

使用道具 举报

🔗
renlong30 2023-1-25 07:53:11 | 只看该作者
全局:
Yueyugu 发表于 2023-1-23 22:31
我猜楼上疯狂diss Lecun的都不是做ML的业内人吧?

我很赞同Lecun的观点,LLM从resear ...
业内人士表示同意hhh没问题啊
回复

使用道具 举报

全局:
这种轻视engineering的文化也是FAIR影响力越来越弱的重要原因。一个gpt3复现做了那么久也是工程能力不足的体现。
回复

使用道具 举报

🔗
nocriz 2023-1-25 08:35:37 | 只看该作者
全局:
yedkk 发表于 2023-1-24 13:41
只要现在还是黑箱炼丹,就做不成强人工智能,能做出来一个看起来还行,但是根本不能细究的回答机器。

人类基本上也是这样。
回复

使用道具 举报

全局:
harrybob 发表于 2023-01-24 16:34:12
这种轻视engineering的文化也是FAIR影响力越来越弱的重要原因。一个gpt3复现做了那么久也是工程能力不足的体现。
你提到了LLM的一个巨大问题,就是性能难以复现。这也是Lecun说的没毛病的原因之一:现在的LLM是一轮一轮大量的训练得到的某个还不错的ckpt, 但你用一样的模型一样的方法训可能就出不来一样的效果。你可以理解为摇骰子摇出来了一个6,和你需要一遍一遍摇骰子的再摇出下一个6。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表