📣 Back to School开学季 - VIP通行证5折优惠!蓝莓、Offer多多同步优惠
楼主: 匿名
跳转到指定楼层
上一主题 下一主题
收起左侧

[职场感言] 这次 gpt 的 hype 还不如alpha go

   
地里匿名用户
🔗
匿名用户-7V3QZ  | 添加认证 | 2023-3-25 12:52:01
小亩_bcd19b6 发表于 2023-3-25 00:20. ----
“predict the next token 也可以让模型对信息进行压缩”???
信息读取是encoding process,你说的对所 ...
.google  и
??????这不是技术上的,我只是引用openai人说的话,至于到底是不是压缩,其实我也不知道,但是的确可以这样想。这是对问题的一个frame。
如果你只从技术上看,难以解释llm为什么这么有效,这是ilya给的解释。你要问我怎么从predict next token 到信息压缩这一步,逻辑是,为了predict the next token,那么模型要对信息进行一定的压缩。但你要说seqtoseq prediction,或者transformer结构怎么直接实现这一点,我不知道。
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-24 21:52:01.google  и
??????这不是技术上的,我只是引用openai人说的话,至于到底是不是压缩,其实我也不知道,但是的确可以这样想。这是对问题的一个frame。
如果你只从技术上看,难以解释llm为什么这么有效,这
不懂就别言之凿凿的谈具体技术了…..什么predict next token技术简单alpha go技术难…..服了
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-7V3QZ  | 添加认证 | 2023-3-25 13:15:40
小亩_bcd19b6 发表于 2023-3-25 01:09
不懂就别言之凿凿的谈具体技术了…..什么predict next token技术简单alpha go技术难…..服了

。。。。因为predict the next token是很早之前的想法,我们之前没有想到它为什么这么有用,至少我自己是觉得,要把围棋问题进行建模这一步是比predict the next token难的。但这两者的工程实现是另一个问题,要把predict the next token达到最佳的效果,在工程架构上需要更多的创新,比如transformer,更早的rnn还有lstm都不够好,你非要扯工程当我错了。
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-24 22:15:40
. ----。。。。因为predict the next token是很早之前的想法,我们之前没有想到它为什么这么有用,至少我自己是觉得,要把围棋问题进行建模这一步是比predict the next token
你第一步说LLM是为了predict the next token 就说错了。所以真的最怕不懂装懂的…….
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-7V3QZ  | 添加认证 | 2023-3-25 13:34:47
本帖最后由 匿名 于 2023-3-25 01:37 编辑
小亩_bcd19b6 发表于 2023-3-25 01:26
. 1point 3 acres你第一步说LLM是为了predict the next token 就说错了。所以真的最怕不懂装懂的…….

求求你告诉我,怎么用不学术的办法说出来gpt的原理,什么是autoregressive model您有更简单的解释嘛。你要说bert不是这个原理,是是是,是我错了,我没有覆盖不同llm。如果你非要逼我一步步解释,那算了,不管怎么解释都有问题,您就当我是个彻头彻尾的外行,彻头彻尾的骗子,忽略这个帖子。
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-24 22:34:47-baidu 1point3acres
求求你告诉我,怎么用不学术的办法说出来gpt的原理,什么是autoregressive model您有更简单的解释嘛。你要说bert不是这个原理,是是是,是我错了,我没有覆盖不同llm。如果你非要逼我
知道为什么我说你是外行吗,因为你留言越多错误越多,槽多无口我也没那个时间给你科普。还有什么“是不是不靠统计而是简单的+/-”………Bert也好gpt也好,所有的transformer model本身里面的attention 就是统计。你不了解细节怎么来谈论原理? 不想再跟你浪费时间了,只不过看两个视频就来科普很容易误导别人。. 1point3acres.com

补充内容 (2023-03-26 01:15 +08:00):
再指出你一个明显的错误,bert 不是autoregressive model. bert 只帮你把一段文字数据理解成vectors,根本没有后半段的“predict the next token”, 因为Bert只是encoding model, chatgpt 才是encode + decode
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-24 21:11:23
看你怎么frame 这个问题,它就是predict the next token,您自己去看看ilya的一系列访谈,为了产品稳定性做的rlhf。模型基础是transformer-based。但是pre
作为一个对外行的科普视频还是可以的,你说出来的例子也是为了让外行容易懂的简化版。我不理解的是,看了一个科普视频就开始谈论行业前景还能逼逼出来一堆有的没的,我看sam altman 再飘也没楼主飘….楼主真科技大佬😓

评分

参与人数 1大米 +1 收起 理由
sge + 1 赞一个

查看全部评分

回复

使用道具 举报

地里匿名用户
🔗
匿名用户-9ZNVZ  | 添加认证 | 2023-3-26 02:31:41
小亩_bcd19b6 发表于 2023-3-25 10:10
知道为什么我说你是外行吗,因为你留言越多错误越多,槽多无口我也没那个时间给你科普。还有什么“是不是 ...

大家应该不会这么容易误导,会增加论坛噪声
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-25 11:31:41
大家应该不会这么容易误导,会增加论坛噪声
你说的对,只是楼主这种大篇漏洞百出的民科实在没忍住…
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表