本帖最后由 匿名 于 2023-2-13 03:09 编辑 -baidu 1point3acres
楼主把人类的智能想的太复杂了。人从读书到现在花了十几年,长期吸收信息,执行,反馈,然后学习。当然不能说和ai是一样的。对于一个完全没有受过教育的人而言,学习东西的能力其实也是很慢的,而且还有很多偏见。即使受过教育的人里,很多同学一开始学green's theorem还有divergence theorem的时候一样也没办法很快转过弯,需要靠老师反馈来掌握,ai这样被人训练也没什么吧。
老实说,有的phd读了好几年,他们想解决一道有点难的证明题目都要花不少时间想,甚至要和人讨论,实验几个想法,其实和计算机学习过程挺像的。
很多批评ai的言论其实就是把人类想的太特殊了。.google и
对现在大模型效果,其实还是值得怀疑的。但是模型量级起来,我们目前就没办法谈论本质。现在的很多工程方法都没有坚实理论依据,可我们还在用。我们可以分析一个简单的feedforward,但是一个超大的transformer模型,怎么分析,怎么谈论本质呢,这就是工程问题,一些业内人士可能因为是学术界出来的,整天就喜欢整些什么convergence,可是工程上有效的一些模型,就是分析不出来呢,但奈何不了别人有用。
. ----
补充内容 (2023-02-14 03:09 +8:00):
楼主 这是您回的话: “神经网络的学习方法没有推理功能,我之所以提反向传播update weight其实就是因为他的原理其实和大数据找最frequent的data一样的,本质上还是一个统计学方法,靠的是数据要大”
我针对您这句话来回。
首先 backpropagation 的原理是什么,是gradient descent。它是个用来优化 loss function的方法。是个优化方法。如果这个loss function是least square 或者negative log likelihood ,OK 你可以说它很统计很像,但统计是不是”本质”呢? 不是啊 。只是统计会用类似的solver。我们目前解偏微分方程,搞大型模拟仿真,依然还是用的least square来解。 那feedforward神经网络是什么, 是approximation function。feedforward神经网络是一个表达能力超强的函数,它很依赖它被训练的training data 所在的range,这是它难以泛化的原因,理论上的这些问题 ,当然是存在的。
但你说它有没有用,很有用,工程上可能真的能突破很多问题。为什么 ?因为least square 这个formula 很多从数学到物理仿真,都在用,而且神经网络表达能力很强,很多高维问题,feedword neural network它就能好结果。
. 1point3acres
还有楼主,线性代数是目前计算机里数值方法的核心,很多问题到头来还是靠least square formula解决,别瞧不起,计算机确实不如人类高级。但是现在神经网络它能探索问题的范围广了,学术界都没研究清楚呢,楼主还在这谈”本质”。 . 1point3acres
最后,理论和工程不一样,现在有大模型还有RL,我也觉得大模型emergent ability 很虚,但是RL确实能“学到”东西。现在chatgpt 也是大模型加RL, 也许人家工程人员能应付这些问题就像lecun说的 engineer the hell out of it. 1point3acres
补充内容 (2023-02-14 07:54 +8:00):
贴回复:
谢谢楼主回复,您说的对的。目前dL就是用composition和概率提高了找到答案的效率。但没有rule based method 想让DL算法实现准确 就很难。目前我们工作也是利用dl增大search space。reinforcement learning可以说 它是一种高效穷举的办法,比如谷歌的alpha tensor,当然它太浪费了。当然 理论上可以边用RL扩大范围 再用别的模型学习,当然样很浪费 emergent ability又很奇怪。
不过我觉得工程上面仍然很有潜力 就像楼里有人说的结合传统计算机方法和DL。尤其是假如emergent ability是真的话,那么大模型真能造出点东西,搞高精度计算不行,干些容错率低的也许不错。当然这怎么实现 就是另一个话题了。
. From 1point 3acres bbs
楼主对dl原理的批评有道理,最典型的是底下有人举的sin(x),dl 模型预测回归很难超过training data range 太远,从数值上计算机本来就很难处理无穷大和无穷小问题。当然我个人对dl工程上效果相对乐观。受教了
..
补充内容 (2023-02-14 13:40 +8:00):
dl还有一个用处就是,它在高维是个很有效的approximation function, 之前的数值方法, 效果不行。现在有了dl和gpu,我们就能在高维有一个表达能力较强的Approximation function,这极大的扩展了人类所能探索的范围。之前搞research的,两维问题都要搞半天。
当然我说的主要针对科研和理论上的效果,楼主觉得这它不算智能,比如这玩意学不会说谎,准确性不如人类。但只把它当一个拟合预测生成工具,只要这玩意能比人快比人便宜,那它就有用,毕竟大部分人在一些低智能task上表现不怎么样。谢谢楼主还有各位的讨论哈。 |