中级农民
- 积分
- 103
- 大米
- 颗
- 鳄梨
- 个
- 水井
- 尺
- 蓝莓
- 颗
- 萝卜
- 根
- 小米
- 粒
- 学分
- 个
- 注册时间
- 2016-10-25
- 最后登录
- 1970-1-1
|
算是做大型语言模型相关工作的.
这个说法其实会让人想起 "李约瑟问题",
即 "为什么古代发达的中国没有产生现代科学".
但其实可能的答案是:
不止中国没有产生现代科学, 古埃及, 古印度, 古巴比伦, 以至于世界上绝大部分地方都没有产生.
有些伟大的火花, 回头看觉得理所当然, 大势所趋.
但真正出现之前, 可能就是一时一地各种特殊情况的神奇链式反应.
就像现在大型语言模型一样,
不止中国没搞出ChatGPT, 甚至其他科技巨头现在也不是很能打... (当然很期待Llama们)
而所谓 "中文语料的缺失", 确实是个问题, 但不完全是最大的问题. (虽然我也对各种中文论坛的被打压和被审查非常不爽.)
其实视频里也多少提到, 与其说中文语料少, 不如说 "中文语系的语料少"
因为大型语言模型属于各种语言都学的. 只要是语言相近的, 即便语料稀少, 仍能触类旁通, 达到SOTA.
比如使用人数和资料都很少的威尔士语, 也能傍着英语系的大腿表现很好.
另一方面, 也感慨数据确实是石油..
不仅是有价值, 也是需要沉淀和累积才能产生的... |
|