楼主: 匿名
跳转到指定楼层
上一主题 下一主题
收起左侧

[求比较] 怎么看百度的文心一言疑似有套壳

   
地里匿名用户
🔗
匿名用户-PJBRC  | 添加认证 | 2023-3-26 17:03:26 来自APP
匿名用户 发表于 2023-03-26 00:13:55
市面上的diffusion model都没啥自己的东西,都是开源论文+开源data的engineering implementation。中文数据集差太远了。
为什么没人好好做个中文数据集,百度缺数据吗
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-RKOB0  | 添加认证 | 2023-3-26 17:12:20
匿名用户 发表于 2023-3-26 02:03
为什么没人好好做个中文数据集,百度缺数据吗

造数据集还真涉及到很多很多问题。以及中文数据集很可能就算是按流程从头自己造一个也不如英文效果好,中文互联网环境都比英文差多了。

补充内容 (2023-03-26 17:14 +8:00):
看他们自己paper里的信息,百度现在应该是自己造一部分加上翻译LAION(翻译质量不太行),但自己造的这部分也不够。
回复

使用道具 举报

🔗
hypnoz 2023-3-26 18:24:08 | 只看该作者
全局:
据我所知 没啥中文的数据集
Laion那个也不是标的 是天然的alt-text 中国人做网页时候也没这个标准
自己标的话成本太高了 Laion-5B 自己找图片写caption的话 感觉千万上亿的花费.... 希望思聪哪天支持一下
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-26 00:09:19.google  и
虽然但是,高质量中文-图片库还得清洗干净,各种测试迭代。。。本来中文语料库质量就比英文低很多了,英文还有大量的non-profit和研究机构无偿开源大量数据集,没得比好吧。。。
真想做这能算理由吗……单纯就是百度菜,这么大的语料资源,nlp也这么长时间了,差不多的语料库还是没有。之前也是,贴吧那么大流量入口,结果移动端互联网一言难尽
回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-25 22:53:26
不太了解没有发言权,不过我觉得百度应该没这么蠢去套壳吧?。。。有没有可能是因为中文的训练数据太少了。
百度啥事干不出来?前两年还用活人后台回答问题冒充人工智能。别说还真是“人”工智能
回复

使用道具 举报

全局:
nevarofred 发表于 2023-3-26 21:20
百度啥事干不出来?前两年还用活人后台回答问题冒充人工智能。别说还真是“人”工智能

你不是码农吧...当真是丢人现眼,活人冒充人工智能都说得出口。

评分

参与人数 1大米 +1 收起 理由
hathbutterfly + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
匿名用户 发表于 2023-03-25 23:50:42. 1point3acres.com
为啥中国人做的不用中文数据呢?
网易lofter做了中文头像生成器,不过被老夫特用户喷侵权了。百度虽然看上去大,但好像并没有什么拿得出手的绘画库,百度图片都是其他网站的图。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-GQBGX  | 添加认证 | 2023-3-27 01:11:39
相当于chatgpt2.0的水平
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-ZFO0Z  | 添加认证 | 2023-3-27 01:34:08
石锤了
. check 1point3acres for more.
再弱智的神经网络,绝对不可能把鼠标翻译成老鼠,也绝对不可能把起重机翻译成鹤
哪怕是5年前的App都绝对不可能犯这么低级的错误

. ----等着股价暴跌吧,呵呵,也不知道百度这10年来all in AI all in 出来了一个什么玩意
太tm丢人。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表