楼主: zhong950419
跳转到指定楼层
上一主题 下一主题
收起左侧

[自我提升] 聊聊大数据的前生今生

   
🔗
无量塔 2022-9-8 14:29:46 | 只看该作者
全局:
lz写得很好。好奇lz从写微服务转做数据的话是怎么准备的,有推荐的学习资料或者路线吗?还是说通过转为数据方面的工作从实践积累经验?
回复

使用道具 举报

🔗
奢入俭 2022-9-8 19:26:41 | 只看该作者
全局:
写得太好了,了解了大数据历史之后非常有收获!感谢楼主
回复

使用道具 举报

全局:
daydreamerlee 发表于 2022-8-16 02:43
感谢!
第二个问题其实是想问
-  支撑 ML training 的海量数据,现在都在用什么类型的数据库 (或 ware ...

做ML的来凑个热闹。这个问题要看真正喂给模型的数据有没有确定:

1.比如推荐系统,每时每刻都在产生很多新的日志,这些原始日志一定要经过一些ETL才能真正喂给模型。这种原始日志就存在HDFS,按天和小时分个区就差不多了,可优化的空间不大

2.如果ETL工作(采样,特征工程等等)已经做完了,这时候需要反复训练模型调参(所以需要反复load数据集),提高效率的方式可能是将数据集序列化(比如TFRecord)

ML和数据库在使用数据的场景上还是有很大区别的,数据库需要支持各种花式过滤&聚合&计算的操作,ML通常只要简单的过滤条件一顿猛读就好了
回复

使用道具 举报

🔗
zzz6222 2022-9-9 22:28:59 | 只看该作者
全局:
微信用户_50ca7b9 发表于 2022-9-9 02:25
做ML的来凑个热闹。这个问题要看真正喂给模型的数据有没有确定:

1.比如推荐系统,每时每刻都在产生很 ...

ML的feature engineering需不需要各种花式过滤&聚合&计算?
回复

使用道具 举报

🔗
einvince 2022-9-10 00:33:20 | 只看该作者
全局:
写的不错
回复

使用道具 举报

全局:
zzz6222 发表于 2022-9-9 22:28
ML的feature engineering需不需要各种花式过滤&聚合&计算?

特征必然是需要的,不过这个过程我把当作training前单独的一步了,大数据要解决的问题完美匹配这个场景。我就挑了点不一样的说下。。
回复

使用道具 举报

全局:
支持楼主 才95年?
回复

使用道具 举报

全局:
这是吃了多少本书才能做到的理解程度。只能看懂皮毛的瑟瑟发抖……
回复

使用道具 举报

全局:
大佬最后说的就是Apache Ignite 吗?
回复

使用道具 举报

🔗
thzwf12 2022-11-10 02:53:14 | 只看该作者
全局:
Kayle_Yang 发表于 2022-10-14 14:31
这是吃了多少本书才能做到的理解程度。只能看懂皮毛的瑟瑟发抖……

我在划水的时候楼主在旁边读书,亲眼看他真的读了很多书,很佩服他
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表